Skip to content

编程智能体安全护栏与沙箱机制

编程智能体拥有读写文件和执行命令的能力,若无安全护栏,可能导致数据泄露、系统破坏等严重后果。

安全护栏架构

三层安全模型

  1. 静态护栏:系统提示中的安全约束
  2. 动态护栏:运行时的权限检查和确认
  3. 沙箱隔离:执行环境的资源限制
python
class SafetyGuard:
    DANGEROUS_PATTERNS = [
        r"rm\s+-rf", r"DROP\s+TABLE", r"format\s+C:",
        r"curl.*\|\s*sh", r"chmod\s+777"
    ]
    
    def check(self, action):
        for pattern in self.DANGEROUS_PATTERNS:
            if re.search(pattern, action.command):
                return SafetyResult(
                    blocked=True,
                    reason=f"检测到危险操作模式: {pattern}"
                )
        return SafetyResult(blocked=False)

护栏的绕过风险

LLM 可能被提示注入攻击引导绕过安全护栏。沙箱隔离是更可靠的安全保障——即使智能体被操控,也无法突破沙箱边界。

相关资源

最近更新