编程智能体安全护栏与沙箱机制
编程智能体拥有读写文件和执行命令的能力,若无安全护栏,可能导致数据泄露、系统破坏等严重后果。
三层安全模型
- 静态护栏:系统提示中的安全约束
- 动态护栏:运行时的权限检查和确认
- 沙箱隔离:执行环境的资源限制
python
class SafetyGuard:
DANGEROUS_PATTERNS = [
r"rm\s+-rf", r"DROP\s+TABLE", r"format\s+C:",
r"curl.*\|\s*sh", r"chmod\s+777"
]
def check(self, action):
for pattern in self.DANGEROUS_PATTERNS:
if re.search(pattern, action.command):
return SafetyResult(
blocked=True,
reason=f"检测到危险操作模式: {pattern}"
)
return SafetyResult(blocked=False)护栏的绕过风险
LLM 可能被提示注入攻击引导绕过安全护栏。沙箱隔离是更可靠的安全保障——即使智能体被操控,也无法突破沙箱边界。