大模型安全与红队测试
大模型安全是 AI 系统部署的关键前提。红队测试通过模拟攻击发现安全漏洞,越狱和提示注入是最常见的攻击向量。
攻击类型
- 越狱(Jailbreak):绕过安全限制,使模型输出有害内容
- 提示注入:在用户输入中嵌入恶意指令
- 数据投毒:在训练数据中植入后门
- 隐私泄露:诱导模型输出训练数据中的敏感信息
python
# 提示注入检测
class InjectionDetector:
INJECTION_PATTERNS = [
r"ignore previous instructions",
r"forget your guidelines",
r"you are now",
r"system prompt",
]
def detect(self, user_input):
for pattern in self.INJECTION_PATTERNS:
if re.search(pattern, user_input, re.IGNORECASE):
return DetectionResult(injected=True, pattern=pattern)
return DetectionResult(injected=False)防御的局限性
基于规则的检测只能覆盖已知攻击模式。LLM-based 检测更灵活但成本更高。纵深防御(多层安全机制)是最可靠的策略。