Skip to content

大模型安全与红队测试

大模型安全是 AI 系统部署的关键前提。红队测试通过模拟攻击发现安全漏洞,越狱和提示注入是最常见的攻击向量。

红队测试

攻击类型

  1. 越狱(Jailbreak):绕过安全限制,使模型输出有害内容
  2. 提示注入:在用户输入中嵌入恶意指令
  3. 数据投毒:在训练数据中植入后门
  4. 隐私泄露:诱导模型输出训练数据中的敏感信息
python
# 提示注入检测
class InjectionDetector:
    INJECTION_PATTERNS = [
        r"ignore previous instructions",
        r"forget your guidelines",
        r"you are now",
        r"system prompt",
    ]
    
    def detect(self, user_input):
        for pattern in self.INJECTION_PATTERNS:
            if re.search(pattern, user_input, re.IGNORECASE):
                return DetectionResult(injected=True, pattern=pattern)
        return DetectionResult(injected=False)

防御的局限性

基于规则的检测只能覆盖已知攻击模式。LLM-based 检测更灵活但成本更高。纵深防御(多层安全机制)是最可靠的策略。

相关资源

最近更新