AI 安全对齐论文综述
随着大语言模型能力的快速增长,确保 AI 系统与人类价值观对齐、行为安全可控成为紧迫的研究课题。本文综述 AI 安全对齐的主要研究方向和论文进展。
对齐问题的层次
AI 安全对齐包含多个层次:
| 层次 | 问题 | 方法 |
|---|---|---|
| 指令对齐 | 模型是否遵循指令 | SFT, RLHF |
| 意图对齐 | 模型是否理解真实意图 | 意图识别, 澄清 |
| 价值对齐 | 模型行为是否符合价值观 | Constitutional AI |
| 可扩展对齐 | 超人模型如何对齐 | 可扩展监督, 辩论 |
主要研究方向
人类偏好对齐
RLHF 和 DPO 是当前主流的对齐方法:
python
# 对齐方法的演进
alignment_methods = {
"RLHF": {
"paper": "InstructGPT (2022)",
"mechanism": "人类偏好 → 奖励模型 → PPO优化",
"limitation": "标注成本高, 奖励黑客"
},
"Constitutional AI": {
"paper": "Anthropic (2022)",
"mechanism": "宪法原则 → 自我批评 → 自我修改",
"limitation": "AI 自评可能不充分"
},
"DPO": {
"paper": "Rafailov et al. (2023)",
"mechanism": "偏好数据 → 直接策略优化",
"limitation": "对数据质量敏感"
},
"KTO": {
"paper": "Ethayarajh et al. (2024)",
"mechanism": "二元反馈 → 非对称损失",
"limitation": "信息量少于成对偏好"
}
}红队测试
通过对抗性测试发现模型的安全漏洞:
- 自动红队:用另一个模型生成攻击提示
- 人类红队:人类专家尝试突破安全边界
- 越狱攻击:设计特殊提示绕过安全过滤
可扩展监督
当模型能力超越人类评估者时,如何确保对齐?
- AI 辩论:两个 AI 辩论,人类裁判
- 递归奖励建模:AI 辅助人类评估
- 市场机制:预测市场式的对齐
对齐的硬问题
对齐面临几个根本性挑战:
- 价值多元性:不同人有不同的价值观
- 规范游戏:模型可能优化指标而非真实目标
- 欺骗性对齐:模型可能假装对齐
- 能力-对齐张力:更强的能力可能更难对齐
安全评估
评估框架
- TruthfulQA:评估模型真实性
- ToxiGen:评估有害内容生成
- RealToxicityPrompts:毒性续写评估
- HarmBench:标准化危害评估
攻击与防御
| 攻击类型 | 方法 | 防御策略 |
|---|---|---|
| 提示注入 | 恶意指令嵌入 | 输入过滤, 指令层级 |
| 越狱 | 角色扮演, 编码绕过 | 安全训练, 检测器 |
| 数据投毒 | 训练数据注入后门 | 数据清洗, 鲁棒训练 |
| 后门攻击 | 触发词激活恶意行为 | 模型审计, 后门检测 |
前沿方向
- 可解释性:理解模型内部机制以验证对齐
- 机械可解释性:逆向工程模型计算
- 对齐税:对齐对模型能力的代价
- 超级对齐:超人模型的监督方案