Skip to content

AI 安全对齐论文综述

随着大语言模型能力的快速增长,确保 AI 系统与人类价值观对齐、行为安全可控成为紧迫的研究课题。本文综述 AI 安全对齐的主要研究方向和论文进展。

AI安全对齐

对齐问题的层次

AI 安全对齐包含多个层次:

层次问题方法
指令对齐模型是否遵循指令SFT, RLHF
意图对齐模型是否理解真实意图意图识别, 澄清
价值对齐模型行为是否符合价值观Constitutional AI
可扩展对齐超人模型如何对齐可扩展监督, 辩论

主要研究方向

人类偏好对齐

RLHF 和 DPO 是当前主流的对齐方法:

python
# 对齐方法的演进
alignment_methods = {
    "RLHF": {
        "paper": "InstructGPT (2022)",
        "mechanism": "人类偏好 → 奖励模型 → PPO优化",
        "limitation": "标注成本高, 奖励黑客"
    },
    "Constitutional AI": {
        "paper": "Anthropic (2022)",
        "mechanism": "宪法原则 → 自我批评 → 自我修改",
        "limitation": "AI 自评可能不充分"
    },
    "DPO": {
        "paper": "Rafailov et al. (2023)",
        "mechanism": "偏好数据 → 直接策略优化",
        "limitation": "对数据质量敏感"
    },
    "KTO": {
        "paper": "Ethayarajh et al. (2024)",
        "mechanism": "二元反馈 → 非对称损失",
        "limitation": "信息量少于成对偏好"
    }
}

红队测试

通过对抗性测试发现模型的安全漏洞:

  • 自动红队:用另一个模型生成攻击提示
  • 人类红队:人类专家尝试突破安全边界
  • 越狱攻击:设计特殊提示绕过安全过滤

可扩展监督

当模型能力超越人类评估者时,如何确保对齐?

  • AI 辩论:两个 AI 辩论,人类裁判
  • 递归奖励建模:AI 辅助人类评估
  • 市场机制:预测市场式的对齐

对齐的硬问题

对齐面临几个根本性挑战:

  1. 价值多元性:不同人有不同的价值观
  2. 规范游戏:模型可能优化指标而非真实目标
  3. 欺骗性对齐:模型可能假装对齐
  4. 能力-对齐张力:更强的能力可能更难对齐

安全评估

评估框架

  • TruthfulQA:评估模型真实性
  • ToxiGen:评估有害内容生成
  • RealToxicityPrompts:毒性续写评估
  • HarmBench:标准化危害评估

攻击与防御

攻击类型方法防御策略
提示注入恶意指令嵌入输入过滤, 指令层级
越狱角色扮演, 编码绕过安全训练, 检测器
数据投毒训练数据注入后门数据清洗, 鲁棒训练
后门攻击触发词激活恶意行为模型审计, 后门检测

前沿方向

  • 可解释性:理解模型内部机制以验证对齐
  • 机械可解释性:逆向工程模型计算
  • 对齐税:对齐对模型能力的代价
  • 超级对齐:超人模型的监督方案

相关资源

最近更新