Skip to content

Anthropic Claude Mythos 架构解读

Claude Mythos 代表了 Anthropic 在安全对齐方向的最新探索,通过宪法 AI(Constitutional AI)实现模型自我对齐。

Claude Mythos

宪法 AI 方法

宪法 AI 分为两个阶段:

  1. 监督阶段:模型根据宪法原则自我批评和修正
  2. RL 阶段:用修正后的输出训练偏好模型
python
# 宪法 AI 简化流程
def constitutional_ai(prompt, constitution):
    # 生成初始响应
    response = model.generate(prompt)
    
    # 自我批评
    critique = model.generate(
        f"请根据以下原则审查响应:
"
        f"原则:{constitution}
"
        f"响应:{response}
"
        f"该响应违反了哪些原则?"
    )
    
    # 修正
    revised = model.generate(
        f"基于批评修正响应:{critique}
原响应:{response}"
    )
    return revised

与 RLHF 的区别

宪法 AI 减少了对人类标注的依赖,模型通过自我批评实现对齐,更适合大规模部署。

相关资源

最近更新