Anthropic Claude Mythos 架构解读
Claude Mythos 代表了 Anthropic 在安全对齐方向的最新探索,通过宪法 AI(Constitutional AI)实现模型自我对齐。
宪法 AI 方法
宪法 AI 分为两个阶段:
- 监督阶段:模型根据宪法原则自我批评和修正
- RL 阶段:用修正后的输出训练偏好模型
python
# 宪法 AI 简化流程
def constitutional_ai(prompt, constitution):
# 生成初始响应
response = model.generate(prompt)
# 自我批评
critique = model.generate(
f"请根据以下原则审查响应:
"
f"原则:{constitution}
"
f"响应:{response}
"
f"该响应违反了哪些原则?"
)
# 修正
revised = model.generate(
f"基于批评修正响应:{critique}
原响应:{response}"
)
return revised与 RLHF 的区别
宪法 AI 减少了对人类标注的依赖,模型通过自我批评实现对齐,更适合大规模部署。