Skip to content

Qwen3 技术报告解读

Qwen3 是阿里云推出的大语言模型系列,在多语言、推理和代码生成方面展现出强劲实力。

Qwen3 技术架构

训练策略

Qwen3 的训练分为四个阶段:

  1. 预训练:30T Token 多语言语料
  2. 长上下文扩展:从 4K 到 128K 的渐进扩展
  3. 后训练:SFT + RLHF + DPO
  4. 混合思维模式:支持开关思维链
python
# Qwen3 的思维模式切换
# 开启思维链
response = model.chat("请推理:...", thinking=True)

# 关闭思维链(快速响应)
response = model.chat("请回答:...", thinking=False)

混合思维模式

Qwen3 可以在单次对话中动态切换思维模式——简单问题快速响应,复杂问题启用深度推理,兼顾效率和准确性。

相关资源

最近更新