阿里云的“魔搭 ModelScope 社区”于 8 月 12 日深夜发布消息,宣布阿里 Qwen 团队已正式公开 Qwen3.8-2.4T-A95B 模型的权重。
这是 Qwen-Max 系列模型首次进行权重开源,该模型拥有 2.4T 的总参数量,每个 Token 会激活 95B 参数。它原生支持 262,144 Token 的上下文长度,并且能够扩展至 1,010,000 Token。
Qwen3.8 继承了 Qwen3.5 的混合架构,重点在于提升模型在编程、办公、科研以及长周期 Agent 任务方面的端到端处理能力。官方发布的 Qwen3.8-Max 云端版本,在开源权重模型的基础上,进一步集成了更多生产环境下的功能。
根据官方披露的评测结果,该模型在编程 Agent、通用 Agent、专业工作和长上下文处理等方面的表现,与 Opus 4.8、Fable 5、GPT 5.6 Sol 等模型相比,各有千秋。在 PaperBench 和 IFBench 等基准测试中,Qwen3.8-2.4T-A95B 取得了同类模型中的较好成绩。
Qwen3.8-2.4T-A95B 作为一个因果语言模型,总参数量为 2.4T,每个 Token 激活 95B。其 MoE(Mixture of Experts)层设计为每个层包含 512 个专家,每个 Token 会选择 10 个路由专家,并同时激活 1 个共享专家。
此外,该模型还经过了多步 MTP(Multi-Token Prediction)训练,使其在支持相关推理引擎时,能够预测多个后续 Token。
根据介绍,Qwen3.8-Max 在办公与 Agent 后训练方面,主要经历了三个阶段:
- 持续扩展真实环境,并在任务(从单任务到多任务再到跨天任务)、工作空间(从多文件到层级目录再到复杂异构目录)以及 Harness(不同的类别、版本、技能)等独立维度上进行解耦。此举使得环境数量能够以组合方式自然增长,而非依赖于逐一的定制化集成。
- 构建一个统一的奖励系统,将真实任务中不同的验证方式整合。该系统涵盖了基于执行的校验、对文本及渲染后视觉输出的 rubric 评估,以及 agentic 检查。通过将多种形式与模态统一在一个奖励系统内,为所有环境提供了一致且可靠的奖励信号,避免了维护任务专用 verifier 所带来的不一致性。
- 构建一个在线数据均衡器,对每个 batch 进行重构,确保其在任务、难度、工作区和 harness 上的分布高度均衡。这有助于降低 batch 间的梯度方差,从而支持强化学习训练算力稳定、持续的扩展。