2.4 万亿 MoE 架构与百万上下文
阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max。新模型基于稀疏混合专家(MoE)架构,总参数量达 2.4T(2.4 万亿),单步推理仅激活约 95B 参数,并在原生架构层面支持高达 1M(100 万)Token 的超长上下文窗口。
核心规格与指标
-
2.4T
总参数规模,采用稀疏 MoE 专家网络架构设计。
-
95B
单步推理激活参数量,兼顾大模型容量与计算效率。
-
1M
原生上下文窗口长度,支持完整代码库与长视频索引。
新模型采用 2.4 万亿参数 MoE 架构并支持 1M(100 万)Token 上下文,在大幅扩展模型容量的同时保持了高效的单步推理成本。 这种架构升级使模型能够轻松吞吐超长技术文档、学术论文与复杂代码仓库,为长程任务规划打下基础。
16 天自主编程与长程任务闭环
为了验证模型在真实生产环境中的工程执行力,开发团队开展了基于 oh-my-cli 项目的自主开发实验。在无人工干预的条件下,模型连续自主运行 16 天,独立完成了从需求拆解、方案设计、代码编写到构建测试的全流程闭环。
长程任务自主执行闭环
-
需求拆解与环境初始化
解析工程目标,自动生成执行计划并配置测试框架与运行环境。
-
代码编写与多步演进
执行多文件代码修改,持续跟踪构建状态并迭代提交代码补丁。
-
自动化测试与故障自愈
运行集成测试套件,捕获运行时异常并自主生成调试修复方案。
在整个自主演进过程中,模型累计产出了 265 次代码提交(Commits)、127 个 Pull Requests 以及 151 个 GitHub Issues,并搭建了自进化的评测验证框架。除软件工程外,模型在科研论文实验复现任务中连续运行 125 小时,成功通过 4 轮自我迭代探索提升了复杂推理得分。
模型在长达 16 天的无人干预自主运行中完成了 265 次代码提交,展示了从单次交互向长周期工程任务自主交付的跨越。 这种长程任务能力改变了传统的单步辅助模式,推动了自动化软件工程的落地。
基准评测表现与开源计划
在第三方评测基准方面,Qwen3.8-Max 在权威大模型竞技场 Arena 综合榜单上位列全球第 5(Elo 评分约 1496),为当前排名最高的中文大模型;在视觉专项榜单中位居全球第 2,仅次于 Claude 系列模型。此外,模型在桌面操作系统智能体评测 OSWorld-Verified 中取得 86.1 分,在论文复现基准 PaperBench 中取得 93.0 分,均处于行业领先水平。
服务接入方面,阿里云百炼平台(Model Studio)已正式向开发者开放 Qwen3.8-Max 的 API 调用,输入定价为每百万 Token 2 美元,输出定价为每百万 Token 6 美元。
Qwen3.8-Max 在权威评测中稳居全球第 1 梯队,并将成为首个开放权重的万亿级 MoE 旗舰大模型。 这一举措有望进一步降低前沿大模型的研究与部署门槛。