资讯 · 高影响返回资讯

阿里巴巴发布 Qwen3.8-Max 旗舰大模型

阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max。新模型采用 2.4 万亿参数的稀疏混合专家(MoE)架构,单次激活 950 亿参数,原生支持 100 万 Token 上下文与多模态输入。新模型重点强化了长程自主编程与复杂智能体任务执行能力,并在 Arena 综合评测与视觉榜单中位居前列。官方同时宣布将在次周正式开源模型权重。

2.4 万亿 MoE 架构与百万上下文

阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max。新模型基于稀疏混合专家(MoE)架构,总参数量达 2.4T(2.4 万亿),单步推理仅激活约 95B 参数,并在原生架构层面支持高达 1M(100 万)Token 的超长上下文窗口。

核心规格与指标

  • 2.4T

    总参数规模,采用稀疏 MoE 专家网络架构设计。

  • 95B

    单步推理激活参数量,兼顾大模型容量与计算效率。

  • 1M

    原生上下文窗口长度,支持完整代码库与长视频索引。

新模型采用 2.4 万亿参数 MoE 架构并支持 1M(100 万)Token 上下文,在大幅扩展模型容量的同时保持了高效的单步推理成本。 这种架构升级使模型能够轻松吞吐超长技术文档、学术论文与复杂代码仓库,为长程任务规划打下基础。

16 天自主编程与长程任务闭环

为了验证模型在真实生产环境中的工程执行力,开发团队开展了基于 oh-my-cli 项目的自主开发实验。在无人工干预的条件下,模型连续自主运行 16 天,独立完成了从需求拆解、方案设计、代码编写到构建测试的全流程闭环。

长程任务自主执行闭环

  1. 需求拆解与环境初始化

    解析工程目标,自动生成执行计划并配置测试框架与运行环境。

  2. 代码编写与多步演进

    执行多文件代码修改,持续跟踪构建状态并迭代提交代码补丁。

  3. 自动化测试与故障自愈

    运行集成测试套件,捕获运行时异常并自主生成调试修复方案。

在整个自主演进过程中,模型累计产出了 265 次代码提交(Commits)、127 个 Pull Requests 以及 151 个 GitHub Issues,并搭建了自进化的评测验证框架。除软件工程外,模型在科研论文实验复现任务中连续运行 125 小时,成功通过 4 轮自我迭代探索提升了复杂推理得分。

模型在长达 16 天的无人干预自主运行中完成了 265 次代码提交,展示了从单次交互向长周期工程任务自主交付的跨越。 这种长程任务能力改变了传统的单步辅助模式,推动了自动化软件工程的落地。

基准评测表现与开源计划

在第三方评测基准方面,Qwen3.8-Max 在权威大模型竞技场 Arena 综合榜单上位列全球第 5(Elo 评分约 1496),为当前排名最高的中文大模型;在视觉专项榜单中位居全球第 2,仅次于 Claude 系列模型。此外,模型在桌面操作系统智能体评测 OSWorld-Verified 中取得 86.1 分,在论文复现基准 PaperBench 中取得 93.0 分,均处于行业领先水平。

服务接入方面,阿里云百炼平台(Model Studio)已正式向开发者开放 Qwen3.8-Max 的 API 调用,输入定价为每百万 Token 2 美元,输出定价为每百万 Token 6 美元。

Qwen3.8-Max 在权威评测中稳居全球第 1 梯队,并将成为首个开放权重的万亿级 MoE 旗舰大模型。 这一举措有望进一步降低前沿大模型的研究与部署门槛。

核心结论

下一步

继续追踪 Qwen3.8-Max

沿着同一主题继续阅读。

打开实体档案