从被动感知转向生产环境 Agent 交付
阿里巴巴通义千问团队于 2026 年 9 月 18 日推出新一代轻量级全模态模型 Qwen3.8-Omni-Flash 。
与以往侧重静态图像描述的多模态模型不同,新模型将工程核心转向了 生产环境中的 Agent 任务规划与交付 。
该模型支持文本、图像、音频与视频四类模态联合输入,原生具备 1M Token 上下文窗口 。它在长程任务规划、复杂工具调用以及工业级音视频剪辑、MV 制作与会议纪要等场景中均完成了流程验证。
在交互设计上,模型默认启用 深度思考模式(Thinking Mode) ,支持通过参数灵活调控推理深度。同步推出的 Realtime 实时版本还具备 空间音频感知能力 ,能够融合声源方位与画面信息定位物理环境目标。
综合评测基准与工业级视频任务跑分
在 29 项全模态综合基准评测中,Qwen3.8-Omni-Flash 相比前代 Qwen3.5-Omni-Plus 录得 平均超过 25% 的性能增幅 。
针对音视频 Agent 与长程多模态代码调度,官方发布了一系列基于真实工程管线的对比数据。
| 评测基准 | 评估领域 | Qwen3.8-Omni-Flash 得分 | 工程解读与提升幅度 |
|---|---|---|---|
| WildClawBench-MM | 音视频 Agent 综合任务 | 提升 36.5 分 | 音频与视频协同推理与工具调用能力大幅增强 |
| AgenticVBench | 100 项专业视频后期剪辑 | 提升 22.3 分 | 涵盖粗剪、拼接、调色与多轨字幕生成全链路 |
| OmniVideoBench | 视频理解与长程规划 | 提升 9.6 分 | 配合 Qwen Code 时准确率达 67.8% 且节约 45.7% Token |
| Video-MME-v2 | 动态长视频多模态推理 | 71.3 分(代码工作流) | 音视频推理水准整体逼近 Gemini 3.8 Flash |
在综合音视频表现上,Qwen3.8-Omni-Flash 的音视频综合推理能力已接近 Gemini 3.8 Flash 。而在多发言人声纹切分与长音频定位等细分维度上,官方测试指标已展现出反超态势。
成本降幅账本与生产调用边界
除能力提升外,本次发布最直接的工程变量体现在 全模态输入成本的断崖式下调 。
官方数据显示,新模型每小时音频输入成本降幅超 98%,音视频混合输入成本降幅超 93%。在阿里云百炼平台上,输入单价为 每 1M Token 0.8 元 ,输出单价为 每 1M Token 2.7 元 ,同时支持上下文缓存折扣。
这种计费层级的下降,让 企业持续处理海量音视频会议与长视频素材 具备了可观的投入产出比。一次长视频结构化解析,API 基础开销已被压缩至极低水平。
在系统架构选型上,开发者需要注意 该模型仅输出文本内容 ,并不直接生成合成音频。若业务链路需要实时语音反馈,网关层必须外接 TTS 服务,或改用具备端到端语音输出能力的特定全模态分支。
目前 Qwen3.8-Omni-Flash 已通过阿里云百炼提供 API 访问,并兼容 OpenAI 接口规范。与此前开源权重的 Qwen3.8-Flash-Next 不同,该模型目前 以云端托管 API 形式交付 ,官方尚未开放模型权重下载。