资讯 · 高影响返回资讯

Qwen3.8-Omni-Flash 发布:1M 上下文全模态主打 Agent 任务交付与低成本长音视频处理

通义千问团队发布轻量级全模态模型 Qwen3.8-Omni-Flash,支持百万级 Token 上下文与文本、图像、音频、视频输入。新模型将重心转向视频剪辑等长程 Agent 工具调用,音视频输入调用成本下降超 90%,并通过阿里云百炼开放 API 服务。

从被动感知转向生产环境 Agent 交付

阿里巴巴通义千问团队于 2026 年 9 月 18 日推出新一代轻量级全模态模型 Qwen3.8-Omni-Flash

与以往侧重静态图像描述的多模态模型不同,新模型将工程核心转向了 生产环境中的 Agent 任务规划与交付

该模型支持文本、图像、音频与视频四类模态联合输入,原生具备 1M Token 上下文窗口 。它在长程任务规划、复杂工具调用以及工业级音视频剪辑、MV 制作与会议纪要等场景中均完成了流程验证。

在交互设计上,模型默认启用 深度思考模式(Thinking Mode) ,支持通过参数灵活调控推理深度。同步推出的 Realtime 实时版本还具备 空间音频感知能力 ,能够融合声源方位与画面信息定位物理环境目标。

综合评测基准与工业级视频任务跑分

在 29 项全模态综合基准评测中,Qwen3.8-Omni-Flash 相比前代 Qwen3.5-Omni-Plus 录得 平均超过 25% 的性能增幅

针对音视频 Agent 与长程多模态代码调度,官方发布了一系列基于真实工程管线的对比数据。

评测基准评估领域Qwen3.8-Omni-Flash 得分工程解读与提升幅度
WildClawBench-MM音视频 Agent 综合任务提升 36.5 分音频与视频协同推理与工具调用能力大幅增强
AgenticVBench100 项专业视频后期剪辑提升 22.3 分涵盖粗剪、拼接、调色与多轨字幕生成全链路
OmniVideoBench视频理解与长程规划提升 9.6 分配合 Qwen Code 时准确率达 67.8% 且节约 45.7% Token
Video-MME-v2动态长视频多模态推理71.3 分(代码工作流)音视频推理水准整体逼近 Gemini 3.8 Flash

在综合音视频表现上,Qwen3.8-Omni-Flash 的音视频综合推理能力已接近 Gemini 3.8 Flash 。而在多发言人声纹切分与长音频定位等细分维度上,官方测试指标已展现出反超态势。

成本降幅账本与生产调用边界

除能力提升外,本次发布最直接的工程变量体现在 全模态输入成本的断崖式下调

官方数据显示,新模型每小时音频输入成本降幅超 98%,音视频混合输入成本降幅超 93%。在阿里云百炼平台上,输入单价为 每 1M Token 0.8 元 ,输出单价为 每 1M Token 2.7 元 ,同时支持上下文缓存折扣。

这种计费层级的下降,让 企业持续处理海量音视频会议与长视频素材 具备了可观的投入产出比。一次长视频结构化解析,API 基础开销已被压缩至极低水平。

在系统架构选型上,开发者需要注意 该模型仅输出文本内容 ,并不直接生成合成音频。若业务链路需要实时语音反馈,网关层必须外接 TTS 服务,或改用具备端到端语音输出能力的特定全模态分支。

目前 Qwen3.8-Omni-Flash 已通过阿里云百炼提供 API 访问,并兼容 OpenAI 接口规范。与此前开源权重的 Qwen3.8-Flash-Next 不同,该模型目前 以云端托管 API 形式交付 ,官方尚未开放模型权重下载。

下一步

继续追踪 Qwen3.8-Omni-Flash

沿着同一主题继续阅读。

打开实体档案