混合注意力架构与内置投机解码
阿里云通义千问团队正式开源新一代稠密多模态大模型 Qwen3.8-27B。作为 Qwen3.8 系列面向端侧与本地开发者的中量级主力模型,该版本全面开放 Apache 2.0 开源许可,旨在为编码工程、科研分析与复杂智能体工作流提供高效率、低显存开销的开源模型基座。
核心架构与性能规格
-
27B
参数量稠密多模态模型,基于 Qwen3.5 基础架构深度演进。
-
48/64
层网络采用线性注意力,大幅降低 KV Cache 显存开销与长文本计算延迟。
-
262K
原生上下文 Token 长度,结合 RoPE 缩放可扩展至 100 万(1M)Token。
Qwen3.8-27B 采用 48 层线性注意力与 16 层门控注意力的混合设计,在保留深度推理能力的同时大幅压缩了长文本显存开销。 此外,模型内部集成了多 Token 预测(Multi-Token Prediction,MTP)草稿头,无需挂载外部辅助模型即可在 vLLM 与 SGLang 等推理框架中实现原生投机解码加速。
可控思考模式与长程任务连续性
在推理控制层面,Qwen3.8-27B 默认启用了内置思考模式,支持模型在生成最终结果前自主开展多步链式推导。开发者可通过 API 参数灵活调节思考深度(分为 xhigh、medium 与 low 三档),在极致推导精度与低延迟响应之间自由取得平衡。
长程 Agent 思考与执行流转链路
-
接收多模态输入与环境反馈
解析结构化文本、高分辨率图表与工具执行返回的代码运行状态。
-
分级自主思考与逻辑规划
根据设定推理力度生成反思思维链,分解子任务并验证前置条件。
-
保留推导上下文并执行动作
保持跨轮交互思考状态连贯,精准调用外部 API 与终端环境。
模型默认开启跨轮思考保留机制,确保 Agent 在多步环境交互与工具调用中不丢失前序推导上下文。 结合原生视觉编码器对图表、技术文档及小时级长视频的理解能力,模型能够胜任跨多轮工具调用的复杂工程排障与自动化科研任务。
基准评测突破与多模型横向对比
在官方公布的权威评测中,Qwen3.8-27B 展现出超越同级甚至顶级旗舰模型的工程表现。在真实软件工程评测 SWE-bench Pro 中取得 61.7 分,显著超越了 Anthropic 旗舰模型 Opus4.6 Max(53.4 分)与前代 Qwen3.6-27B(53.5 分);在内部深度工程评测 QwenSWEBench 中取得 79.0 分,大幅领先 Opus4.6 Max(63.8 分)。
| 评测基准 (Benchmark) | 评估领域 | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
|---|---|---|---|---|---|---|
| SWE-bench Pro | 软件工程 (Agentic Coding) | 61.7 | 53.5 | -- | 54.1 | 53.4 |
| QwenSWEBench | 真实工程开发 (SWE) | 79.0 | 49.3 | 59.2 | -- | 63.8 |
| LiveCodeBench v6 | 算法与竞技编程 | 90.3 | 83.9 | 89.6 | -- | 88.8 |
| Terminal Bench 2.1 | 终端命令行交互 | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| CoWorkBench | 长程协同办公 (Agent) | 70.7 | 61.0 | 65.1 | -- | 68.2 |
| IFBench | 复杂指令遵循 (General) | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
| GPQA Diamond | 博士级科学推理 | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 |
Qwen3.8-27B 在 SWE-bench Pro 与 QwenSWEBench 上全面超越了 Opus4.6 Max,树立了轻量级模型逆袭顶级旗舰的新标杆。 此外,模型在 4-bit 量化后仅需约 17GB 显存即可运行,发布首日(Day 0)即获 vLLM、SGLang、llama.cpp、LM Studio、Ollama、Unsloth 与 AMD ROCm 平台的全面支持。