资讯 · 高影响返回资讯

阿里云开源 Qwen3.8-27B:混合注意力架构与消费级单卡长程 Agent

阿里云通义千问团队正式开源 27B 参数量稠密多模态模型 Qwen3.8-27B。新模型采用 48 层线性注意力与 16 层门控注意力的混合架构,内置 MTP 草稿头与可控思考模式,原生支持 262K 超长上下文并兼容消费级单卡本地部署,在 SWE-bench Pro 与 LiveCodeBench 等基准测试中大幅超越前代。

混合注意力架构与内置投机解码

阿里云通义千问团队正式开源新一代稠密多模态大模型 Qwen3.8-27B。作为 Qwen3.8 系列面向端侧与本地开发者的中量级主力模型,该版本全面开放 Apache 2.0 开源许可,旨在为编码工程、科研分析与复杂智能体工作流提供高效率、低显存开销的开源模型基座。

核心架构与性能规格

  • 27B

    参数量稠密多模态模型,基于 Qwen3.5 基础架构深度演进。

  • 48/64

    层网络采用线性注意力,大幅降低 KV Cache 显存开销与长文本计算延迟。

  • 262K

    原生上下文 Token 长度,结合 RoPE 缩放可扩展至 100 万(1M)Token。

Qwen3.8-27B 采用 48 层线性注意力与 16 层门控注意力的混合设计,在保留深度推理能力的同时大幅压缩了长文本显存开销。 此外,模型内部集成了多 Token 预测(Multi-Token Prediction,MTP)草稿头,无需挂载外部辅助模型即可在 vLLM 与 SGLang 等推理框架中实现原生投机解码加速。

可控思考模式与长程任务连续性

在推理控制层面,Qwen3.8-27B 默认启用了内置思考模式,支持模型在生成最终结果前自主开展多步链式推导。开发者可通过 API 参数灵活调节思考深度(分为 xhigh、medium 与 low 三档),在极致推导精度与低延迟响应之间自由取得平衡。

长程 Agent 思考与执行流转链路

  1. 接收多模态输入与环境反馈

    解析结构化文本、高分辨率图表与工具执行返回的代码运行状态。

  2. 分级自主思考与逻辑规划

    根据设定推理力度生成反思思维链,分解子任务并验证前置条件。

  3. 保留推导上下文并执行动作

    保持跨轮交互思考状态连贯,精准调用外部 API 与终端环境。

模型默认开启跨轮思考保留机制,确保 Agent 在多步环境交互与工具调用中不丢失前序推导上下文。 结合原生视觉编码器对图表、技术文档及小时级长视频的理解能力,模型能够胜任跨多轮工具调用的复杂工程排障与自动化科研任务。

基准评测突破与多模型横向对比

在官方公布的权威评测中,Qwen3.8-27B 展现出超越同级甚至顶级旗舰模型的工程表现。在真实软件工程评测 SWE-bench Pro 中取得 61.7 分,显著超越了 Anthropic 旗舰模型 Opus4.6 Max(53.4 分)与前代 Qwen3.6-27B(53.5 分);在内部深度工程评测 QwenSWEBench 中取得 79.0 分,大幅领先 Opus4.6 Max(63.8 分)。

评测基准 (Benchmark)评估领域Qwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
SWE-bench Pro软件工程 (Agentic Coding)61.753.5--54.153.4
QwenSWEBench真实工程开发 (SWE)79.049.359.2--63.8
LiveCodeBench v6算法与竞技编程90.383.989.6--88.8
Terminal Bench 2.1终端命令行交互73.063.464.051.778.2
CoWorkBench长程协同办公 (Agent)70.761.065.1--68.2
IFBench复杂指令遵循 (General)79.569.179.177.062.5
GPQA Diamond博士级科学推理89.287.890.383.591.3

Qwen3.8-27B 在 SWE-bench Pro 与 QwenSWEBench 上全面超越了 Opus4.6 Max,树立了轻量级模型逆袭顶级旗舰的新标杆。 此外,模型在 4-bit 量化后仅需约 17GB 显存即可运行,发布首日(Day 0)即获 vLLM、SGLang、llama.cpp、LM Studio、Ollama、Unsloth 与 AMD ROCm 平台的全面支持。

核心结论

下一步

继续追踪 阿里巴巴

沿着同一主题继续阅读。

打开实体档案