今日头版2026/8/15
阿里云开源 Qwen3.8-27B:混合注意力架构与消费级单卡长程 Agent
阿里云通义千问团队正式开源 27B 参数量稠密多模态模型 Qwen3.8-27B。新模型采用 48 层线性注意力与 16 层门控注意力的混合架构,内置 MTP 草稿头与可控思考模式,原生支持 262K 超长上下文并兼容消费级单卡本地部署,在 SWE-bench Pro 与 LiveCodeBench 等基准测试中大幅超越前代。
- 012026/8/15探索术语混合注意力混合注意力(Hybrid Attention)是指在 Transformer 神经网络的不同层级混合使用多种注意力机制的架构设计。模型在大部分网络层使用显存与计算复杂度均为线性的线性注意力(Linear Attention),而在关键层保留全门控注意力(Full Gated Attention),从而在超长上下文下兼顾推理吞吐与复杂推导质量。
- 022026/8/15资讯模型智谱发布 GLM-5.3:强化后训练强化学习与网络安全能力,两周内开源权重智谱 AI 正式发布基于 743B 基础模型深度后训练的新一代旗舰模型 GLM-5.3。借助 IndexShare、SAO 强化学习算法与 Slime 异步训练框架,该模型在 CyberGym 漏洞挖掘(84.5%)、AutomationBench(48.2%)与 GDPval-AA v2(1769)多项榜单取得第一,并在 Terminal Bench 3.0 达到 28.3 分,官方计划于两周内开源模型权重。
- 032026/8/6指南中级Agent 调用工具还是写代码执行:Code-as-Action 简析Code-as-Action(代码即动作)将 Agent 的工具调用与决策链路统一建模为可执行 Python 代码。本文系统解析 CodeAct 核心机制、执行循环、上下文屏蔽、自愈调试与代码沙箱安全防御体系,结合 SWE-bench Verified 与 LiveCodeBench 等前沿模型选型,帮助开发者搭建高表达力、低 Token 消耗与强确定性的新一代 Agent 运行时。
- 042026/8/15探索模型Qwen3.8-27B阿里云通义千问团队开源的 27B 参数量稠密多模态大模型。模型基于 Qwen3.5 基础架构构建,采用 48 层线性注意力与 16 层门控注意力的混合注意力设计,内置投机解码 MTP 草稿头与思考模式,原生支持 262K 上下文(可扩展至 1M Token),专为单卡本地部署与长程 Agentic 任务深度优化。
- 052026/8/15资讯工具DeepSeek 开源模块化 Agent 框架 DeepSeek HarnessDeepSeek 正式开源模块化智能体框架 DeepSeek Harness(dsh)。该项目基于 Cordis 元框架构建,采用全插件化架构解耦模型接入、执行循环与工具系统,并提供终端与本地 Web 界面,旨在为开发者提供高可扩展且支持全量审计的开源 Agent 开发与装配环境。
- 062026/8/5指南进阶独立小分类器探索:Qwen LoRA 与 BGE 实测本文开篇区分性能问题与实际基模:实验对象是本机可训练的 Qwen3-0.6B 与 BGE-small-zh-v1.5。文章按轮次说明 V1 到 V4 的改动、效果、问题分析和下一轮依据,并汇总最终质量与性能;最终选型仍需独立盲测。
- 072026/8/15探索模型GLM-5.3智谱 AI 推出的 743B 参数旗舰大模型,基于后训练强化学习扩展与 IndexShare、SAO、Slime 训练栈构建,具备出色的终端长程任务执行、代码编写与网络安全漏洞挖掘能力,支持多档位推理强度控制。
- 082026/8/14资讯模型谷歌发布 Gemini 3.7 Flash:主打长程编程与 Agent 工作流,首发 API 降价 50%谷歌正式发布 Gemini 3.7 Flash,主打长程代码编写与 Agent 工作流执行。模型具备 100 万 Token 上下文窗口与分级思考能力,在 DeepSWE 与 FrontierCode 等工程基准测试中较 3.6 Flash 明显提升,并在 2026 年底前提供 50% 的 API 调用折扣。
- 092026/8/5指南中级如何构建向量存储向量存储是构建高维语义检索与非结构化数据基础设施的首要步骤。本文系统梳理从异构文档加载、语义化文本切分、Embedding 模型编码到向量数据库对比分析(含 Chroma、Pinecone、Milvus、FAISS、Annoy 与 sqlite-vector)的核心机制,帮助开发者搭建高可靠、低延迟的相似度检索基础设施。