IT之家 · 智能时代T2·78 分
微软 GitHub Copilot 引入本地推理:MAI Code 1.1 Flash MoE 模型在 Surface Laptop Ultra 达 63 TPS
原文标题:GitHub Copilot 不再纯云端 AI 模型:Surface Laptop Ultra 本地推理吞吐量最高每秒 63 词元
- GitHub Copilot 将支持本地推理,提供自动编排或强制设备端两种模式。
- 推出专用本地模型 MAI Code 1.1 Flash,采用 MoE 架构(137B 总参/6B 激活)及量化推测解码技术。
- 在 Surface Laptop Ultra 硬件上,该模型实现 40-63 TPS 的解码吞吐量,显著优化内存占用。