资讯 · 中影响返回资讯

智谱发布 GLM-5.3-FlashX:推理速度升至 200 tokens/s,主攻高并发 Coding Agent

智谱于 2026 年 9 月 18 日正式上线 GLM-5.3-FlashX 模型 API。该版本基于 320B 总参数与 18B 激活参数的混合注意力架构,在保持 1M 上下文窗口的同时将推理速度提升至最高 200 tokens/s,定价为输入 2.0 元、输出 7.0 元每百万 Tokens。

高速推理架构与版本迭代背景

智谱在 2026 年 9 月 18 日正式推出 GLM-5.3-FlashX 高性能推理模型。此前,基础版 GLM-5.3-Flash 曾以匿名代号 Ox (Ox Alpha)在 OpenCode 和 OpenRouter 社区开放盲测并凭借扎实的代码能力广受好评;而本次上线的 GLM-5.3-FlashX 则是在该底座上进一步针对极致吞吐与低延迟场景打造的高速迭代版本。

GLM-5.3-FlashX 沿用了 GLM-5.3 系列的核心架构设计,模型总参数量为 320B ,单次激活参数量为 18B 。模型底层结合了 稀疏注意力(Sparse Attention)与线性注意力(Linear Attention) 的混合机制,并在国产 10000 卡(万卡级)异构算力集群上完成了底层算子与通信调度优化,支持高达 1M Tokens 的长上下文输入处理。

核心规格、定价与基准吞吐对比

与基础版 GLM-5.3-Flash 相比, GLM-5.3-FlashX 实现了最高 200 tokens/s 的首字与生成吞吐,推理效率相比原版提升了约 5 倍。智谱开放平台同步上线了该模型的 Chat Completion 接口,模型代码为 glm-5.3-flashx

在计费策略上,智谱采取提价换性能方案,调用单价设定为基础版 Flash 的 2.5 倍。开发者在调试与部署时可参考下述规格与单价对比:

模型版本峰值推理速度激活参数 / 总参数上下文窗口输入单价(元 / 百万 Tokens)输出单价(元 / 百万 Tokens)
GLM-5.3-Flash40 tokens/s18B / 320B1M0.82.8
GLM-5.3-FlashX200 tokens/s18B / 320B1M2.07.0

此外,智谱官方确认该模型的上下文缓存存储(Prompt Caching)目前处于限时免费阶段,有助于进一步降低多轮长对话与长文档检索的综合调用开销。

高并发 Agent 场景的工程选型与落地考量

GLM-5.3-FlashX 的加速设计主要瞄准了长链条智能体(Agent)工作流与复杂代码重构任务。在 多轮工具调用(Tool Calling) 、长文件沙箱交互以及大型测试用例自愈场景中, 200 tokens/s 的高吞吐能够将长等待延迟压缩至秒级,大幅降低智能体循环的端到端耗时。

对于工程团队而言,选型取舍主要集中在成本与时效之间。对于后台非实时批处理或离线总结,单价更低的基础版 GLM-5.3-Flash 依然具备极高性价比;而在面向 IDE 实时交互补全、复杂多智能体协作或高频交互式客服时, GLM-5.3-FlashX 则提供了显著改善的响应流畅度。

下一步

继续追踪 GLM-5.3-FlashX

沿着同一主题继续阅读。

打开实体档案