跳到主要内容
Today for AI
AI 情报与实践
首页
资讯
指南
探索
搜索
EN
探索索引
←
返回模型
GLM-5.3-FlashX
智谱推出的高速推理大语言模型,基于 320B 总参数与 18B 激活参数混合稀疏注意力架构,支持 1M 上下文窗口,推理速度最高达 200 tokens/s。
NEWS LOG
相关资讯
01
01
智谱发布 GLM-5.3-FlashX:推理速度升至 200 tokens/s,主攻高并发 Coding Agent
智谱于 2026 年 9 月 18 日正式上线 GLM-5.3-FlashX 模型 API。该版本基于 320B 总参数与 18B 激活参数的混合注意力架构,在保持 1M 上下文窗口的同时将推理速度提升至最高 200 tokens/s,定价为输入 2.0 元、输出 7.0 元每百万 Tokens。
2026/9/20