探索索引返回模型

GLM-5.3-FlashX

智谱推出的高速推理大语言模型,基于 320B 总参数与 18B 激活参数混合稀疏注意力架构,支持 1M 上下文窗口,推理速度最高达 200 tokens/s。