探索索引返回术语

上下文缓存

上下文缓存(Context Caching)是指服务端将长提示词(System Prompt、代码库或长文档)计算得到的 KV Cache 在显存或内存中持久化保存的技术。当后续请求复用相同前缀上下文时,无需重新计算注意力矩阵,从而大幅降低首 Token 延迟(TTFT)与计算成本。

暂时没有与该实体关联的公开内容。