vLLM 官方博客T1·68 分
vLLM 优化 DeepSeek-V4.1-Flash:集成新内核与 CUDA 图实现智能体吞吐提升 5.3 倍
原文标题:DeepSeek-V4.1-Flash on vLLM: 5x Agentic Throughput Since Day 0
- DeepSeek-V4.1-Flash 在 vLLM 上实现 5.3 倍吞吐量提升,低并发下加速 1.9 倍。
- 集成 MegaAttention、Mega-Gate 等新内核及 SWA 有界重放技术,显著降低 TTFT。
- 利用因果编码器-解码器架构特性,结合 FP4 KV Cache 等技术大幅压缩显存占用。