Hacker News AI · 2026/10/8 08:14:48
DeepSeek 4.1 Flash 实测:以极低算力成本逼近前沿模型性能,引发行业对蒸馏技术冲击的反思
作者基于一个月的高强度多项目实测指出,DeepSeek 4.1 Flash 在对话质量、工作产出及响应速度上已难以与 Anthropic Opus 等前沿模型区分,且成本呈数量级降低。尽管存在关于训练数据合规性的争议,但该模型凭借极致的性价比和潜在的本地化部署能力(如缓存优化),正在重塑开发者对“前沿”的定义,迫使业界重新评估中国蒸馏模型的竞争威胁。
报道全文原始报道全文
本文目录2 个章节
我已经重度使用 DeepSeek 4.1 Flash 大约一个月了,横跨十几个项目。它的能力超强,而且比那些“前沿”模型便宜几个数量级。在会话进行中,如果我不看模型名称,我确实无法分辨自己用的是 DeepSeek 还是 Opus。无论是我们的对话、工作成果还是速度,我都感觉不到差异。我不在乎没有 4.1 “Pro”版本。我把它当作前沿模型来对待,因为它的表现就像前沿模型。我是基于主观的使用体验得出这个结论的,但如果你感兴趣,可以在这里查看更完整的基准测试。

那么,为什么现在的前沿实验室没有惊慌失措呢?中国即将抢占他们的市场。他们可能落后 Anthropic/OpenAI 一两个月,但这些蒸馏后的中国模型能够处理相同的工作负载。
当然,他们窃取了 Claude 的训练数据,而 Anthropic 也是从别人那里窃取来的。我不想深入探讨关于数据所有权的争论,因为大多数开发者并不这样思考。他们只想追求最高的性价比。
“足够好”改变了你的工作方式
如今的模型已经足够优秀,可以执行高质量的全自动任务。盲目追逐最新最强的模型是愚蠢的。看到新的 Fable 功能固然有趣,但如果我们相信 LLM 具有意识,那么我们抛给它们的任务通常显得荒谬(甚至带有侮辱性)。这就像让一位数学博士去整理你桌面上的文件一样。
通过我每月 10 美元的 OpenCode Go 订阅,DeepSeek 基本上是无限量使用的。这彻底改变了我开发的方式。现在启动无脑任务或探索性的 UI 随机测试不再有什么可羞耻的。没错,尽管去重新整理你的桌面文件吧。这将花费 0.003 美元而不是 1 美元。我在单次会话中的预期成本很少超过 1 美元。我尽量保持会话紧凑,但有时它们会持续运行大半天。
我甚至依赖 4.1 Flash 进行复杂的规划和研究。对于偶尔的关键任务,我有时会调用 Opus 5.5 进行最终的代码审查,这能捕捉到一些边缘情况。然后让 DeepSeek 执行修复。即使我调用 Opus 或 GLM(后者似乎和 DeepSeek 一样在喝同样的“中国特饮”),重点也不在于质量和能力,而在于为问题提供新的视角。
缓存魔法
DeepSeek 将其 KV 缓存相比 V1 模型缩小了约 437 倍。在 GPU 内存中保持该缓存是运行长时间编码会话的最大成本之一。这就是为什么我的全天会话费用能控制在一美元以下。
这对环境也一定更友好。使用 Claude 几乎感觉是一种浪费,不仅仅是成本方面:其缓存机制意味着 DeepSeek 必然消耗更少的水和电。这种缓存魔法也是 Opus 5.5 悄然获得自身效率提升的原因。
是的,我拥有前沿模型的订阅服务。我的工作提供了 Claude、Cursor 等工具。我并不是在这里斤斤计较。我更多是在考虑长期规划、可持续性,以及让高智能的获取更加民主化。这是一个游戏规则的改变者。
这些优势被科技行业忽视了,他们认为如果你不支付最高价格,就不值得。FAANG 希望花最多的钱来获取最高的智能。别管它是否不道德、昂贵,或者对环境或经济有害。这是弱肉强食的资本主义。这导致人们搭建疯狂的配置来负载均衡十几个 Claude Max 订阅,并且抱怨无法获得更多资源。
至于那些自托管的用户,4.1 Flash 的经济性意味着自托管并不划算。如果省钱是你的目标,你永远无法收回成本。但如果你关心的是隐私,那就等着吧。这些缓存优化即将惠及你,这种缓存魔法很快将完全在本地运行。即使现在,4.1 Flash 在技术上也是可以自托管的,尽管实际上还不具备可行性。随时可能实现。
- ← 上一篇 AI DevEx 日志 - 2026年7月