资讯 · 高影响返回资讯

Anthropic 发布 Claude Fable 5.1:对标 GPT-5.6 Sol 登顶长程榜,缓存读取直降 75%

Anthropic 于 2026 年 9 月 1 日推出主力旗舰 Claude Fable 5.1 及受限攻防孪生版 Mythos 5.1。在与前代 Fable 5 及 OpenAI 旗舰 GPT-5.6 Sol 的全面对标中,Fable 5.1 以 83.0 的 BenchLM 得分登顶榜首,并在长程科学终端评测中翻倍;同时将提示词缓存读取费率削减 75% 至每百万 0.25 美元,长程高频 Agent 的实际开销降低多达 45%。

对标 GPT-5.6 Sol 实测横评:长程终端反超,成本逻辑分化

Anthropic 于 2026 年 9 月 1 日正式推出 Claude Fable 5.1,主攻长程自主软件工程、跨代码库全流程重构与复杂知识工作流。官方本次公布了与前代 Fable 5、旗舰 Opus 5 以及直接竞品 OpenAI GPT-5.6 Sol 的实测横向评测矩阵,清晰呈现出各主力模型在长程终端、桌面操作与计费结构上的直接取舍:

评测基准 / 关键维度Claude Fable 5.1GPT-5.6 SolClaude Fable 5工程取舍解读
BenchLM 综合指数83.0 (#1)82.3 (#4)78.4Fable 5.1 登顶全球多维度智能综合榜首
Terminal-Bench-Science 0.152.6%48.2%24.7%较前代翻倍,超 Sol 4.4 个百分点
CursorBench 3.2.073.4%71.8%70.5%IDE 真实多文件重构维持前沿最高分
OSWorld 2.0 (Strict)41.7%43.5%36.1%Sol 在跨桌面操作系统自动化上仍略占优势
基础费率(每百万 In/Out)$10 / $50$5 / $30$10 / $50单次直接调用 Sol 基础价格显著更低
缓存读取(Cache Read)$0.25 / M$1.25 / M$1.00 / MFable 降价 75%,长程高频交互反超低价

评测数据展现出清晰的技术路线分歧:在长程终端科学推演与真实 IDE 多文件重构中,Fable 5.1 凭借 1M 上下文、12.8 万输出上限与自适应思考模式(Adaptive Thinking)在复杂代码排障中实现领先;而在泛化桌面环境操作(OSWorld)中,GPT-5.6 Sol 凭借其 Ultra 多 Agent 协同模式仍有微弱优势。两者最大的胜负手最终落在了长程调用的经济账本上。

算一算开发者的真实账本:缓存读取降价 75% 意味着什么?

从基础定价来看,GPT-5.6 Sol 的每百万输入 5 美元与输出 30 美元明显比 Fable 5.1(10/50 美元)亲民,单轮请求更便宜。然而在长程 Agent 场景下,超过 85% 的 Token 是多轮循环中重复读取的代码树与历史记录,计费重头从基础输入迅速转移到了缓存命中上。

Anthropic 将提示词缓存读取单价大砍 75% 至每百万 0.25 美元(仅为 GPT-5.6 Sol 对应 1.25 美元费率的五分之一)。这意味着当开发者在 Cursor 或自建 Agent 中跑完一套数十轮探索与编译排错的任务时,Fable 5.1 的实际综合调用账单被大幅稀释 25% 至 45%,打破了旗舰模型不可承受的长程推理门槛。

双生架构分流:公开版 Fable 与受限攻防版 Mythos

面对前沿模型在敏感网络攻防与生物领域的双刃剑效应,Anthropic 本次采用了独特的双生发布策略:公开发售的 Fable 5.1 配备工业级生产安全护栏,同时推出能力完全相同但安全策略更开放的受限攻防版本 Claude Mythos 5.1。该版本专为经资质审查的政府机构与安全研究伙伴提供,用于高危漏洞实战挖掘与防御验证。

在接入与落地侧,开发者即日起可通过 Claude API、Amazon Bedrock、Google Cloud 以及 Microsoft Foundry 调用 Fable 5.1,并在 Cursor 与 GitHub Copilot 中原生使用。针对企业合规顾虑,模型配套推出了前沿企业防护机制(EFS),原生支持零数据留存(Zero Data Retention),确保核心代码库与敏感资产在长程 Agent 推理中不被落盘存储或用于二次训练。

下一步

继续追踪 Claude Fable 5.1

沿着同一主题继续阅读。

打开实体档案