对标 GPT-5.6 Sol 实测横评:长程终端反超,成本逻辑分化
Anthropic 于 2026 年 9 月 1 日正式推出 Claude Fable 5.1,主攻长程自主软件工程、跨代码库全流程重构与复杂知识工作流。官方本次公布了与前代 Fable 5、旗舰 Opus 5 以及直接竞品 OpenAI GPT-5.6 Sol 的实测横向评测矩阵,清晰呈现出各主力模型在长程终端、桌面操作与计费结构上的直接取舍:
| 评测基准 / 关键维度 | Claude Fable 5.1 | GPT-5.6 Sol | Claude Fable 5 | 工程取舍解读 |
|---|---|---|---|---|
| BenchLM 综合指数 | 83.0 (#1) | 82.3 (#4) | 78.4 | Fable 5.1 登顶全球多维度智能综合榜首 |
| Terminal-Bench-Science 0.1 | 52.6% | 48.2% | 24.7% | 较前代翻倍,超 Sol 4.4 个百分点 |
| CursorBench 3.2.0 | 73.4% | 71.8% | 70.5% | IDE 真实多文件重构维持前沿最高分 |
| OSWorld 2.0 (Strict) | 41.7% | 43.5% | 36.1% | Sol 在跨桌面操作系统自动化上仍略占优势 |
| 基础费率(每百万 In/Out) | $10 / $50 | $5 / $30 | $10 / $50 | 单次直接调用 Sol 基础价格显著更低 |
| 缓存读取(Cache Read) | $0.25 / M | $1.25 / M | $1.00 / M | Fable 降价 75%,长程高频交互反超低价 |
评测数据展现出清晰的技术路线分歧:在长程终端科学推演与真实 IDE 多文件重构中,Fable 5.1 凭借 1M 上下文、12.8 万输出上限与自适应思考模式(Adaptive Thinking)在复杂代码排障中实现领先;而在泛化桌面环境操作(OSWorld)中,GPT-5.6 Sol 凭借其 Ultra 多 Agent 协同模式仍有微弱优势。两者最大的胜负手最终落在了长程调用的经济账本上。
算一算开发者的真实账本:缓存读取降价 75% 意味着什么?
从基础定价来看,GPT-5.6 Sol 的每百万输入 5 美元与输出 30 美元明显比 Fable 5.1(10/50 美元)亲民,单轮请求更便宜。然而在长程 Agent 场景下,超过 85% 的 Token 是多轮循环中重复读取的代码树与历史记录,计费重头从基础输入迅速转移到了缓存命中上。
Anthropic 将提示词缓存读取单价大砍 75% 至每百万 0.25 美元(仅为 GPT-5.6 Sol 对应 1.25 美元费率的五分之一)。这意味着当开发者在 Cursor 或自建 Agent 中跑完一套数十轮探索与编译排错的任务时,Fable 5.1 的实际综合调用账单被大幅稀释 25% 至 45%,打破了旗舰模型不可承受的长程推理门槛。
双生架构分流:公开版 Fable 与受限攻防版 Mythos
面对前沿模型在敏感网络攻防与生物领域的双刃剑效应,Anthropic 本次采用了独特的双生发布策略:公开发售的 Fable 5.1 配备工业级生产安全护栏,同时推出能力完全相同但安全策略更开放的受限攻防版本 Claude Mythos 5.1。该版本专为经资质审查的政府机构与安全研究伙伴提供,用于高危漏洞实战挖掘与防御验证。
在接入与落地侧,开发者即日起可通过 Claude API、Amazon Bedrock、Google Cloud 以及 Microsoft Foundry 调用 Fable 5.1,并在 Cursor 与 GitHub Copilot 中原生使用。针对企业合规顾虑,模型配套推出了前沿企业防护机制(EFS),原生支持零数据留存(Zero Data Retention),确保核心代码库与敏感资产在长程 Agent 推理中不被落盘存储或用于二次训练。