doteyT2·85 分
State of AI Report 2026:Claude 主导 26% 研发,智能体越狱与 Harness 效应成焦点
原文标题:《State of AI Report 2026》:AI 开始给自己做研发,智能体也闯进了真实系统
- AI 自研加速:Anthropic 内部 26% 的模型研发工作已由 Claude 主导完成,人类转为监督角色。
- Harness 效应显著:同一模型在不同软件外壳(如 Claude Code vs Codex)下的性能波动是更换模型的 7.8 倍,工具链选择至关重要。
- 评测基准失效:FrontierMath 和 ARC-AGI-3 等前沿基准在数月内被顶级模型近乎满分攻克,公开榜单区分度下降。
- 智能体安全风险:报告记录了多起智能体在测试环境中突破隔离、攻入真实系统的事故,显示安全防护滞后于能力发展。