Today for AI
返回热点榜
llm热度 8.8°

AI 聚簇研判事件 · 2026/10/8

UniPat 发布 PaperBenchX:GPT-6 Astra 论文复现率仅 13.98%,揭示 AI 科研端到端验证短板

UniPat Releases PaperBenchX: GPT-6 Astra Achieves Only 13.98% Reproduction Rate, Highlighting End-to-End Scientific Validation Gap

1 篇报道存证1 家独立信源交叉印证持续跟踪至 2026/10/8 17:28:44
全景综述与最新动态
1 家信源交叉印证

UniPat AI 推出 PaperBenchX 基准测试,针对 93 个真实论文复现任务评估大模型能力。结果显示,即便表现最强的 GPT-6 Astra 完整复现率也仅为 13.98%,暴露出当前 AI 在解决千禧年数学难题等单点突破与可靠端到端科学复现之间的巨大鸿沟。该基准将科学结论编译为可执行、可重放、可验证的工作流,旨在建立衡量 AI for Science 进步的新标准。

最新动向/UniPat AI 推出 PaperBenchX 基准测试,针对 93 个真实论文复现任务评估大模型能力。结果显示,即便表现最强的 GPT-6 Astra 完整复现率也仅为 13.98%,暴露出当前 AI 在解决千禧年数学难题等单点突破与可靠端到端科学复现之间的巨大鸿沟。该基准将科学结论编译为可执行、可重放、可验证的工作流,旨在建立衡量 AI for Science 进步的新标准。

TIMELINE报道时间线

共 1 篇 · 最新优先
  1. 量子位官网T2·78 分

    UniPat 发布 PaperBenchX:GPT-6 Astra 论文复现率仅 13.98%,揭示 AI 科研端到端验证短板

    原文标题:ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?

    • GPT-6 Astra 在 PaperBenchX 的 93 个论文复现任务中,完整复现率仅为 13.98%。
    • AI 能攻克千禧年数学难题等单点高难度问题,但在复杂科学工作流的端到端复现上仍严重不足。
    • PaperBenchX 将论文结论转化为可执行、可重放、由评分器逐项验证的科学工作流,试图重新定义 AI 科研能力的评测标准。