Today for AI

Interconnects (Nathan Lambert) · 2026/10/10 05:33:47

AI 研究员观点:工程加速非通用智能,RL 数据质量成瓶颈

出处作者 / 发布主体:Nathan Lambert原标题:I expect rapid progress but not towards general superintelligence
68AI 研判分
核心综述

资深 AI 研究员指出,当前大模型在基础设施与工程能力上的快速迭代(如自动化 GPU 调试)虽能显著降低实验门槛,但并未改变模型的本质属性,因此不应盲目预期短期内出现超越人类认知的通用超级智能。文章同时强调,强化学习(RL)环境的数据质量普遍低下已成为制约进展的关键因素,尽管头部实验室仍能从中获得明确的投资回报,但该领域存在巨大的可修复空间。

报道全文原始报道全文

我曾多次感到惊讶,因为听到工业界的顶尖研究人员认为,几年后 AI 将在他们的工作上超越人类。起初我并不清楚自己为何对此持怀疑态度。后来我意识到,这种看法源于研究人员目睹了模型在基础设施和工程能力方面的巨大加速。我完全同意,几年后这些模型将成为超人般的分布式 GPU 工程师。这将使模型的公式化实验和调试变得容易得多,但并不会从根本上改变我们模型的性质。

从某种意义上说,Ilya 较早地宣告了 AI 进入 研究时代。如今有了编程智能体(coding agents),研究工作变得更加轻松。这种便利性源于一种灵活且引人入胜的新型工作方式,这标志着一个时代的开端:在软件领域,好的想法可能比出色的执行更有价值。

我们在这条道路上仍处于非常早期的阶段。此外,这也不是该领域在“AI 更偏向研究”还是“更偏向工程”这一平衡点上经历的首次转变。在深度学习爆发之前,AI 也主要是一项研究性事业。如今,人们公认评判顶尖研究人员的标准在于其将想法在复杂基础设施中实现并规模化的能力。我们将迎来一场持续数年的大规模加速,届时工程瓶颈将逐渐减弱。有人将此称为递归自我改进(RSI),但更务实的说法其实是“并行化的、AI 辅助的语言建模”。你无需相信那种指数级起飞(takeoff)的场景,也能看清基础设施改进的幅度有多大,以及它将如何改变 AI 工作的本质。

本文旨在概述这种工程加速为何会发生,并探讨它无法完全解决的问题。即便我们在数学和编程之外尚未获得具有经济价值的超人特质,这也将极大地促进该技术向经济领域的扩散。近期的大部分进展来自于利用现有工具扩展推理时的计算规模,而非模型在研究能力上发生戏剧性的阶跃式提升。

AI 训练和推理栈中的许多环节都具有高度的可验证性。例如,训练指标如每 GPU 每秒处理的 token 数(即训练速度),以及推理指标如每个 prompt 的 token 数、每个 token 的 FLOPs,或者更直接地说是每次回答的成本。这些指标都极具优化潜力,尤其是当存在成熟的子问题和架构权衡方案时。我预计 AI agents 将在几年内帮助端到端地优化这一过程,使我们的推理能力逼近当前加速器(如 GPU)底层最大计算能力的极限。在过去几年中,企业在推理效率方面取得的收益已经非常巨大,例如在公布某个定价点后,将服务模型的成本节省了约 10-30%。整个技术栈的效果将产生复利效应,我预计未来几年模型智能的有效成本将以近乎指数级的速度下降(可能比近期的趋势更快)。

这些唾手可得的效率红利应该只需几年时间即可捕获。从长远来看,这将涉及在更长的时间线上对加速器和模型进行协同设计,从而在灵活的 GPU 平台基础上带来额外几个数量级的效率提升。在这一快速提升效率的阶段,GPU 的灵活性至关重要,因为架构探索空间显得尤为重要,并且是自动化研究的一个主要杠杆。我认为,至少针对当前这一代模型的预训练研究——包括架构设计和数据选择——在 2-3 年内实现自动化是一个合理的预测。

这一切都将为智能体模型引发巨大的杰文斯悖论效应。我预计需求只会进一步增长,因为行业的主要瓶颈在于如何更好地引导和交付智能体。Meta 的 Muse 智能体就是这一趋势的早期信号,我们可以预期未来会出现更多面向不同受众和目标用例的、类似 Muse 的体验。其价值源于对智能体运作机制的理解,而非单纯追求性能前沿的突破。

在更广泛的科学文献领域(如生物学和化学),相应的阶段将是一个由模型发现大量跨子领域成果所定义的时代。AI 模型在爬取文献以及在目前由极少互动的小型科学家社区维护的稀疏网络中建立联系方面,表现远超人类。这中间存在一条微妙的界限:它究竟是预示着一个科学发现的新纪元(例如治愈大多数癌症),还是仅仅加速了科学原本就在进行的进程。

另一个具有工业规模的低垂果实是提升强化学习(RL)环境的整体质量。你无需远寻,就能看到又一家新的 RL 数据公司营收突破 1 亿美元或 10 亿美元。这类公司的数量远超我的预期。该领域的平均输出质量相当低下。无数研究人员一致认为,他们购买的许多数据简直就是垃圾。与此同时,顶尖实验室从购买这些数据中看到了明确的投资回报。

许多 RL 环境之所以粗糙不堪,显然是可以修复的。