MIT Technology Review · 2026/10/8 17:00:00
MIT Tech Review 深度复盘:人形机器人演示惊艳但落地艰难,AI 突破难改生活现状
文章指出尽管特斯拉 Optimus 等人形机器人在视频演示中展现了令人惊叹的平衡与操作能力,但其实际部署仍面临巨大挑战。核心观点认为当前 AI 技术尚未跨越从“实验室演示”到“真实世界自主导航”的鸿沟,短期内难以实质性改变人类生活方式。
报道全文原始报道全文
本文目录5 个章节
本文是《麻省理工科技评论》与 Aventine 的合作成果。Aventine 是一家非营利研究基金会,致力于创作和支持有关技术与科学如何改变我们生活方式的内容。
一个外形酷似人类的机器人——白色身躯搭配黑色头部和躯干——频繁出现在视频流中。也许你见过它跳舞、递爆米花、扔垃圾进桶、吸尘或按微波炉按钮;又或者,你目睹过它在分发水瓶时向后摔倒,或是笨拙地试图熨烫衬衫。
这就是 特斯拉的 Optimus,一款由 AI 驱动的人形机器人。该公司首席执行官埃隆·马斯克(Elon Musk)坚信,这将是“不仅特斯拉史上最大的产品,而且可能是有史以来最大的产品”,它将率先应用于工厂车间,随后进入我们的家庭。他在今年七月告诉股东,Optimus 最终将具备“人类乃至超人类的灵巧度”。马斯克认为,每台售价低至 2 万美元的 Optimus 机器人几乎可以自动化所有人类劳动——从搬运金属板到折叠衣物。在一月份于瑞士达沃斯举行的世界经济论坛年会上,他预测这些机器人将在 2027 年底前面向公众销售。
并非只有马斯克在大力推崇这一愿景。硅谷风险投资公司 Andreessen Horowitz 的联合创始人兼普通合伙人马克·安德森(Marc Andreessen)曾表示,机器人技术可能成为“地球历史上最大的产业”。一月,英伟达(Nvidia)首席执行官黄仁勋称,人形机器人将在今年达到人类水平的能力。据摩根士丹利预测,“外观和行为类似人类”的机器人数量有望在 2050 年接近 10 亿,创造出一个价值超过 5 万亿美元的市场。

埃隆·马斯克预测,特斯拉的 Optimus 人形机器人可能成为世界上最畅销的产品之一。目前,它最常见的亮相方式是在特斯拉活动中分发食物和饮料。SIPA VIA AP IMAGES
此类宣言在很大程度上源于一种观点:推动 OpenAI 的 ChatGPT 和 Anthropic 的 Claude 等工具发展的同一批 AI 进步,将使新一代机器人能够像聊天机器人模仿人类语言那样,模仿人类的动作。然而,许多机器人研究人员对此持怀疑态度,他们认为这种假设低估了利用基于语言和图像的 AI 来掌握物理世界无限变数的挑战。“那些制造人形机器人的公司——绝对没有一家——知道如何让这些机器人聪明到具备实用价值,”常被誉为“AI 教父”之一的 Yann LeCun 在达沃斯会议期间的另一场活动上表示。
研究人员还指出,将外观酷似人类的人形机器人与所谓能够学习并执行多种任务的通用型机器混为一谈,是一种误导。“制造一个看起来像人的机器人非常容易,”Agility Robotics 联合创始人兼首席机器人官、俄勒冈州立大学机器人学教授 Jonathan Hurst 解释道,“但要制造一台在运动或行为上动态地、物理地像人的机器,难度要大得多。”
这些争议——关于全能型人形机器人是否即将问世还是遥不可及,以及当前的 AI 形式是否足以将其完善——正在全美各地的机器人实验室中上演,其中对时间表的炒作掩盖了艰难但意义重大的进展。
大约十年前,一系列突破引发了生成式 AI 革命,将人们长久以来设想的人工智能可能性变为现实。尽管对于这一时刻何时到来存在分歧,但机器人学家们相信,机器人领域同样有可能发生一场变革性的革命,赋予机器长期以来难以企及的物理直觉和流畅性。随着机器人技术的缓慢推进,关键问题在于:推动 AI 进步的相同方法和工具是否足以实现这一目标,还是需要一条全新的路径。
机器人遇上先进 AI
要一窥当今最聪明的机器人“大脑”之一,不妨看看 Google DeepMind 如何利用名为 ALOHA 2 的设备。ALOHA 2 是 “A Low-cost Open-source Hardware System for Bimanual Teleoperation”(用于双臂遥操作的低成本开源硬件系统)的缩写。
长期以来,机器人学家们一直争论仿人形态对于通用机器人是否必要:支持者认为这有助于机器人融入现有世界,而反对者则认为此举得不偿失。ALOHA 2 体现了后一种思路。它外观平平无奇,仅由一对机械臂、一些夹爪和几个摄像头组成。尽管看似简单,它却是 Google DeepMind 研究人员的主力测试平台,他们利用它在各个实验室中测试其最先进的机器人 AI 系统——Gemini Robotics。
在 Gemini Robotics 的控制下,ALOHA 2 变得更像一台通用机器人,即能够根据训练示例执行各种任务。正如这段演示视频所示,如果你让它打包午餐盒,它能用两个钳形夹爪小心翼翼地将一片白面包放入 Ziploc 保鲜袋并封口,将一串葡萄放入特百惠容器并盖好盖子,然后仔细地将这些物品移入午餐盒并拉上拉链。
这顿午餐并不丰盛。但机器人能够完成这一组装过程,标志着相较于三年前甚至更早的技术水平,取得了实质性的进步。
这在很大程度上归功于 AI 及其对所谓“机器人策略”(robot policies)的影响。机器人策略控制着通用机器人如何评估和理解周围环境、规划移动路径,并最终正确执行任务。




ALOHA 2 机器人本质上只是工作台上的一对机械臂,但它作为前沿 AI 机器人模型的测试平台发挥着重要作用。这些动画基于人类对机械臂的遥操作数据,这些数据被用于训练 Google DeepMind 的模型。(视频来源:Google DeepMind / Stanford University / Hoku Labs)
历史上,这些策略基于工程师制定的规则,并将其硬编码到机器人的软件中——数千行代码决定了机器人在数百项任务中的每一毫米运动。过去几年发生的变化——也是人们对通用机器人抱有乐观态度的主要原因——是机器人策略正从硬编码转向由先进 AI 系统接管。这一转变首先始于 VLM(视觉语言模型)。VLM 与大语言模型类似,但其训练数据不仅包含文本,还包含图像。向 VLM 展示一张咖啡泼洒的图片并要求它寻找清理工具,它能够识别出附近的抹布。这种即时的情境理解能力在几年前机器人策略仍被硬编码时是不存在的。
随后出现了视觉-语言-动作模型(Vision-Language-Action models),使机器人能够评估环境并在其中采取行动。这些模型通过增加另一个组件来实现这一点:运动指令。VLAs 的训练数据包括与执行特定任务相关的一系列图像或视频,以及关于机械臂如何移动以完成该任务的关联数据。这些运动数据通常通过遥操作(teleoperation)收集,即人类使用遥控器引导机器人执行动作。这种训练方式使 AI 能够学习如何在特定任务中指挥机器人进行移动和操作。将一台由 VLA 驱动的机器人放在书桌前,并告诉它“合上笔记本电脑”或“整理耳机线”,它将观察场景、识别相关物体、规划执行请求的方式,然后挥动机械臂开始行动——前提是它之前见过此类任务的执行过程。
Gemini Robotics 模型就是一个 VLA,它在大量描绘各种不同动作的人类演示视频上进行了训练。因此,它能够执行相对复杂的任务,例如用厨房夹子夹起雪豆、折纸或准备简单的午餐。这令人印象深刻,但存在一个明显的局限性:目前,如果由 VLA 控制的机器人被要求执行超出其训练集范围的任务,它极有可能失败。
“考虑到所有可能任务的空间,真正的通用策略应该能够涵盖整个光谱上的所有任务,”伦敦帝国理工学院机器人学教授 Edward Johns 表示。然而在今天,Gemini Robotics 模型只能做到“这里做一点,那里做一点”。
对真正通用性的探索
那么,如何让机器人具备执行更多任务的能力?通常的答案并不令人意外:用更多数据来训练它们。
这种思路认为,更多的数据意味着更多的示例,而更多的示例则意味着更强的通用性。例如,Google DeepMind 希望汇集“尽可能多的数据”,该公司前机器人技术负责人 Pannag Sanketi 表示,他目前正在推进 自己的 AI 机器人项目。但数据从何而来?大型语言模型(LLM)拥有海量现成文本作为训练素材的优势。然而,目前并不存在一个对应的高质量物理演示数据集供机器人训练使用。研究人员有几种弥补这一缺陷的方法,但每种方法都有不足。一种是雇佣大量人员创建并收集遥操作数据(成本高且耗时)。另一种是在人类执行活动的视频上训练视觉-语言-动作模型(VLA),但这导致生成的数据质量较差。还有一种是将机器人部署到现实世界中,利用从这些体验中收集的数据进一步改进 AI 模型(机器人在实验室外并不安全或可靠)。Sanketi 认为,结合来自所有这些来源的数据的“多管齐下”策略是最可能的未来路径。
然而,认为仅靠训练数据就能解决问题的观点 远非普遍共识。Agility Robotics 公司的 Hurst 将其描述为“一个根本错误的假设”。
问题在于,现实世界中的任务复杂性会迅速爆炸式增长。如果你试图制作咖啡,就会面临无数变量:没有两个厨房是完全相同的;咖啡机的工作方式各不相同;不同的杯子需要不同的抓握方式;咖啡粉、热水和牛奶都需要以不同的方式处理。即使是这样简单的任务,也需要理解不断变化的可能性清单。Hurst 认为,通过 VLA 实现通用性将需要“对 [机器人] 可能做的所有事情进行完整的数据覆盖”。或者换句话说,需要一个几乎无限大的训练数据池。
LeCun 对整个方法持不屑态度。“在语言领域取得成功的 [AI] 方法并不适用于高维、连续且嘈杂的数据”——他在达沃斯表示,这正是机器人领域中常见的数据类型。“你必须使用其他东西。”
“其他东西”这一概念的主要竞争者是所谓的“世界模型”(world model)——这是一种较少依赖文本,而是基于视频、三维扫描和传感器数据组合进行训练的 AI 形式,旨在预测现实世界中行动的结果。其目标是构建具备足够精确的现实内部表征的模型,以捕捉物理世界的实际运作方式——物体如何移动、碰撞、坠落和变形。如果机器人学家能够在对真实物理世界足够忠实的模拟环境中训练机器,开发过程将变得更快、更便宜且更安全,从而减少对真实世界测试的需求。更具变革性的是,配备世界模型的机器人能够对其周围环境进行推理,而不仅仅是做出反应,这有助于它们在采取行动之前预判后果。
Google DeepMind 最新的机器人 AI 模型日益灵巧,尽管仍显得缓慢且不稳定
Nvidia 和 Google 等公司正在致力于这项技术,投资者的资金也大量涌入备受瞩目的初创企业。由斯坦福大学 AI 研究员李飞飞联合创立的 World Labs 在二月份 筹集了 10 亿美元 的资金,并于九月底被 AMD 以 82 亿美元收购。由 LeCun(前 Meta 首席 AI 科学家)联合创立的 AMI Labs 也在三月份 筹集了 10 亿美元。然而,据他们自己承认,目前仍处于早期阶段。去年年底,李飞飞将该领域描述为 “初生阶段”,并补充说“基础方法仍在建立中”。她在六月份的 Substack 文章中描述了 艰巨的挑战。目前,世界模型是一个充满希望的研究领域,而非通往通用机器人的即时路径,但我们开始看到它们可能实现成果的些许曙光。
去年四月,在旧金山的一个机器人实验室里,一次虽小但可能意义重大的突破带来了这样的一丝曙光。
一项突破?
在旧金山使命区的核心地带,初创公司 Physical Intelligence——或者它喜欢被称为 PI(即 π)——正致力于开发一个通用大脑,理论上可以将任何机器人变成通才。该公司采用“包罗万象”的方法来训练机器人的 AI 模型,最近观察到了一些迹象,展示了配备世界模型的机器人大脑可能具备的能力。
2024 年,PI 发布了其首个通用机器人系统的详细信息,名为 π0,这是一个视觉-语言-动作(VLA)模型,该公司声称它是“迄今为止最强大、最灵巧的通用机器人策略”。该模型最初是在通过遥操作收集的 10,000 小时专有的人类演示数据以及几个开源机器人数据集上训练的。2025 年春季发布的版本 π0.5 在更广泛的数据集上进行了训练,包括来自网络的带标签图像,从而赋予了它更多的多功能性。2025 年秋季更新的 π0.6 为模型增加了强化学习功能。
每次更新都带来了模型性能的重要提升,将其能力范围从缓慢地折叠衣物扩展到在新环境中整理物品,再到以更高的成功率完成折盒子等任务。随后,在 2026 年 4 月,π0.7 似乎将 PI 推向了新的领域。这个版本利用了一个较弱的“轻量级”世界模型,该模型生成执行任务所需步骤的图像。当机器人执行工作时,这个模型会向其提供下一步该做什么的快照。

如何教机器人使用刀具?在初创公司 Physical Intelligence,这始于设计合适的 AI 架构,其中包括专门用于处理语言、视觉和运动的组件。这将有助于它将指令——“嘿,机器人,切我的蔬菜!”——转化为适当的动作。WINNI WINTERMEYER

用于训练 AI 的数据可以来自许多来源,但最重要的来源之一是人类演示。该公司的员工通过遥操作控制机械臂,让 AI 接触切西葫芦的任务。WINNI WINTERMEYER

研究人员利用数百个人类演示示例、网络图像以及第一人称视角视频来训练 AI 模型。WINNI WINTERMEYER

一旦 AI 完成训练,团队便会向其展示一项此前未见过的任务,例如切这种夏季西葫芦。当机器人未曾见过完全相同的任务时——它可能会疑惑那究竟是一根黄西葫芦还是一根奇怪的香蕉——就可能出现失误。但任何失败都可以用于帮助优化模型。WINNI WINTERMEYER
该公司声称,该模型展现出了组合泛化(compositional generalization)的初步迹象。这一术语指的是 AI 系统通过重新组合训练数据中已学到的技能,从而执行其从未接触过的任务的能力。其中一项测试要求模型“将红薯放入空气炸锅”——这是一项它此前从未遇到过的任务。在一段演示视频中,机器人在操作过程中有些笨拙,出现了几次错误的启动尝试,最终勉强完成了合理的动作,尽管并未彻底完成任务。
加州大学伯克利分校教授兼 Physical Intelligence(PI)联合创始人 Sergey Levine 对这一潜力感到兴奋:“这实际上是我们第一次令人信服地观察到这种组合泛化现象,即我们可以基本上要求模型执行那些我们并未专门收集数据并对其进行训练的任务,而它确实能做出像样的尝试。”
这一成功促使团队思考模型是如何实现这一壮举的。经过深入调查,他们发现训练材料中隐藏着相关的带标签遥操作数据片段,其中包括两个人类操作员使用机器人将空气炸锅篮推入炸锅的例子。这些零星的数据可能足以让 π0.7 几乎完成空气炸红薯的任务。
目前,π0.7 的泛化能力究竟有多强尚不明确。不过,鉴于该模型接触空气炸锅的时间如此短暂,这仍让我们得以一窥前沿研究目前能让机器人达到何种程度。
“70% 的成功率就像根本没用一样”
你可能会感觉到一种脱节:一边是机器人在实验室里步履蹒跚的“婴儿学步”——“看!它把红薯放进空气炸锅了!”——另一边则是许多演示和视频中所展示的令人眼花缭乱、栩栩如生的灵巧身手,在那里机器人似乎无所不能,从在舞台上跳舞到礼貌地调制饮品。这类演示往往没有明确揭示一个关键事实:在许多情况下,机器人是由人类操控的,或者其动作经过了精心编排。(例如,2025 年 3 月与英伟达 CEO 黄仁勋一同登台的那款机器人,看似在回应他的指令并跟随他移动,实际上是由制造商所称的“幕后木偶师”进行遥控操作的。)
雪上加霜的是,一款实用的机器人必须几乎每次都能成功。波士顿动力(Boston Dynamics)创始人马克·雷伯特(Marc Raibert)表示:“当视觉-语言-动作模型(VLA)的成功率从 50% 提升到 70% 时,人们会非常兴奋。但 70% 的成功率意味着它基本上还是不可用,对吧?”

演示往往让机器人看起来很有用,但这些机器仍然频繁出错,无法在家庭和工厂中可靠使用。AP IMAGES, SHUTTERSTOCK, 1X, AGILITY ROBOTICS, GOOGLE DEEPMIND
目前,在现实场景中测试的少数人形机器人仅能在严格受控的环境中执行极其有限的任务。它们远非通用型机器人。据 Agility 公司称,其数百台机器人已在 GXO Logistics、亚马逊和 Schaeffler 拥有的设施中部署用于试验。但 Hurst 表示,就目前而言,这些机器人主要瞄准的是搬运料箱和周转箱等简单任务。他补充道,即便只是开发出让物流公司愿意考虑使用的足够安全的机器人,也耗费了数年时间。另一方面,埃隆·马斯克(Elon Musk)曾在 2025 年 5 月声称,到年底将有“数千”台 Optimus 机器人在特斯拉工厂工作;但今年一月,他又改口称该公司仅有“部分 Tesla Optimus 机器人在工厂内执行简单任务”。
当这一愿景真正落地时,这些机器人很可能出自中国之手,因为中国在产能方面已大幅领先西方。根据市场情报公司 Omdia 和中国机器人企业宇树科技(Unitree)的数据,2025 年出货的约 15,000 台人形机器人中,近 90% 由中国制造。去年出货量居首的宇树科技推出的一款型号,售价低于 6,000 美元。如此亲民的价格有望显著提升机器人对消费者的吸引力,尽管该公司预计其设备将首先应用于工业场景。(顺便一提,如果你好奇是谁在购买这些中国机器人,美联社近日报道称,订单主要来自企业和学术实验室以及国有企业。)
历史总是惊人地相似
打造人形机器人的梦想源远流长:早在 1495 年,列奥纳多·达·芬奇就绘制了由缆绳和滑轮控制的机械骑士设计图。纵观整个 20 世纪,那些源自科幻狂热想象的机器来了又去。

西屋电气的 Elektro 在 1939 年世界博览会上引起了轰动。GETTY IMAGES
西屋电气打造的七英尺高、长着双腿的“方盒子”Elektro,在 1939 年的纽约世博会上抽起了香烟。由日本早稻田大学于 1973 年建造的 WABOT-1,是首个全尺寸、可编程的人形机器人。本田于 2000 年发布的 ASIMO,可能是第一台真正展现出一定能力的此类机器——它至少能在一定程度上爬楼梯、识别人脸并在空间中自主移动。但该机器人已于 2018 年停产,因为它无法在演示功能的基础上取得足够突破,从而具备实际实用价值。
在当时,这些全都是令人印象深刻——甚至让人瞠目结舌的工程壮举。但没有一个能够应对现实世界的复杂环境。如今,即便拥有先进 AI 带来的变革性力量,机器人依然面临着同样的根本性挑战。