人形机器人正成为科技界热议的焦点。从特斯拉 Optimus 在工厂搬运货物,到各类演示视频中机器人跳舞、递送爆米花或整理衣物,公众对这一技术的期待值不断攀升。然而,尽管资本与行业领袖纷纷押注,许多机器人领域的研究者却持审慎态度:人工智能驱动的机器人技术突破,短期内难以真正改变普通人的日常生活。

特斯拉 CEO 埃隆·马斯克曾断言,Optimus 不仅将成为特斯拉历史上最大的产品,甚至可能是“史上最大”的产品。他计划先将其应用于工厂车间,随后推向家庭市场,并预测每台售价低至 2 万美元的 Optimus 最终将具备“人类乃至超人类的灵巧度”,从而自动化几乎所有人类劳动。在今年 1 月的达沃斯世界经济论坛上,马斯克进一步预测,这些机器人最快将于 2027 年底面向公众发售。
这种乐观情绪并非孤例。Andreessen Horowitz 联合创始人 Marc Andreessen 认为机器人技术可能成为“地球历史上最大的行业”。Nvidia CEO Jensen Huang 也在今年 1 月表示,人形机器人将在年内与人类能力相匹配。摩根士丹利则预测,到 2050 年,“看起来和行为像人类”的机器人数量可能接近 10 亿,创造超过 5 万亿美元的市场价值。
通用智能的幻觉与现实挑战
上述宣传主要基于一个假设:ChatGPT 和 Claude 等大语言模型的成功,将使新一代机器人能够像模仿人类语言一样轻松模仿人类运动。但众多机器人研究人员指出,这种类比低估了利用基于语言和图像的智能来掌握物理世界无限变化的难度。事实上,目前没有一家制造人形机器人的公司完全掌握了如何让这些机器变得足够聪明。
俄勒冈州立大学机器人教授乔纳森·赫斯特(Jonathan Hurst)强调,将“人形外观”与“通用执行多任务能力”混为一谈具有误导性。“制造出看起来像人的机器人很容易,但要让机器像人一样动态地移动或表现,要困难得多。”
十年前,深度学习引发的 AI 革命让长期设想的人工智能成为现实。如今,机器人学家希望发生类似的变革,赋予机器人此前无法达到的物理直觉和流动性。核心问题在于,推动 AI 进步的方法和工具是否足以实现这一目标。
从规则硬编码到视觉语言行动模型
观察 Google DeepMind 的 ALOHA 2 设备,或许能窥见当前最先进机器人“大脑”的一角。与传统观点不同,ALOHA 2 并未追求完整的人形外观,而是由双臂、抓手和摄像机组成。当由 Gemini 机器人模型控制时,它展现出类似通用机器人的能力:视频显示,它能用两根把手将白面包放入 Ziploc 袋子,将葡萄装入 Tupperware 容器,并将物品整齐放入午餐盒。虽然这顿午餐并不丰盛,但机器人完成组合动作的能力代表了客观的技术进步。
这一进步得益于“机器人策略”的转变。过去,工程师将规则硬编码到软件中;如今,策略交由先进 AI 系统处理。首先是视觉语言模型(VLM),它们在图像和文字上受过训练,能理解上下文(如识别咖啡溢出附近的抹布)。随后是视觉语言行动模型(VLA),它在 VLM 基础上增加了运动指令组件。通过结合执行任务的图像/视频数据以及人类远程操作收集的手臂移动数据,VLA 学习如何命令机器人执行特定动作,例如“关闭笔记本电脑”或“整理耳机线”。
Gemini 机器人模型即是一个经过数小时人类演示训练的 VLA,能执行相对复杂的任务如使用厨房剪刀。但其局限性明显:若任务超出训练范围,机器人往往无法应对。伦敦帝国理工学院机器人学教授爱德华·约翰斯指出:“真正的通用策略应能覆盖所有任务空间,但目前的模型只能做有限的事情。”
数据瓶颈与世界模型的兴起
提升机器人能力的传统路径是增加训练数据。更多例子意味着更强的概括性。Google DeepMind 前机器人技术主管 Pannag Sanketi 主张收集“尽可能多的数据”。然而,获取高质量实体演示数据极具挑战:雇佣大量人员进行远程操作昂贵且耗时;仅靠网络视频训练数据质量较差;直接在现实世界部署机器人收集数据则面临安全性与可靠性风险。Sanketi 认为,“多方位”数据来源的结合是最可行的前进途径。
但赫斯特称单纯依赖数据量的前提是“根本上有缺陷的”。现实世界任务极其复杂:没有两个厨房完全相同,咖啡机工作原理各异,不同杯子需不同握法。即使是简单任务也涉及不断变化的可能性。赫斯特认为,通过 VLA 实现普遍性需要对机器人所能做的所有事情进行完整的数据覆盖,这几乎不可能实现。
Meta 前首席 AI 科学家 Yann LeCun 在达沃斯直言,适用于语言的成功 AI 方法对于高维度、连续、杂乱的数据并不适用,“必须使用别的东西”。这一方向指向“世界模型”:一种通过视频、三维扫描和传感器数据结合,预测现实世界行为结果的 AI。旨在建立精确的内部现实表现模型,捕捉物体移动、碰撞、跌落和变形的物理规律。如果在忠实于现实物理的模拟中训练机器人,开发将更快、更便宜、更安全。配备世界模型的机器人能对周围环境进行推理,而非仅仅做出反应。
Nvidia、Google 以及李飞飞共同创立的世界实验室(World Labs,2 月融资 10 亿美元,9 月底被 AMD 以 82 亿美元收购)和 LeCun 参与的 AMI 实验室(3 月融资 10 亿美元)均在探索此领域。尽管进展迅速,李飞飞仍将该领域描述为“新生的”,基础方法仍在建立中。目前,世界模型更多是有前途的研究方向,而非通向通用机器人的直接捷径。
构成性概括:Physical Intelligence 的突破
去年 4 月,旧金山初创公司 Physical Intelligence (PI) 取得了一次小规模但意义重大的飞跃。该公司专注于开发通用机器人大脑。2024 年,PI 发布了首个通用机器人系统 π0,声称其 VLA 是“迄今最有能力和灵巧的通用机器人策略”,基于 10,000 小时的人类演示及开源数据集训练。随后的 π0.5(2025 春季)和 π0.6(2025 秋季)分别引入了网络标记图像和强化学习,显著提升了折叠衣服、放置新环境物品等任务的成功率。
2026 年 4 月发布的 π0.7 版本似乎将 PI 推向了新领域。该版本使用一个轻量级世界模型生成执行任务所需的步骤图像,向机器人提供下一步行动的快照。PI 声称该模型显示出“构成性概括”的迹象——即 AI 系统能通过重新组合训练中学到的技能,执行从未接触过的任务。在一个测试中,模型被要求“把一颗甜椒装入油炸机中”,这是它以前从未做过的任务。尽管过程中出现犹豫和错误启动,但最终成功完成。
PI 联合创始人、加州大学伯克利分校教授 Sergey Levine 对此感到兴奋:“这是我们首次有说服力地看到这种构成性概括。”后续分析发现,训练材料中存在相关标记的远程操作数据片段,这可能使 π0.7 得以“凭空”组装动作序列。尽管尚不清楚这种概括能力的深度,但它展示了当前最先进研究能让机器人走多远。
70% 成功率意味着什么?
实验室中的微小进步与公众看到的炫酷演示之间存在巨大鸿沟。许多演示视频中,机器人看似自主,实则常由人类远程控制或行为经过精心预设。例如,2025 年 3 月与 Nvidia CEO Jensen Huang 同台亮相的机器人,看似响应指令跟随走动,实则背后有人操控。
目前,完全自主的运动规划——特别是在建筑工地或陌生家庭等混乱环境中——仍是未解难题。更大的挑战在于处理模糊的多步骤任务。区分机器人能否“把盘子放进微波炉”与能否响应“做晚餐”的提示至关重要。迄今为止,让机器人调查厨房并收集制作意大利烩饭的所有食材的任务均以失败告终。
波士顿动力创始人 Marc Raibert 指出,实用机器人必须每次都正确执行。在 VLA 研究中,成功率从 50% 升至 70% 常被视为重大突破,但 Raibert 直言:“70% 的成功率就像它根本不起作用。”
现实中,少数进入工厂的人形机器人仅在严格受控环境下执行极有限的任务。Agility Robotics 在 GXO Logistics、Amazon 和 Schaeffler 的设施中部署了数百个机器人,但赫斯特表示,它们针对的是简单任务,且开发足够安全的机器人仍需数年。马斯克虽在 2025 年 5 月声称年底将有数千台 Optimus 在特斯拉工厂工作,但在今年 1 月又改口称只有“一些”在执行简单任务。
进入家庭面临的挑战更大。用户可预订售价 2 万美元的 1X Neo 家用机器人,预计今年晚些时候交付,承诺承担收拾餐具、应门等家务。但目前,大多数操作仍需远程人工操控,操作人员甚至需获许可才能通过摄像头窥视用户家中。赫斯特估计,若要机器人在人们家中真正做有用的事,至少还需要 10 年。
届时,这些机器人很可能出自中国之手,因为中国在量产方面遥遥领先。据 Omdia 和宇树科技(Unitree)数据,2025 年出货的约 1.5 万台人形机器人中,近 90% 由中国制造。宇树科技推出的机型售价不足 6,000 美元,有望提升消费者吸引力,但该公司预计其机器将首先应用于工业领域。美联社报道指出,采购方主要来自企业、高校实验室及国有企业。
历史的回响:梦想与现实的差距
建造人形机器人的梦想源远流长,可追溯至 1495 年。20 世纪以来,科幻狂热催生了无数机器人原型。1939 年,威斯汀豪斯制造的七英尺高机器人 Elektro 在世界博览会上引起轰动。1973 年,日本早稻田大学制造的 WABOT-1 成为第一个可编程人形机器人,能爬楼梯、识别人脸并自主穿越空间,但因无法在演示中取得足够进步,已于 2018 年停产。
这些工程壮举在当时令人印象深刻,但无人准备好面对现实世界的复杂性。今天的机器人,即使拥有先进人工智能的加持,仍然面临着同样的生存挑战:从实验室走向生活,路阻且长。





