作者:金思宇 中国智库高级研究员、远望智库产业顾问

人形机器人的泛化能力突破,已被业界公认为实现商业化落地的核心关键。宇树科技创始人王兴兴将具身智能的“ChatGPT时刻”定义为“双80%”标准——机器人在80%的陌生环境中,通过自然语言指令完成80%的任务。这一标准一旦达成,就意味着具身智能真正迈过了大规模商业应用的门槛。

当前,行业仍处于技术攻坚期。泛化能力的不足导致机器人仅能执行预设程序,难以适应真实场景的动态变化。宇树科技正通过WMA(世界模型)与VLA(视觉-语言-动作)双技术路线攻关,但距离大规模应用仍需时日。数据稀缺、物理交互精度不足及模型表达能力局限,是横亘在行业面前的三座大山。

一、泛化能力的定义与行业意义

1. “双80%”是衡量泛化能力的核心标准

王兴兴将具身智能的“ChatGPT时刻”定义为:机器人能在80%的陌生环境中,仅通过自然语言指令完成80%的任务,无需提前建图或预设程序。例如,将一台从未接触过某场景的机器人带入陌生环境,仅凭“帮忙把水带给某人”的指令,即可自主完成路径规划、物体识别与递送任务。王兴兴在2026年世界互联网大会数字丝路发展论坛上预测,这一时刻有望在两到十年内到来。

正如《时代》杂志所评价的,王兴兴是“AI时代一位非典型的预言者”。谁能在泛化能力上率先跨越鸿沟,谁就能实现弯道超车。

2. 为何泛化能力决定“弯道超车”?

当前人形机器人多依赖预设程序,在固定场景中任务成功率可达90%以上,但环境稍有变化(如光线、物体位置变动),成功率骤降至30%以下。泛化能力突破后,机器人将从“脚本式执行”转向自主理解物理世界规律,真正适应家庭、工厂等非结构化场景。

智源研究院院长王仲远也明确指出,当前具身智能在硬件层面取得了显著进步,但“通用化与泛化能力仍是制约其大规模落地的核心瓶颈”。他指出,“一旦将一个任务迁移到另外一个任务,它的失败概率依然很高”。相比之下,人类具备极强的通用性和泛化能力,这正是当下具身智能必须突破和解决的核心问题。

从产业政策视角看,正如我在多个场合所强调的,新质生产力的核心不仅是技术层面的升级,更是生产关系与创新生态的系统性重构。人形机器人作为未来产业开辟新赛道的核心方向之一,到2035年,中国有望在6G、脑机接口等关键技术领域实现全球引领,形成万亿级规模的新兴产业集群。

二、当前泛化能力的三大核心瓶颈

1. 数据稀缺与质量不足——与语言模型存在“万倍差距”

截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,而训练通用具身模型至少需要千万小时级数据。智元合伙人姚卯青在WAIC 2026期间透露,具身数据规模与语言模型预训练语料存在“万倍以上的差距”。

数据缺口催生了庞大的采集需求。京东发动最多60万人进行“人类历史上规模最大的数据采集行动”,计划两年内积累1000万小时人类真实场景视频数据。光轮智能联合创始人杨海波表示,具身智能对数据的要求不仅是视觉三维的,还要包含力的大小、力矩反馈等物理交互信息,“拧开一个瓶盖,力的大小、力矩的反馈都要包含在内”。

2. 物理交互精度要求极高——“莫拉维克悖论”凸显

机器人执行精细任务(如端水杯、捡针)需0.1牛顿级力控精度,而当前传感器与算法难以稳定实现。“莫拉维克悖论”深刻揭示了这一矛盾:对人类而言简单的叠衣动作,对机器人的难度远超下棋等复杂计算任务。

3. 模型表达能力与泛化逻辑缺陷

现有VLA模型对长序列任务的理解能力薄弱,难以处理多步骤指令。王仲远指出,当前模型在因果推理、复杂动态系统预判等核心能力上存在瓶颈,对物理场景的推演结果尚达不到实用标准。但他同时强调,现有的VLA类模型“不用推倒重来”,已经能够在某些具体场景中发挥作用。

三、宇树科技的破局路径

1. 双技术路线并行攻关

在WMA路线上,宇树通过视频生成模型预演动作,再与机器人执行对齐,降低对真机数据的依赖。王仲远认为,世界模型与具身智能的关系,本质上是“大脑”与“身体”的关系。在VLA路线上,宇树开源UnifoLM-VLA-0模型,在IBERO基准测试中以98.7分位居行业前列。2026年5月发布的WVLA2.0模型已实现会议室自主整理等生活化场景落地。

2. 构建“数据飞轮”加速迭代

2026年5月,宇树G1人形机器人正式进驻东京羽田机场,由日本航空启动试点,承担行李装卸、货物转运、传送带协同等地勤核心作业,实证试验将持续到2028年。这是中国人形机器人首次在全球顶级航空枢纽实现商用落地。

宇树科技2025年实现营收17亿元,人形机器人收入占比达51.78%,首次反超四足机器人。宇树还发布了R1-D双臂半身机器人,起售价仅2.69万元,直接把“人形机器人”从百万级的科研展品拉到了中小企业能买得起的水平。

3. 硬件与算法协同优化

王兴兴的战略是:首先掌控最难的核心零部件,其次利用规模效应压低成本,最后用每一代产品开拓新市场。宇树招股书显示,此次IPO拟募资42.02亿元,其中超20亿元将投入聚焦具身大模型等机器人“大脑”与“小脑”底层技术攻坚的智能机器人模型研发项目。

四、商业化时间表、市场前景与专家观察

1. 短期(1-3年):聚焦垂直场景验证

行业正从“运动能力竞赛”转向“大脑智能”攻坚。据2026年机器人全产业链接会披露,实现可用的具身智能至少需要1000万小时的多模态数据。工信部、国务院国资委已联合启动2026年度人形机器人与具身智能实景实训专项行动,明确到2026年底带动形成万台级规模落地能力。

从产业演进规律看,具身智能落地将遵循“工业场景→商业场景→家庭场景”的三层路径,市场体量逐层扩大。

2. 中期(3-5年):“双80%”拐点或到来

王兴兴预测人形机器人的“ChatGPT时刻”最快两到十年内到来。摩根士丹利预测,2026年中国市场人形机器人出货量将达5万台,2030年市场规模150亿美元。全球市场空间更为广阔,高盛预测到2035年全球人形机器人出货量将达140万台,市场规模380亿美元;摩根士丹利预计2050年全球市场规模将达7.5万亿美元。

3. 专家观察:行业共识与分歧

多位专家对行业发展表达了审慎乐观。王仲远预计,下一代世界基座模型“才能够真正去推动具身智能,解决我们现在实际落地中遇到的各种困难,尤其是泛化性和面向真实场景的推理能力”。

从国家战略层面看,具身智能已纳入“十五五”规划纲要,被明确为推动新的经济增长点的重要方向。2026年具身智能迎来爆发式增长,全球市场规模突破900亿元,同比增幅超430%,整体出货量突破5万台。

4. 安全与伦理:不可回避的长期课题

2026北京网络安全大会上,“具身智能安全”首次成为独立论坛主题。与会专家指出,具身智能进一步打通了网络空间与物理世界的边界,网络攻击造成的伤害不再只是数据泄露或系统瘫痪,而可能直接转化为物理伤害。

王兴兴强调,宇树机器人“在物理上完全与网络断开”,环境数据仅在客户授权下临时存储,且体量“远低于智能手机”。机器人在设计时也设置了严格的硬件限制和安全保护机制。

结语

当前人形机器人行业已从“运动能力竞赛”转向“大脑智能”攻坚。泛化能力突破将直接决定企业能否从技术演示迈入真实商业场景。

正如我在分析央企改革时所指出的,转型的核心是实现从“依赖垄断资源的巨无霸”向“依靠技术创新的领头雁”、从“被动执行政策的国家队”向“主动开辟新赛道的先锋队”的转变。这一判断同样适用于人形机器人产业——谁能率先在泛化能力上实现突破,谁就能从技术跟跑者跃升为产业引领者。

宇树科技凭借硬件成本优势与数据积累加速迭代,但行业整体仍需跨过“双80%”门槛才能触发爆发式增长。王仲远也指出,具身智能在物理世界的发展相对缓慢,是因为“我们还缺乏一个世界基座模型”。未来2-3年,谁能率先解决数据质量与模型泛化逻辑问题,谁将真正掌握“弯道超车”的主动权。

技术革命需要战略耐心与系统思维。从“实验室创新”到“产业落地”需要跨越成果转化不畅等系统性障碍。唯有通过数据、模型与场景的生态协同,给予行业足够的战略耐心,人形机器人的“ChatGPT时刻”才不会停留在愿景之中。方向已然明确,道路正在铺就。