中国人形机器人占全球97%出货量,训练数据缺口超99%

2026年上半年,全球人形机器人出货量约1.91万台,同比增长272%,其中中国厂商的份额超过97%。出货量与产能的"产量竞赛"已经分出高下,但决定人形机器人能否真正走进工厂和仓库的另一场竞赛才刚刚开始:训练具身智能模型所需的真实场景数据严重不足,全球可用的规模仅约50万小时,距离千万小时级的需求,缺口超过99%。

一、智元与宇树双寡头,合计占据全球四分之三

市场研究机构 Smart Analytics Global(SAG)的数据显示,上半年上海智元出货约8400台,占全球44%;杭州宇树约5900台,占31%。两家合起来,占据全球四分之三的人形机器人出货量。

智元的量产爬坡速度很快:2023年还只有6台原型样机,2024年8月启动规模化量产,2025年1月突破1000台、年底冲到5000台,2026年3月跨越1万台,6月突破15000台。

宇树则刚刚完成上市。8月10日开启网上申购、8月19日登陆科创板,发行价150.8元/股,募资约61亿元,网上申购户数978.46万户,中签率仅0.018%,成为A股"人形机器人第一股"。在供应链一端,宇树国产化率达到90%,核心组件全部自研;DeepSeek以战略配售方式获配93.34万股、投入超过1.4亿元并锁定36个月。

中国机器人同样在加速出海:上半年出口金额62.9亿元,覆盖141个国家和地区,同比增长359%。

二、出货量高,但商业化落地仍在追赶

高产的背后,是真实商业化的进度相对滞后。目前国内人形机器人的终端需求仍集中在科研教研、高校实训、实验室研发等领域,真正进入工业制造、物流仓储、商业服务、公共运维等实体场景的规模化应用占比仍然偏低。相当一部分完成出货的设备,尚未进入常态化、可计价的作业。

行业的制造能力已经建立,但可持续的商业闭环仍在构建。从"造出来"到"用起来"的这段过渡期有多长,取决于另一个变量的成熟速度——数据。

三、50万小时与千万小时的缺口

具身智能,就是让人形机器人在真实世界里自己看、自己动手、自己做判断的能力。这类模型需要海量真实场景数据来训练。据澎湃新闻、腾讯新闻等多家行业报道的测算,要实现通用自主能力,具身大模型的数据需求普遍在千万小时级;而截至2026年初,全球合规可用的真实交互数据仅约50万小时,缺口超过99%。

源头是真实场景数据太少。以广州的一处快递分拣中心为例,深圳龙华企业我能具身研发的双手臂人形机器人已投入包裹分拣流水线试运行,峰值供件效率每小时1200件、稳定约800件。这类机器人的价值不在于"会分快递"——物流行业早已有 AGV(自动导引车)加机械臂的成熟方案——而在于一台通用人形机器人无需改造环境就能接入现有产线。每一次抓取、判断、纠错,都会被记录并反馈到模型训练中,形成正向循环:场景越多,数据越多,模型迭代越快,落地场景越广。

但启动这个循环的前提,是先有足够多、足够好的真实数据。这正是当前最大的瓶颈,也是一批企业切入数据基础设施赛道的原因——它们提供数据采集、清洗、标注、切片等规模化服务,把"缺数据"从全行业的共识,变成一门可交付的生意。

结尾

人形机器人正在同时经历两场竞赛。产量竞赛的胜负已经清晰:双寡头格局初定,产能持续爬坡。数据竞赛才刚刚开始,参赛者不再只是机器人厂商,还包括数据服务商、场景方与标注团队。下一阶段决定产业位置的,不再是产能,而是数据能力。