听雨 发自 凹非寺
量子位 | 公众号 QbitAI
机器人也开始打乒乓球了!
这一次,球台直接搬到了世界机器人大会(WRC)现场。
超维动力的展台前,一台全尺寸人形机器人盯着飞来的乒乓球挥拍、转腰,再根据落点迅速调整动作。
几轮打下来,展台周围很快围满了观众。
球台旁边,另一套更大的系统也被摆上了展台。
全尺寸人形机器人KAI Bot、高自由度灵巧手KAI Hand、数采头环KAI Halo、KAI World Model,以及覆盖数据和训练流程的KAI Embodied AI Infra。
从硬件、模型到数据采集和Infra,这一整套全栈具身智能系统,统统被搬到了现场。
这套布局很容易让人想到Figure。作为全球估值最高的具身智能公司之一,Figure几乎是这一轮人形机器人热潮中最受关注的明星公司。
它真正得到资本认可的,不只是造出了一台人形机器人,而是同时押注本体、模型和真实场景。
自己造机器人,自己训练Helix模型,再把机器人送进宝马工厂,让真实任务产生的数据回到模型里,Figure打通了从本体、模型到真实场景与数据回流的全栈链路。
同样,超维动力走的也是全栈路线。
这家成立约一年的中国公司,已经把整机、灵巧手、数据采集设备、世界模型与训练Infra同时摆到了桌面上。
但这些拼图为什么必须同时存在,又如何真正咬合成一套持续进化的系统?
答案就藏在超维动力选择的全栈路线里。
具身领域,全栈路线正在成为共识
过去几年,人形机器人最容易出圈的方式,是完成一个足够炫的动作。
会跑、会跳、会叠衣服,一段几十秒的视频就能收获流量。
但现在,大家已经不只看Demo了。
机器人完成一次任务,只能说明这个任务被做出来了。能否在不同环境、不同本体上稳定复现,才决定它有没有机会成为产品。
放眼全球,头部玩家虽然起点不同,却都在补齐自己的全栈能力。
Figure从「本体+大模型」切入,一边自研Helix VLA模型,一边让机器人进入宝马工厂,在真实任务中积累经验,再把数据反哺模型。
Tesla Optimus的底牌,则是特斯拉的垂直整合能力。
FSD积累的算法经验、成熟的供应链,再加上自家工厂提供的落地场景,让它能够同时推进本体研发、模型训练与规模制造。
Physical Intelligence(π)从模型侧出发,专攻通用具身基础模型,试图让同一套模型适配不同机器人,为形态各异的本体提供通用操作能力。
路线各不相同,目标却越来越一致:把本体、模型、数据与真实场景接进同一条迭代链路。
而超维动力的选择,则是同时布局硬件本体、具身大模型、高质量数据采集和底座Infra。
超维动力联合创始人、香港大学计算与数据科学学院教授罗平,对此有一个很直观的解释:
语言模型的用户是普通人,而具身大小脑的用户是机器人。
两类模型面对的是完全不同的反馈,语言模型输出的是Token,具身模型输出的却是机器人下一秒的动作。一次错误不只是答案不准确,还可能变成抓取失败、碰撞或者失去平衡。
这也决定了,具身智能不能只在互联网数据里学习。模型需要真实世界的动作数据,也需要在机器人本体上反复训练和验证。
数据进入模型,模型驱动本体,本体执行后的结果再回到训练系统。缺少任何一环,闭环都会断掉。
从这个角度看,全栈并非企业想把业务做得更宽,而是具身智能进入真实世界后的必然要求。
硬件、模型、数据,如何咬成一个闭环?
超维动力的全栈能力,最终需要落到具体产品上。
它真正想解决的问题,并非造出一台机器人,而是如何让人类经验更顺畅地变成机器人能力。
先造一副能承接人类数据的身体
超维动力推出的全尺寸人形整机KAI Bot,身高173cm、体重70kg,全身拥有117个自由度。
其全身近80%的区域覆盖触觉皮肤,集成约18000个触觉触点,理论上可感知0.1N以上的轻微触碰。
这些参数的意义,并非只是让机器人的动作看起来更像人。
更重要的原因在于,机器人训练越来越依赖人类示范数据。但如果人需要靠肩、腰和手才能完成的动作,而机器人在结构上根本做不出来,再多数据也无法直接映射到本体。
动作重定向时,每缺一个关键自由度,模型就要多做一层妥协。
罗平表示,机器人本体越接近人的身体结构,就越容易从第一人称数据中学习人的操作方式。
人类社会中的桌椅、工具和空间同样按照人的身体设计。高拟人不是为了外观,而是为了降低机器人复用人类经验的门槛。
这也是KAI Bot追求高自由度的核心逻辑:自由度不是为了堆参数,它实际上决定了模型能不能把学到的动作完整执行出来。
手部则承担最精细的物理交互。独立销售的KAI Hand拥有37个自由度,其中20个主动自由度、1个被动自由度和16个柔顺自由度,指尖力超过30N。
持续抓握10分钟后,整手最高温度不超过人体体温。
高自由度提供动作空间,柔顺结构负责缓冲碰撞,力量和热管理则决定它能否长时间工作。
四者合起来,才是一双真正为具身模型准备的手。
从SMASH看KAI World Model,机器人如何理解并预测真实世界
如果说KAI Bot和KAI Hand回答了身体是否够用,那么KAI World Model要解决的,就是机器人如何理解物理世界,并预测自己的动作会带来什么结果。
罗平将它比作一个实时生成的VR世界:人在生成环境中用双手操作物体,模型根据人的动作和第一视角画面生成后续状态,产生的数据再用于训练人形机器人。
这条路线并未押注单一技术。团队同时探索JEPA式路线、3D方法和视频生成,将其概括为4D世界建模。
但生成一个可交互环境只是起点,世界模型最终还要回到真实世界,接受速度、碰撞和本体差异的检验。
SMASH人形机器人乒乓球系统,正是KAI World Model能力的一次直观呈现。
乒乓球速度快、旋转多变、落点随机,机器人无法只靠预设动作完成任务。它必须持续观察环境、预测来球,并根据预测结果实时调整下一步动作。
具体来看,SMASH并非让一个大模型从头包办,而是把视觉感知、轨迹预测、动作规划和全身控制串成一套闭环方案。
系统先在毫秒级捕捉来球并预测轨迹,再将视觉数据与高频机身状态实时融合,持续计算击球时机、速度和角度。
而且,前不久SMASH刚释放了最新进展:「真·人类史上首场人形机器人自主乒乓球完整对局!」
让机器人跟机器人打完了完整的一局11分对局比赛。
预测的下一步,是要变成动作。
团队采集数十小时人体运动数据,让机器人从人类动作中学习击球,再通过全身协同策略,调动肩、肘、腕、腰和腿完成击球。
更值得关注的是,SMASH并未只部署在自家本体上,相关算法还适配了宇树G1与智元远征A3等机器人。
从看见、预测到行动,这套系统呈现的乒乓球Demo,正是世界模型所需要的闭环能力,以及这种能力跨本体复用的可能。
数据闭环,决定模型能进化多快
身体准备好了,接下来就是让模型持续获得真实世界经验。
具身智能的数据无法像网页文本一样直接抓取。人如何打开柜门,怎样在超市取货,手指接触物体时如何调整力度,都需要在真实场景中重新记录。
KAI Halo就是超维动力伸向真实世界的数据入口。
数百名采集人员佩戴设备进入家庭、超市、商业空间和小型工厂,采集第一人称多模态数据。
公司披露,目前已经积累超过10万小时视频数据,覆盖20多个场景和300多种全身原子技能。
这些数据还会被进一步处理,生成人体全身关节轨迹、三维场景、手部姿态和动作语义标签,尽量减少数据进入训练流程前的重复加工。
但数据采回来只是开始。百万级片段不断进入后台,如果处理、训练和评测仍依靠人工拼接,迭代速度很快就会卡住。
KAI Embodied AI Infra平台则承担了后半段工作,它覆盖数据处理、模型训练、仿真评测和真机部署,再把机器人运行结果回传到系统中。
按照官方数据,这套平台可将高质量数据生产效率提升10倍,将模型训练与评测速度平均提升5至7倍。
至此,KAI Halo负责采集,Infra负责加工,World Model负责学习,KAI Bot负责先做算法的验证和落地,最后再让不同机器人本体负责执行。
真实世界反馈再进入下一轮训练,五块拼图才真正咬合。
当资金和算力不占绝对优势时,闭环效率就是中国创业公司缩短差距的重要杠杆。
一年时间,搭起三年成型的技术骨架
把目光投向大洋彼岸,Figure成立于2022年,用数年时间逐步补齐机器人本体、Helix模型和工厂部署,才形成今天这套相对完整的闭环。
而超维动力的速度要快得多。
这家公司于2025年7月在深圳成立。约一年时间里,整机、灵巧手、数采设备、世界模型和训练Infra相继落地,具身智能所需要的几块核心拼图,已经有了基本轮廓。
这样的推进速度,也与团队过去的积累有关。
超维动力的团队横跨具身模型、计算机视觉、运动控制、自动驾驶和机器人硬件,成员曾参与医用康复外骨骼量产、L4级矿卡落地及端到端自动驾驶模型等项目。
顺便插播一则小道消息,超维动力的Infra团队很强。
因为华为自动驾驶从0到100万量产交付,背后的Infra平台就是他们做的
。
同时,公司也与香港大学MMLab、深圳河套学院等科研团队合作,推进具身模型和运动控制研究。
不过,产品线铺开只是第一步。
人形机器人最终要面对的,是长时间运行是否可靠、产品能否批量交付,以及进入真实场景后能不能创造价值。对于一家成立约一年的公司来说,同时推进本体、模型、数据和Infra,资金与组织压力都不会小。
因此,超维动力没有等到整套系统完全成熟后再考虑商业化,而是先把其中相对独立的能力拆出来。
2026 WAIC期间,KAI Hand和KAI Halo Lite开始公开销售。
整机之外,灵巧手可以进入其他机器人,数采设备可以服务模型团队,Infra也可以成为技术服务。
每一个独立产品都是商业入口,同时又能为内部闭环带回更多数据与场景。
这也是超维动力最值得关注的地方。
它与Figure之间,尽管存在资金规模、场景积累和商业化进度上的差距,但两家公司对行业终局的判断十分接近:
具身智能比拼的不会只是某一台机器人,而是谁能让本体、模型、数据与真实场景更快转起来。
超维动力的优势,在于这套全栈布局一步到位,也足够集中。成立约一年,它不仅搭起了整套技术骨架,还为其中几项能力找到了进入市场的入口。
如果这些产品能够相互带回数据、场景和模型能力,超维动力拥有的就不只是一台持续升级的人形机器人,而是一套可以反复训练和迭代的具身智能系统。
这正是它有潜力超越Figure的原因。
这个判断与单一参数或某场Demo无关,真正值得注意的是,随着行业进入系统竞争,超维动力已经率先拿到了下一阶段比赛的入场券。
接下来,闭环运转的速度与效率,将决定超维动力能走多远,也将成为中国具身智能公司追赶甚至超越硅谷巨头的关键。
One More Thing
据WRC现场围观的业内人士透露,在对打乒乓球的环节里:
KAI Bot面对一些擦网球和离谱高抛球,依然能做出相当丝滑的救球反应(doge)。