跳舞时代过去了!看百机大战的明天
作者/ IT时报 孙妍
编辑/ 郝俊慧
“机器人的班味很浓。”当大家在讨论2026世界人工智能大会(WAIC 2026)时,脑海里冒出的第一个画面就是,机器人真能干活了!
在这场机器人“武林大会”上,比个心、握个手、跳个舞、打个拳,已经没办法引起全场欢呼,甚至大家都懒得举起手机拍摄,只道是寻常。
WAIC 2026上,具身智能展区汇聚了超200家企业,不少行业人士打趣道:“明年还剩多少家,要看多少机器人真能落地干活。”
市场逼近出清,“百机大战”竞争必然残酷,即便把价格打得再低,如果没有满足真实需求这一硬指标,机器人仍旧卖不出去。
那么,真正让机器人走进实景的“武功秘籍”到底是什么?
不落地 不成活
“具身智能1.0是概念验证与展示阶段,真正的机器人要落地,不能一直跳舞和表演。把价格做低并不等于就能卖出去。”润科具能CEO周斌提出,2.0阶段大规模部署必须满足三个条件:真实需求、稳定性能、合理的投入产出比。
就在WAIC 2026开幕前两天,睿尔曼智能RealBOT机器人刚在新疆伊宁完成拉条子、穿肉串、烤肉串、切菜等真实后厨作业,它的全栈自研关节模组平均无故障运行50000小时。逻辑很简单,不比谁的翻跟头更帅,比谁的连续工作时间更长。
如今,睿尔曼智能关节模组进入规模化量产阶段,年产能超36万台,服务全球超8000家企业。
云深处科技直接用业绩回应了“落地是唯一硬指标”的转向。2025年,云深处实现四足机器人行业应用收入全球第一。这些四足机器人进入了1200多个真实场景干活,才得以打磨出覆盖电力、应急、公安、消防、林草、教育这六大行业的标准化解决方案。
单纯的算法突破或硬件创新已不足以构筑竞争壁垒,唯有深入行业一线、理解真实需求、打磨可复用的标准化方案,才能真正实现技术价值向产业价值的转化。
人形,不是终局
人形机器人仍然是WAIC 2026的流量担当,但在产业端,人形并不是最终答案。
“人形在技术演进中承担了训练具身智能大脑的功能,但当这些能力真正进入场景部署时,形态应当为功能服务,而非为拟人服务。”周斌用“寒武纪物种大爆发”来形容未来机器人形态的多元化趋势,“我们最终要的不是跟人一模一样,而是如复仇者联盟般,具备十倍于常人超能力的场景专属机器人”。
云深处科技开发了“一人一猫一狗”三种形态的机器人,四足、轮足、人形等机器人适用于不同场景。
山猫S10轮足机器人自重不超过20公斤,单人就可携带并快速部署,能够穿越大型设备无法进入的狭窄通道与废墟缝隙,在应急救援、侦察探测等场景中开辟了轻量化作业的赛道;人形机器人已完成变电站精准作业实地测试,进入商用投放阶段。
润科具能则打破了轮足和人形的界限,造出了全球首创的“半人马”机器人,颇有复仇者联盟的气质。“半人马”机器人的上半身具备双臂灵活操作能力,下半身采用四轮足构型,平均负载100至120公斤,极限静态负载可达210公斤。在消防应急场景中,它不仅能巡检,还能清除障碍物、转运伤员,这是传统四足机器人难以做到的。
如今,消防应急成为“半人马”机器人的首个落地方向,润科具能与上海华燕消防工程公司签署战略合作协议,包含100台半人马机器人意向订单。
机器人
不是大模型的“物理Agent”
给机器人装上大脑就能干活?这个看似顺理成章的路径,在WAIC 2026上被多家企业否定。
“物理世界不是数字世界的简单延伸,机器人需要一套从感知、预测到行动,都为物理世界重新设计的基础模型体系。”蚂蚁灵波科技首席科学家沈宇军将机器人大脑面临的挑战概括为三道鸿沟——看得更清楚、想得更明白、干得更利索。
隔着透明玻璃看见一只猫,并不意味着机器人能够直接触碰它,视觉语义上的“看见”不等于物理空间上的“可达”。
当前,很多机器人大脑的底座是基于数字世界训练成熟的视频生成模型,但沈宇军认为,这条技术路径很难走通。因为数字世界与物理世界有不同的优化目标。对机器人来说,识别得准、生成得美,都不等于任务能够完成;模型还必须理解空间约束,遵循因果与物理规律,在实时反馈中持续行动,并把能力迁移到更多本体和场景。
所以,蚂蚁灵波选择了一条更加艰难的技术路径:许多能力必须从头开始,不直接依赖数字世界已经训练成熟的模型。
大晓机器人董事长王晓刚给出了相似的判断:“数字世界模型失误仅影响图文生成,而物理场景下智能体预判偏差将产生不可逆的真实损失。”基于这一认知,大晓提出具身世界模型的第一性原理:依托多模态高密度信息萃取、控制充分状态锚定,在复杂不确定环境中最大限度降低机器人行动试错成本,加速物理AI的“开悟”时刻到来。
大晓机器人发布的开悟世界模型3.1采用原生统一架构,从底层打通理解、生成、预测三大能力,而非将它们作为独立模块拼接。
洗衣服对人类来说,是一个十分简单的任务。但机器人要完成自主闭环作业,并没有那么容易。有了空间理解的核心底座,机器人才能精准识别部件空间关系,依托时空记忆与思维链拆解十余个操作步骤,自主规划从取衣、放衣到启动、整理的全链路方案。同时具备任务状态追溯能力,实时核验每一步执行结果,出现异常时可精准定位失败节点并重启对应步骤。
两家做机器人大脑的企业殊途同归,他们的判断都是,物理世界需要自己的基础模型,不能把数字世界训练成熟的模型直接“嫁接”到物理世界。机器人,不是大模型的“物理Agent”。
数据配方
具身智能的“武功秘籍”
用一个大脑控制多个形态机器人,一起完成某项任务,这是理想的状态。
但要做到“一脑多形”,到底难在哪里?还是难在高质量场景数据。那么,多少数据才能让数据飞轮转起来?现有的数据远远不够。《IT时报》记者采访了多家具身智能企业,大家对数据的渴求几乎是一致的。
当前,大量数据采集中心积累的“抓东西”“开瓶盖”等通用数据虽在增长,但真正贴合特定作业场景的数据仍然稀缺。润科具能的解法是“底座模型+场景App”架构,利用大厂提供的具身智能底座模型,在油田、炼钢、矿山、消防应急等真实作业环境中采集高质量数据集,精调出面向具体工种的“应用程序”。
睿尔曼智能在北京建成3000平方米的人形机器人数据训练中心,108台机器人在十大高保真场景中实际作业采集数据,形成每日6万条的规模化数据量产能力,目前已储存超10000小时高质量真机数据。
大晓机器人首次提出“具身模型信息密度定律”,即数据的价值不在数量堆叠,而在信息密度,会改变行动结果的信息才是有价值的信息。类比自动驾驶,它将数据分为L1至L5五个层级,L1至L2级数据仅能支撑基础预训练,L3至L4级数据止步于已知任务拟合,唯有融入三维力触觉、失败恢复轨迹和开放场景变量的L5级数据,才能让世界模型获得泛化、反思与自进化能力。大晓同时向全行业开源了L5级家居类复杂任务数据集ACE-Data-0。
网络视频数据、仿真数据、真实场景数据,这三类数据如何配比的“配方”,成为大多数具身智能企业的“武功秘籍”。
触觉,下一个突破维度
触觉,这是WAIC 2026上被反复提及的关键词。多家具身智能企业不约而同地判断:仅靠视觉无法完成真正的物理操作,触觉是具身智能从“看见”走向“理解”物理世界的关键一步。
“在车企装车灯的流水线工位上,工人装上去后,能准确地感知到有没有拧紧,有没有装歪,要让机器人具备这种触觉反馈能力,单靠高清视频是训练不出来的。”周斌认为,触觉是今年乃至明年,具身智能必须突破的维度。
触觉能提供物体几何形状、材质属性与接触动力学的直接信息,是视觉等远距离传感器无法替代的。润科具能正推进应用触觉电子皮肤技术,通过柔性触觉传感器阵列采集压力、温度、纹理、滑动等多维信号。
大晓机器人则发布了行业首个集成三维力触、动捕信息的采集手套ACE Sense Glove,力触觉灵敏度达0.01N,关节角误差小于2度,20余种异构传感器的同步误差控制在1毫秒内。开悟世界模型3.1也将力触状态作为多源具身数据的关键维度之一,与视觉观测、语言指令、策略轨迹共同压缩进统一隐空间。
有意思的是,《IT时报》记者在WAIC 2026展会上看到越来越多情感疗愈机器人通过触觉来感知人类的情绪。熊猫机器人“安安”就搭载了全身全域触摸感知系统,一个拥抱的力度,一次轻抚的位置,都会被精准捕捉,结合对话语境给出贴合情绪的反馈,这就是机器人提供情绪价值的方式。
记者手记
不要技术自嗨 要产业务实
具身智能行业正在经历一场从技术自嗨到产业务实的集体转向:落地是检验一切的唯一标准,“跳舞”的时代正在过去;形态服务于功能,人形是手段不是目的;物理世界需要原生的智能底座,而非数字模型的简单移植;高质量场景数据正取代海量通用数据成为核心壁垒;感知的拼图,要靠触觉来补全。
当蚂蚁灵波选择从头训练具身原生模型,当润科具能推出半人马而非人形机器人,当睿尔曼智能把50000小时无故障运行作为核心卖点,当大晓开源L5级数据集……其实,它们在做同一件事:把具身智能从实验室搬到真实世界的作业现场。
正如周斌所言:“具身智能的真正价值,不在于它能模仿多少人类的动作,而在于它能解决多少人类不愿面对的风险与痛点。”
排版/ 季嘉颖
图片/ IT时报 采访对象
来源/《IT时报》公众号vittimes
E N D