新华财经上海9月10日电(记者 魏雨田)过去一年,具身智能站上产业风口,融资与新品发布密集上演。然而热潮之下,三个关键问题始终悬而未决:训练机器人,究竟应更依赖真实数据还是仿真数据?通用大模型会不会“降维打击”具身模型?机器人何时才能跨过Demo(演示),真正进入可持续商业化阶段?
【资料图】
在2026 Inclusion·外滩大会圆桌论坛“物理智能——分歧与抉择”上,围绕数据、智能与场景的三场“路线之争”,与会嘉宾们给出了各自的答案。一个共识正在形成:具身智能不会简单复制语言大模型的发展路径,真正的竞争,正从单一模型能力,转向由数据、模型、硬件、系统和场景共同构成的完整能力。
数据之争:真实与仿真不是单选题
具身智能的第一道分歧来自数据,与互联网上海量现成的文本语料不同,机器人数据无法“伸手即得”。业内人士认为,数据获取成本高、标注难、复用性差,是当前制约具身智能发展的第一瓶颈,也是各家技术路线分野的起点。
苏度科技联合创始人、CEO韩铮认为,真实世界的数据采集效率有限、质量也不总是稳定,仿真因此是绕不过去的一环。苏度科技长期押注仿真,希望通过大规模强化学习,让机器人在不同物体和环境中获得泛化能力。但是仿真与真实数据并不是非此即彼,最终更可能形成分层和组合。
蚂蚁灵波科技首席科学家沈宇军表示,机器人未来真正进入现实环境后,所有信息都只能来自机身上的摄像头、触觉、力觉等传感器。而真实传感器天然存在噪声、误差和个体差异,这些“不完美”恰恰构成了现实世界的一部分。
由此,沈宇军提出了一个更具冲击力的判断:比“Sim to Real”(仿真到现实,即把仿真环境中训练的技能迁移到真实机器人上)更值得关注的,可能是“Real to Sim”(真实到仿真,即将真实世界的物理特征规模化地复刻进仿真器)。真实世界中复杂而细碎的物理特征,究竟能否被规模化地搬进仿真器。未来真正有价值的数据竞争,可能不是比谁拥有更多小时的数据,而是谁能获得并组织那些真正包含“物理智能”的经验。
破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲对此给出佐证。他提醒,当前行业对数据量本身存在一定程度的高估,“一百万小时”“几百万小时”并不天然意味着更好的模型。数据规模之外,质量、分布和训练方式可能更加重要。
业内人士认为,这一分歧背后是语言大模型“规模定律”在物理世界的失灵,文本可以无限爬取,物理经验却必须一条条“挣”回来。谁能率先打通真实与仿真之间的数据闭环,谁就掌握了具身智能的第一张入场券。
模型之争:分层协作而非降维打击
数据之争未歇,模型之争又起。近期GPT-6 Astra在机器人控制上的表现,让行业重新讨论:通用大模型是否会直接进入机器人,甚至“降维打击”具身智能公司?这一担忧折射出市场的真实焦虑,大模型巨头跨界而来,创业公司的技术护城河究竟还剩多宽。
自变量机器人创始人、CEO王潜并不认同这一判断。他认为,“智能的本体存在于数据里”,模型更像训练阶段的蒸馏器和部署阶段的容器。Coding(代码/编程)之所以率先快速进步,并不是因为语言模型自然获得了编程能力,而是因为代码数据更容易生成、验证和反馈。
王潜表示,如果通用模型要真正进入具身智能,它依然必须面对机器人数据、现实世界评测、硬件、仿真和部署等基础设施问题,这些难度不会因为拥有一个更强的语言模型而自动消失。
许华哲对Astra进行测试后也观察到,它在语义理解和三维空间能力上表现突出,能够识别物体、抓取筷子,甚至完成一定程度的递送操作;但到了叠衣服、复杂接触等“Contact-rich”(富接触,指涉及大量物理接触与精细力控的复杂任务)任务,物理交互能力依然存在明显不足。因此,更可能出现的未来不是谁取代谁,而是分层:上层大模型负责语义、推理、规划和任务拆解,底层具身模型负责实时感知、连续控制和高可靠执行。
这一“大脑—小脑”式的分工架构,正在成为业内讨论的主流框架。但沈宇军进一步认为,这种分层甚至可能反过来改变大模型。机器人必须在行动过程中持续接收传感器输入,并根据环境实时改变决策,不能像今天的聊天模型一样“一问一答”。这意味着,具身智能最终可能形成一套属于物理世界自己的训练范式。
场景之争:商业化是一道系统工程题
具身智能眼下最稀缺的不是关注度,而是可复制的商业闭环,Demo视频可以刷屏,但订单和复购刷不出来。当竞争从实验室转向工厂车间与真实服务场景,衡量标准也随之改写:机器人能否稳定、规模化地创造真实价值。
韩铮把实验室与真实商业场景的落差直接摆上台面:大量工业任务第一次执行就必须接近100%的成功率;与此同时,机器人还要能够适应不同物体和环境,不能每进入一个新场景,都依靠大量后训练重新“过拟合”一次。成功率和泛化性,由此成为机器人走出实验室的底线要求。
沈宇军提醒,行业容易陷入一个误区:把商业化几乎全部归因于模型性能。但在真实场景中,客户最终购买的不是一个模型指标,而是一套能够工作的系统。他向现场抛出了一连串追问:是使用一台完整的人形机器人,还是只需要一套双臂?硬件成本到底是多少?传感器是否可靠?系统能否长期稳定运行?部署和维护成本能不能被客户接受?“具身是一个复杂的系统工程。”沈宇军说,模型只是其中一环,真正落地要综合考虑硬件、模型、系统鲁棒性、部署方式和最终ROI(投资回报率),而不能把所有场景问题都归结为“模型还不够强”。
王潜的判断标准最为直接:客户能否持续付钱,而且付得越来越多。在他看来,本代机器人真正的商业价值,不应该只是复制上一代自动化,而应该解决过去解决不了的问题,并在真实场景里形成比人工或传统自动化更好的投资回报。一旦具身公司能够通过前沿技术持续创造客户价值,商业化收入又会反过来支持更大的模型和更多研发投入,技术与商业的飞轮就此转动起来。
许华哲把这场跃迁描述为一条爬坡曲线:基础模型面对大量未知任务时,也能不断提高成功率,从50%、60%、70%,最终走向工业场景所需要的99.99%。因此,“场景之争”的答案可能并不是寻找某一个杀手级应用,而是同时跨过几道门槛:模型要有泛化能力,执行要足够可靠,系统成本要成立,客户还要愿意持续付费。
业内人士认为,从“拼Demo”到“拼交付”,具身智能行业正处在挤去泡沫、回归商业本质的关键节点。数据闭环、模型分层、系统工程能力,缺一不可。也正因如此,这场竞赛的胜负,未必属于跑得最快的那家公司,而可能属于把技术、成本与场景的每一环都扎得最实的长期主义者。
标签: