世界机器人大会上,人形机器人叠衣服、炒菜、搭积木的场景吸引着观众的目光。这些机器人不再依赖预设程序或遥控器操作,而是展现出自主决策与任务执行能力。展台上的广告语与论坛讨论的焦点,均指向“具身大模型”与“自主驱动”两大关键词,折射出行业从硬件比拼向智能核心竞争的转型趋势。
过去两年,机器人企业热衷展示运动控制能力,如行走稳定性、抓取精准度等硬件指标。但今年风向明显转变:智平方机器人现场制作咖啡,深朴智能演示洗衣流程,银河通用机器人在零售场景中完成补货任务。这些应用场景虽不追求视觉冲击,却更贴近商业化需求——机器人需在动态环境中理解任务目标,并在出错时自主调整策略。例如洗衣场景中,机器人需检测衣物边缘是否外露,并动态调整抓取位置,这对传统固定程序构成挑战。
资本市场对这一转变反应敏锐。数据显示,2026年上半年国内具身智能领域融资超430亿元,其中50.8%资金流向以“大脑”研发为主的企业,18.5%投入“大脑+本体”综合方案。对比2023年以硬件为主的投资结构,资本重心已明显向智能算法倾斜。某创投人士直言:“仅掌握本体制造的企业难以获得融资,运动控制领域也形成头部效应,新入局者必须突破智能决策技术。”
数据竞争成为具身大模型的核心战场。开发者Alex指出,行业期待通过海量数据积累触发“ChatGPT时刻”——当数据规模突破临界点后,模型可能自发产生通用物理认知能力。当前蚂蚁灵波、字节跳动等企业纷纷开源基座模型,既为拓展应用生态,也为获取更多真实场景数据。但现实是,具身智能所需数据量远未达标:自动驾驶需10亿条数据,而具身智能达到同等能力预计需要100亿条,当前行业积累仅约百万条。
数据采集方式呈现多元化特征。真机遥操作成本高昂,仿真数据虽效率突出但可靠性存疑,第一人称视角采集因其成本可控与场景真实性成为主流。展会现场,部分企业设置互动环节,邀请观众佩戴设备完成抓取、摆放等动作,这些数据将直接用于模型训练。某企业负责人强调:“我们需要覆盖不同物体材质、光线条件、空间布局的多样化数据,单一场景的重复数据对模型提升意义有限。”
技术路线分化加剧行业不确定性。当前主流方案分为VLA(视觉-语言-动作)与世界模型两大阵营:VLA通过端到端训练实现快速落地,但泛化能力受限;世界模型通过构建物理世界内部模型提升推理能力,却面临算力消耗过大的挑战。部分企业尝试融合两条路线,但融合方式与主导模型尚未形成共识。这种技术分歧导致资本市场情绪波动,从2023年大模型热潮到2025年机器人舞蹈引发的关注,再到今年对自主任务执行的追捧,市场期待与现实进展始终存在落差。
在家庭服务场景中,具身智能的落地挑战尤为突出。非标准化环境要求机器人具备任务一致性、动作推理能力与通用泛化能力。以家务为例,机器人不仅需完成洗衣、烹饪等单项任务,还需统筹多项家务的执行顺序。某企业演示的点球大战场景揭示更深层需求:机器人需理解比赛规则、预测对手动作并实时调整策略,这种复杂决策能力恰是当前技术瓶颈所在。尽管资本市场已形成数据驱动的共识,但如何将数据优势转化为商业化突破,仍是所有参与者面临的共同课题。










