人形机器人系列深度报告(四):具身大模型:人形机器人智慧内核,数据飞轮驱动迭代跃升-兴业证券#人形机器人hrp2 ypxx.net

报告由兴业证券于 2026 年 4 月 15 日发布,核心指出具身大模型是人形机器人规模化应用的核心瓶颈,其技术架构、数据驱动与国内外进展共同决定行业迭代节奏,同时给出明确投资方向与风险提示。

具身大模型作为机器人 “大脑”,主导感知 - 认知 - 控制全闭环,需具备多模态感知、自主决策、实时执行与泛化四大能力,区别于传统大语言模型,更强调与物理世界的实时交互。当前人形机器人硬件肢体层已成熟,大模型能力滞后是未规模化落地的核心原因,模型在复杂物理环境适应性、泛化能力上仍有明显短板。

技术架构层面,行业路线尚未收敛,分为分层式与端到端式两大方向。分层架构采用 “大脑 - 小脑 - 肢体” 模式,落地难度低、调试灵活,但存在错误累积、跨任务泛化弱的问题,代表为 Figure AI Helix、英伟达 GR00T N1;端到端架构以 VLA(视觉 - 语言 - 动作)模型为核心,集成感知、决策与执行,泛化能力更强、响应更快,代表为谷歌 RT-2、特斯拉 FSD,是未来主流演进方向。世界模型作为辅助技术,可合成数据、预测环境,缩小仿真与现实差距,成为模型迭代重要支撑。

国内外具身大模型已形成对标格局。海外谷歌 RT-2、特斯拉 FSD 领跑端到端路线,Figure Helix、英伟达 GR00T N1、Physical AI π₀则深耕分层双系统架构;国内星动纪元 ERA-42 为首个端到端原生模型,智元 G0-1 首创 ViLLA 架构,银河通用 GraspVLA 依托合成数据实现零样本抓取,字节 GR-3、灵初 Psi R1 也各有技术突破,整体能力贴近海外水平。

数据是模型迭代的核心驱动力,训练数据呈金字塔结构:真机数据价值最高但采集最难,仿真数据用于预训练,互联网数据为基础补充。主流采集方式包括 VR 遥操作、数据手套、主从臂控制等,特斯拉逐步转向视频学习降低成本,银河通用采用 “仿真为主、真机为辅” 的合成数据路线,数据飞轮效应将推动模型持续进化。

免责声明:我们尊重知识产权、数据隐私,只做内容的收集、整理及分享,报告内容来源于网络,报告版权归原撰写发布机构所有,通过公开合法渠道获得,如涉及侵权,请及时联系我们删除,如对报告内容存疑,请与撰写、发布机构联系