扫描下载APP
其它方式登录
2026年具身智能赛道告别路线之争,头部企业从VLA与世界模型的对立转向融合实践,通过技术混搭、轻量化部署、多模态协同和物理世界数据驱动,推动机器人从演示走向真实场景落地,核心焦点转向可靠性、实时性与规模化应用能力。
深圳智平方作为新兴机器人公司,以“最像特斯拉”的端到端VLA大模型技术路线为标签,获近50亿元融资、200亿元估值,正筹备港股IPO;其核心优势在于打通模型研发、机器人产品与真实工厂应用,已获惠科5亿元千台订单,并在半导体显示、汽车制造、生物科技等领域实现方案复购和场景拓展,但商业化收入规模仍待招股书验证。
文章聚焦具身智能发展新路径,介绍清华于超团队提出的Harness VLA框架,强调从单一端到端模型转向“模型+系统”协同范式,通过引入Harness Layer与code policy agent实现任务自主分配;指出强化学习的核心作用是生成交互数据以学习物理规律,并探讨仿真到真实落地的挑战、具身智能Scaling Law及创业实践。
中国L2级辅助驾驶渗透率达70.5%,远超欧洲,自主品牌通过自研智驾芯片(如蔚来神玑、小鹏图灵、理想马赫、比亚迪璇玑)、VLA大模型与世界模型(如蔚来NWM、鸿蒙WEWA 2.0)实现技术突破,并推动智驾向燃油车普及,形成全球领先的智能驾驶发展路径。
文章围绕具身智能发展核心议题展开,聚焦机器人行业三大主线:数据飞轮需在真实场景中构建而非单纯采集;VLA与WAM并非对立,未来主流将是融合语言理解、世界建模、推理规划与实时控制的系统;软硬件全栈能力成趋势,但商业模式将分化为‘大脑型’平台与‘整机型’厂商并存。多位头部机构专家对机器人‘ChatGPT时刻’预测集中在2–5年,但共识在于定义未统一、路径未收敛。
PolicyTrim是一种面向VLA机器人的后训练优化框架,通过两阶段强化学习提升策略效率:先扩展可靠动作序列长度,再压缩冗余物理步骤,在不降低任务成功率的前提下实现最高5.83倍端到端加速,显著减少真实机器人执行步数和时间。
2026年WAIC聚焦人形机器人规模化商用落地,展示全尺寸机器人在展会、工厂、地铁、公安等真实场景的批量部署;行业从炫技转向量产,VLA模型与世界模型双技术路线并行演进,供应链国产化率超75%,芯片、关节、触觉等细分赛道加速专业化分工。
具身智能面临严重数据短缺,催生独立的数据基建赛道。文章分析真机采集、无本体采集、仿真合成和视频蒸馏四类数据生产方式的优劣与成本,指出当前行业存在高估值低收入、商业模式不成熟、数据格式不统一、标准缺失等痛点,并强调数据质量、跨本体适配和商业化落地是核心挑战。
2026年具身智能赛道热钱狂涌,超半数资金流向机器人大脑相关技术,而非本体硬件。文章指出运动控制(小脑)已成熟,而理解世界、自主决策的‘大脑’因高质量数据极度匮乏、技术瓶颈未破成为竞争核心。VLA模型、世界模型、数据基础设施和端侧芯片成资本焦点,华为、腾讯等巨头及千寻智能、无界动力等初创公司加速布局,大脑正从技术模块跃升为具身智能价值链中最具定价权的智能底座。
文章围绕具身智能发展现状展开深度探讨,指出当前技术仍处于‘大哥大时代’,小脑(运动控制)相对成熟,但大脑(决策与泛化)尚未收敛,数据缺口巨大(仅50万条,距千万级需求差200倍),商业化受成本制约,经济账尚难平衡。应用分情绪价值、商业服务、劳动操作三类市场,潜力达百万亿级。强调具身智能可先行落地于非人形场景,需突破数据采集、模型架构及产业生态协同。
文章探讨GigaWorld-1如何将世界模型(World Model)用作具身智能(如机器人VLA模型)的物理评测裁判,以解决真机评测效率低、周期长(需1–2天)的瓶颈问题;通过构建WMBench基准和自动化评估体系,显著提升模型迭代速度,目标是减少而非完全替代真机评测,并指出未来竞争核心在于数据、模型与评测深度打通的系统能力。
世界模型作为AI从‘预测下一个Token’迈向‘预测下一个物理状态’的下一代范式,正引发百亿美元级投资热潮,但概念尚未统一,技术路线分散于渲染器、模拟器、规划器等方向;其落地面临物理数据匮乏与因果推理薄弱两大瓶颈,当前与VLA并非替代而是融合关系,正加速向具身智能的动作闭环演进。
2026年具身智能融资热潮转向‘机器人大脑’,VLA(视觉-语言-动作)模型与世界模型成为核心竞争方向,前者侧重任务理解与执行,后者聚焦物理世界预测与规划,二者正加速融合。资本密集涌入自变量机器人、智平方、千寻智能、银河通用、极佳视界等公司,估值普遍超200亿元,反映行业重心从硬件本体向可泛化、可进化、可落地的具身基座模型迁移。
复旦大学邱锡鹏团队提出“上下文世界建模”(ICWM)方法,使视觉-语言-动作(VLA)模型无需微调即可适应新环境。该方法通过任务前的随机探测生成交互上下文,让模型自主推断系统配置,显著提升跨视角、跨机器人形态的泛化能力,在仿真和UR5e真实机器人实验中均优于现有方法。
文章探讨具身智能领域中‘世界模型’概念的误读与实践偏差,指出视频生成等‘造世界’能力虽具传播价值,但不等于物理世界所需的因果推理与行动预测能力;强调世界模型应作为VLA的补位而非替代,核心在于服务真实物理场景的预演、验证与决策,而非炫技式数字仿真。