从传统控制、RL 到大模型:我眼中的具身智能不是骗局

硅基异见
个人专栏
热度: 5296

具身智能并非资本炒作的骗局,而是一次真实但尚早的范式转移,融合传统控制、强化学习与大模型技术:传统控制保障可靠执行,强化学习提升复杂技能获取效率,大模型增强任务理解与泛化能力;中国具备制造、供应链、政策与应用市场等产业底座,但人形机器人仍处早期试点阶段,商业化落地面临ROI、安全、维护等硬性挑战。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

过去一两年里,具身智能很容易给人一种割裂感。

一边是展会、融资、发布会和人形机器人热舞;另一边是真实机器人落地时绕不开的电机、减速器、控制器、传感器、通信延迟、安全边界、维护成本和场景ROI。

如果只看前者,它确实像一场被资本和流量推高的狂欢。

但如果从控制、强化学习和大模型三条技术线往回看,它又不是空中楼阁。

我的判断是:具身智能不是虚伪狂欢,而是一次真实但尚早的范式转移。

它有技术进展,也有产业底座;有长期价值,也有短期水分。真正的问题不是“它是不是骗局”,而是:哪些能力已经发生了变化,哪些还只是演示视频里的未来。

传统控制没有失效,只是机器人问题变复杂了

2019到2021年,我更多接触的是传统控制世界,在电机、云台等低自由度设备上搞控制。

系统辨识、鲁棒控制、MPC、伺服系统、轨迹跟踪、扰动抑制、执行器约束,这些词构成了我对机器人和自动化系统的第一层理解。

这套体系给人的第一印象是严谨、可靠、可解释。

一个伺服系统要跑得稳、跟得准、抗扰好,背后不是一句“智能”就能解决的。它需要模型、频域分析、约束处理和工程调参。

那时候我对“控制”的理解,更多还是围绕经典控制框架展开:先建模,再设计控制器,再验证稳定性和鲁棒性。

但是,当被控对象变得复杂时,这套方法似乎很难拓展。

腿足机器人要在碎石、坡面、湿滑地面上保持动态平衡;灵巧手要处理接触切换、摩擦不确定和物体形变;移动操作机器人既要移动,又要抓取,还要和环境发生复杂交互。

这时,问题不再只是“让一个轴跟踪一条轨迹”。

它变成了高维状态空间、非结构化环境、多自由度全身协调,以及大量难以精确建模的接触过程。

我意识到传统控制仍然重要,但单纯依赖人工设计控制律,会越来越吃力。

强化学习改变的不是控制本身,而是获得复杂技能的方式

2021年之后,我开始研究强化学习在随机系统中的应用(我的研究跟机器人领域没啥关联),同时也看到了强化学习在机器人领域快速扩展。

强化学习,简单说,就是让智能体在环境中不断试错,通过奖励信号学习策略。放到机器人里,它不是直接写死“脚该怎么迈、手该怎么抓”,而是让机器人在仿真中反复练习,最后学到一套动作策略。

这个过程对我的冲击很大:强化学习改变了机器人控制器设计的范式,这不是换一个算法名字那么简单。四足机器人、双足机器人、跌倒恢复、复杂地形适应、部分灵巧操作,这些能力如果完全依赖人工编写控制逻辑,很难以今天这样的速度迭代。

这种新的控制范式不是简单地用神经网络替代控制律。它真正改变的是控制器获得的方式。传统控制更多是工程师手工建模、显式写出控制结构和控制律;强化学习则是工程师设计状态、动作、奖励、仿真环境、随机化范围和安全约束,让策略在大量交互中学出复杂行为。

简单点说,过去设计的是控制律,现在设计的是学习问题。这也导致了以往控制器设计复杂性的迁移,从模型推导和稳定性分析,转移到了奖励设计、仿真可信度、sim-to-real、安全过滤和真实部署。

但这也正是强化学习的价值:它把很多过去难以手工建模和调参的问题,转化成了仿真训练、奖励设计、安全约束和真实部署的问题。在大规模调参(训练)这一块,机器远快于人,可以搜索的范围也更大。

大模型进入机器人,补的是任务理解这一层

再往后,大模型LLM、VLM出现,机器人领域又发生了另一层变化(这一块我了解的较少,只谈一些“宏观”上的认知)。

如果说强化学习更多解决“怎么动”,那么大模型开始触碰的是“为什么动、往哪里动、任务是什么”。

过去机器人可能能完成一个固定动作,但未必理解人类语言里的意图;能识别一个物体,但未必知道这个物体在任务里的语义角色。

比如,“把能用来敲钉子的东西拿给我”,这不是简单识别“锤子”两个字。机器人要理解任务目标、物体功能和环境上下文。

而LLM、VLM在机器人上的拓展应用,包括RT-2、OpenVLA、π0、NVIDIA Isaac GR00T N1、Gemini Robotics等方案,则开始回应并试图解决这个问题:

机器人能不能从“会一个具体技能”,走向“能理解任务,并组合已有技能去完成新任务”?

这就是我认为具身智能不是纯概念的原因。它背后确实有模型路线的变化,而且已经初具成效:让机器人具备了——理解人类世界任务、任务规划、分解执行等能力。

中国机器人的底座,不只是发布会

技术变化之外,产业底座也在发生变化。身处创新与制造业发达的大湾区,我感触良多。

这里需要区分两个概念:工业机器人、服务机器人产量的增长,并不等于通用具身智能已经成熟;但它说明,我国确实拥有较大的机器人应用市场、制造体系和供应链基础。

IFR的World Robotics 2025数据显示,2024年中国工业机器人安装量达到约29.5万台,占全球部署量的54%;中国工业机器人运行存量超过200万台,国内厂商在本土市场份额首次超过外资,达到57%。

国家统计局数据也能看到制造端的增长。2025年,中国工业机器人产量为773,074套,同比增长28.0%;服务机器人产量为18,581,081套,同比增长16.1%。

这说明机器人并不只停留在融资新闻、样机视频和展会表演里。至少在工业机器人和部分服务机器人生产端,它已经是制造业升级的一部分。

人形机器人还很早,但已经从“零”进入早期市场。IDC 2026年发布的分析称,2025年全球人形机器人出货超过18,000台,收入约4.4亿美元。这个数字放在整个工业机器人市场里仍然很小,远不能说明通用人形机器人已经成熟;但它也说明,人形机器人已经从实验室样机开始进入商业试点。

政策端也在加速。

《“机器人+”应用行动实施方案》提出,到2025年制造业机器人密度较2020年实现翻番。工信部印发的《人形机器人创新发展指导意见》提出,到2025年初步建立人形机器人创新体系,突破“大脑、小脑、肢体”等关键技术;到2027年形成有国际竞争力的产业生态。

这些因素叠在一起,构成了中国具身智能的现实底座:应用市场、供应链、制造能力、政策牵引和新一代AI模型同时出现。

但这不等于成功已经发生。

真正要警惕的,是把五年、十年后的可能性提前写进今天

我不认为具身智能是骗局,但也不认为今天所有叙事都可信。

很多人形机器人展示,仍然集中在表演、导览、教育、数据采集和试点验证。

IDC在2026年4月的分析中提到,2025年超过85%的人形机器人部署集中在表演、教育、数据采集和导览服务等场景,主要仍是演示、交互和技术验证,制造与物流场景只是开始出现早期试点。

这和真正的长期商业闭环之间,还有距离。

机器人在工厂、仓储、巡检、养老和家庭中长期稳定创造ROI,需要回答很多更硬的问题:连续运行时间、故障率、维护成本、安全责任、人员培训、任务可替代性、单位经济性。

这些不是演示视频能回答的。

国家发改委在2025年11月也提醒过,当前人形机器人在技术路线、商业化模式、应用场景方面尚未完全成熟;中国已有超过150家人形机器人企业,其中半数以上是初创或跨界进入者,需要防范重复度高的产品“扎堆”上市、研发空间被压缩等风险。

这个判断很客观。

方向是真的,但行业需要挤掉水分。

不是神话,也不是骗局

所以,我不会把具身智能看成神话,也不会把它看成骗局。

它更像机器人领域的一次长期工程革命。

短期会有水分,长期要看落地;短期会有过热,长期要看谁能把模型、控制、本体、数据和场景真正闭环。

对于做控制和强化学习出身的人来说,这是一个很好的时代

具身智能恰好是传统控制、强化学习和大模型三条线的汇合点。

传统控制解决可靠执行。

强化学习和模仿学习改善复杂技能获取。

大模型和VLA打开语义理解、任务泛化和跨场景迁移的空间。

真正的机器人智能,不会只属于其中任何一个学派,而会出现在它们的交界处。

而当你越接近真实机器人时,越会发现控制没有过时。

它只是需要和学习、语言、视觉、硬件、数据和工程系统重新组合。

经过传统控制训练的学生,对控制系统有更深刻的认知:谐振、带宽、鲁棒性等。在大模型的辅助下,能快速掌握更多技能,像具身智能靠近。

最后,具身智能不是虚伪狂欢

它是一场真实但尚早的范式转移,可能是五年、也可能是十年。但也正好留给了我们转型的时间。

真正值得控制人下注的,也许不是会跳舞的机器人,也许不是最会讲故事的融资PPT,而是那些能把模型、控制、硬件、数据和场景一层层接起来的系统能力。

本文来自微信公众号: 硅基异见 ,作者:真话粉碎机

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。