逐际动力张巍谈具身智能的技术和商业化:机器人大脑系统已到GPT-3左右阶段

明亮公司
个人专栏
热度: 5221

逐际动力创始人张巍在2026世界人工智能大会上指出,具身智能正处指数增长阶段,机器人大脑系统已发展至GPT-3左右水平;其核心技术难点在于物理AI而非本体制造,强调‘大小脑融合’系统架构与‘通用本体+APP’商业化路径,并主张通过场景驱动的数据飞轮加速落地。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

7月19日,2026世界人工智能大会,逐际动力创始人、南方科技大学长聘教授张巍发表了题为《让AGI触达物理世界人形机器人从“会动”到“能用”的迁跃》的演讲,分享了他对物理AI、具身智能技术路线、人形机器人商业化路径以及产业生态建设的判断。

逐际动力成立于2022年,张巍在演讲中表示,公司的定位是“一家产品型、有大脑能力的主机厂”。

截至目前,逐际动力已完成多轮融资。2023年10月,逐际动力完成近2亿元天使轮与Pre-A轮融资,投资方包括峰瑞资本、绿洲资本、联想创投、明势创投等。2024年7月,阿里巴巴战略领投逐际动力A轮融资,这也是阿里巴巴首次投资具身智能领域;

2025年,逐际动力规模化发展进一步加速,半年内累计完成5亿元A轮系列融资,获得阿里巴巴、蔚来资本等头部机构战略支持,后续又获得京东战略领投,双方计划在零售、物流与服务场景展开协同探索。

2026年1月,公司完成2亿美元B轮融资,引入阿联酋磊石资本(Stone Venture)、东方富海、基石资本等机构,多家老股东继续跟投,进一步推进全球化布局。

2026年7月,逐际动力完成近2亿美元Pre-IPO融资,投资方包括阿联酋磊石资本、意大利财团、上市公司蓝思科技、IDG资本、合肥滨湖产发集团等。据张巍介绍,逐际动力形成了覆盖战略产业方与国内外财务投资机构的综合股东背景,产业化、国际化和市场化能力进一步增强。

在演讲中,张巍分享了一些独到的行业观点,其中不少是“反共识”的。

张巍认为,当前以人形机器人为代表的具身智能,正处在一个指数增长曲线之中。“很多人看到机器人现在还笨笨的、干不了什么,就用线性方式去判断它的未来。但我们正在经历的是指数变革,不能等看到结果再响应,那就已经晚了。”

在他看来,人形机器人本体并不是最难的部分。“机器人是比较好造的,人形机器人也比较好造。它比光刻机、飞机都好造,甚至比汽车还好造。”张巍指出,真正制约行业发展的,是大会主题所指向的核心能力——AI,尤其是来自物理世界数据的物理AI。

张巍将当前具身智能的发展阶段类比为“大脑系统已经进入GPT-3左右的初级阶段”。但他强调,机器人大脑不是一个单一模型,而是由大语言模型、视觉语言模型、世界模型、记忆管理、任务规划、运动控制等共同构成的agentic system。

围绕这一判断,逐际动力提出了自己的机器人“大脑”系统以及“大小脑融合”的技术方向。张巍表示,行业真正的挑战,不是把某一个单层模型做到极致,而是将高层认知、视觉运动规划和底层运动控制,在毫秒级实时系统中协同起来,并与硬件联合优化。

在商业化路径上,张巍提出,人形机器人的底层逻辑是“通用本体+APP”。单一技能可能价值有限,但如果不改变机器人构型,就能持续叠加不同技能和应用,最终会出现一个“吸星大法拐点”——足够多的应用都会开始向通用本体聚集。

他同时提醒,具身智能不应复刻大模型行业“先做通用模型、再寻找落地场景”的方式。由于物理世界数据天然稀缺且昂贵,不同技能之间的数据差异也很大,因此更合理的路径,是在具备一定通用能力后,尽早进入具体场景,通过专业数据反哺模型能力,形成“场景—模型”的数据飞轮。

以下为「明亮公司」精编后的现场演讲内容(未经演讲人审阅):

具身智能正进入指数增长曲线

大家下午好,我是逐际动力的创始人张巍。今天很荣幸来到这里和大家交流。

虽然今天是世界人工智能大会,但我发现,真正吸引大家眼球的往往还是机器人,是物理AI。因为物理AI确实是AI非常重要的应用方向。

大家也看到了,现在现场有很多眼花缭乱的机器人,到处蹦跳、表演。但大家真正关心的问题是:这些机器人什么时候能从“能动、能表演”,变成真正“能用”、能够解决现实问题的有效工具?

作为一个在这个行业从业比较长时间的创业者和科研工作者,我最近半年到一年非常兴奋。因为我觉得,我们正在经历一个能力跃迁。所以今天想分享一下我在这方面的一些思考。

我这个人比较实在,希望讲一点真话,所以可能会有一些反共识的地方。当然,这些也仅代表我个人和我们一家公司的观点。

先简单介绍一下逐际动力。我们成立于2022年,也是一家学术创业公司。我过去在美国和中国做了大概15年教授,我们团队在人形机器人和具身智能领域也积累了比较长时间。

逐际动力有几个特点:

第一,我们从第一天(day one)开始,就非常重视产业落地。所以很早引入了阿里、京东、招商局、上汽等一系列产业资本。第二,我们非常重视全球化布局。我们在中东、欧洲、美国都有一些重要资本参与,为未来全球化发展奠定了基础。

逐际动力

来源:逐际动力演讲内容(下同)

虽然公司成立时间不算长,但团队在这个行业已经做了很多年。刚才几位嘉宾也都提到,这个行业变化太快了。作为从业者,我自己也经常低估它的发展速度。所以我觉得,对这个行业的判断和预测,一定要建立在对行业变革本质的深刻理解之上。

我认为当前行业变革的本质有两个关键词:第一个叫singularity,奇点。第二个叫exponential,指数增长。

我们正处在一个指数增长的赛道中。但人类对未来的预测,无论是股市还是技术发展,往往都喜欢做线性推演,这是我们的本能。举一个简单例子。比尔·盖茨曾经说过,他花了几十年、投入大量资金,希望解决语言交互问题,但一直没有彻底解决。如果你在大模型出现前问他,这件事什么时候能彻底解决,他可能会说还要10年或20年。但大模型出现以后,技术范式一变,半年时间很多问题就被解决了。而且大模型不仅解决了语言交互,还解决了很多其他问题。

所以我们不能用线性推演,去衡量一个指数级变革。

很显然,推动当前指数变革最关键的力量,是数字世界的AI。数字AI已经越过了那个起点。比如我们公司有些员工一天使用token的成本,可能接近七八千人民币。这在一两年前是无法想象的,甚至一年前也很难准确预判。

在指数变革中,如果等我们“看到了”再去响应,就已经慢了、晚了。我们一定要提前一两年看到趋势。

我认为,以人形机器人为代表的具身智能机器人,虽然现在看上去还笨笨的、好像干不了什么,但它同样处在一条指数曲线里。很多人用线性方式去看它,觉得它没什么用;即便像我这样相对乐观的人,也可能仍然低估它。因为我们本能上很难理解指数增长。

逐际动力

推动具身智能指数级变革的核心要素

接下来我想分享一下,推动具身智能指数变革真正发生的几个核心要素。首先,这个行业目前仍然是一个技术突破驱动的行业。它不是成熟技术的简单落地,而是颠覆性技术突破以后,带来新的商业机会。

先讲一个可能反共识的观点:我觉得机器人是比较好做的,人形机器人也是比较好造的。它比光刻机、飞机都好造多了,甚至比汽车还好造。人形机器人的零部件数量,大概是汽车的十分之一。

那为什么飞机天天在天上飞,汽车到处跑,但我们很少看到人形机器人真正进入日常生活,而大部分还停留在展厅里?

缺的不是会制造机器人本体的人。缺的是今天大会的主题——AI。而且这里的AI不是普通AI,而是物理AI。

逐际动力

物理AI有一个非常重要的特点:它的数据不是来自互联网,而是来自真实物理生活。这就给它带来了极大难度。它可能是AI最具挑战的一类应用。如果考虑终极形态的人形机器人AI,它本质上就是“人形物理AI”,是在模仿人的大脑。

我再讲一个观点:人的大脑从概念上看,其实没那么难。它的任务非常简单:接收指令、理解意图、观察周围环境,然后计算出自己应该怎么动。物理AI的大脑,核心就是做这件事。

本质上,它是一个映射。凡是映射,以前我们可以通过规则分析去构建,现在则可以通过数据去构建。真正的问题是缺数据。

这块行业里众说纷纭,有各种挑战,也有各种技术路线之争。但到现在为止,我认为技术方案可以很多样,但技术范式已经相对收敛了——也就是纯数据驱动的技术范式。剩下更多是工程和细节问题。

我们所有探索的本质,都是在降低完成一个任务所需要的数据成本。这是最根本、最核心的目标。因为如果有足够多的数据,大家都可以做很多事情。问题只是数据不够多。所以行业要解决的根本问题,就是降低数据成本。

机器人大脑不是单一模型,而是一个系统

虽然行业还没有一个统一答案,但逐际动力提出了自己的架构。

逐际动力

我们不认为人的大脑是一个纯端到端系统。它当然都是数据驱动的,但我们觉得它是分层的,因为人的大脑本身也是分区的。

我们大概把机器人大脑分成三层,这和Figure的架构有一些类似,但细节上非常不同。

最上层类似人的前额叶,本质上是一个思考引擎。它以大语言模型、视觉语言模型,甚至未来的世界模型为引擎,是一个agentic system。这一层我称之为System2。它负责:记忆管理;收集指令;信息理解;任务规划;做出决策。它只负责“想”。

中间层是视觉运动皮层。它接收上层决策,观察环境,然后做出一些运动规划。

最下层是小脑和运动控制系统,负责把动作真正完成。

简单概括就是:上面一层“只想不动”,下面一层“只动不想”。

现在大家常用的词是VLA,或者World Action Model。它们其实是实现高阶技能层的不同技术方式,表象叫什么并没有那么重要。每一层现在都有很多研究,但我认为行业真正的挑战,不是把每一层单独抠到多细,而是把这三层联合起来,做到毫秒级协同,尤其是和硬件进行联合优化。

人类从早期类人形态演化到现在,大概经历了700多万年。我们现在需要在AI的辅助下,用几年时间把这件事打通,让大脑真正能够指引行动。

我们把这个方向叫做“大小脑融合技术”。这是逐际动力最重要的投入方向之一,也是我们认为驱动行业真正落地最重要的方向。

如果笼统概括一下,目前机器人或者人形机器人的大脑到了什么阶段?

逐际动力

大家喜欢用“GPT时刻”来类比。这个类比不一定特别恰当,但如果一定要类比,我认为整个机器人大脑系统已经到了GPT-3左右的阶段。这和很多人的判断完全不一样。很多人觉得还非常早。但要知道,GPT-3到GPT-3.5之间,也经历了两年多时间。更重要的是,机器人大脑是一个系统,不是由单一模型决定的。

这是我们和很多人不同的思考。

我认为,模型不等于大脑。模型代表的是能力,而大脑是多模型加上记忆管理、情感管理、任务规划等构成的一整套agentic system。我们的大脑系统叫COSA。整个大脑系统里最关键的,是大语言模型帮我们解决了System2,也就是“只想不动”的部分。

你可以把它理解成一个躺在病床上的残疾人。他不能动,但他有脑子,能思考。如果这个系统由LLM驱动,它相当于一个不能动、但能思考的人。如果由VLM驱动,它就是一个有眼睛的残疾人,能够看见世界。如果它还有World Model,那就相当于学了物理的霍金——它能够理解和预测物理世界。

具身智能要做的事情,就是让这个聪明的System2指引行动。就像让一个残疾人进行康复训练一样,需要数据和练习,通过练习长出下面的技能。

技能不需要一开始就通用,关键是数据成本

技能学习靠数据,这是大家公认的。

但这里我有一个和很多人不同的观点:技能不需要非常通用,才叫有脑。

比如,一个人不会拧螺丝、不会开车,他仍然是一个正常有脑的人。技能的泛化性并不代表智能水平。技能构建取决于:你想先学什么、后学什么,以及对应的数据成本。

所以我们最关键的判断是:大脑不是一个模型,而是一整套操作系统。我们也较早在这方面做了重要投入。

不同技能的难度是不一样的。比如跳舞这种技能相对比较简单,因为它不需要实时和环境交互。凡是需要实时和环境交互的技能,比如上楼梯,就相对更难。我们公司的机器人Ollie上楼梯,就是一个实时大小脑融合技术的例子。为什么楼梯可以做?因为它可以很大程度上在仿真环境里完成。但有些技能,比如收拾桌子,就不行。它必须依赖真机数据。

大家可以看到,我们从去年开始研究、今年发布的COSA系统,能够接收人的指令,通过System2进行任务规划,然后调度导航定位,再执行具体任务。

比如让机器人去拿包裹。你可以把它理解成一个残疾人刚刚恢复运动,所以它走路还有一点点别扭。

在一个演示里,人类向机器人发出指令:“有个快递需要你送到一楼车间Lily手上。”机器人会进行任务规划,先把水拿给客户,再去送快递。它的动作是实时生成的。

大家知道,大语言模型是生成语言token。而机器人不仅要生成对话,还要生成动作token,去完成真实物理任务。在当时的数据量下,它的动作还没有那么自然,但现在已经更好了。各位看到的很多机器人,大部分是两条腿站在那里,上半身做咖啡或者其他操作。真正把全身移动和操作联合起来的系统,其实相对较少,而这恰恰是非常稀缺的能力。

最近,我们的COSA有一个重要升级:我们完成了全自主、实时推理的长程任务。这和前面短技能演示不同。它没有遥操作、没有遥控器,而是在实时推理下完成全身移动和操作。它还有一个特点:场景是家庭环境。家庭环境里的物体种类更多,还包括软物体。这个任务是由一个模型、一个技能直接推理完成的。

目前,除了Figure以外,能够完成这种长程移动操作通用任务的公司非常少。更重要的是,整个模型是纯数据驱动的,不需要专家规则。把系统打通以后,只要持续收数据、再部署,机器人就可以完成一些简单任务的学习和落地。

人形机器人的商业化逻辑:通用本体+APP

接下来讲人形机器人如何推动商业化。首先要理解整个人形机器人产业的landscape(整体图景)。这个产业里会有核心供应商,比如机器手、零部件企业;也会有技术解决方案商,比如未来一些模型公司可能会成为技术方案提供方;还会有人形机器人主机厂,也就是OEM。

和其他行业不同的是,人形机器人未来可能会发展出很多应用。有些机器人最适合接待,有些最适合表演,有些甚至最适合做东北菜。在这个产业链中,主机厂是最关键的,因为它承上启下。

逐际动力的定位是:一家产品型、有大脑能力的主机厂。技术上,我们全面对标Figure;产业化方面,我们会更激进一些。我们的slogan是:serve people,not process。也就是说,两条腿的人形机器人,应该服务于人,而不是服务于生产流程。

因此,我们并不是优先在工业场景里尝试人形机器人。因为我觉得,在很多工业流程里,人形机器人未必是效率最高的形态。它更适合在人类环境中,比如上台、接待、公共服务等场景,为人提供服务。

逐际动力

人形机器人商业化的底层逻辑,是“通用本体+APP”。单一能力,比如跳舞,你可能觉得没什么用。但关键在于,它不改变构型,就可以持续叠加很多APP。当叠加到某个拐点以后,足够多应用都会开始向它身上聚集。我把这个叫“吸星大法拐点”。

所以,我们要做的是阶段性商业化。什么技能先开发,什么技能后开发,这件事背后要有商业逻辑。总结成一句话就是:

构建一个技能的数据成本,要小于这个技能所创造的价值。

逐际动力

只有这样,这个技能才值得做。因此,选择什么样的应用场景,既要考虑技术,也要考虑商业价值。这也是人形机器人商业化难的原因。

也是一种技能,它不是完整大脑。到今天它还没有真正全面到L4。你选择一个场景以后,会发现它需要的数据成本可能非常高,所以必须进行综合判断。

具身智能,不能复刻大模型「先通用再落地」的路径

最后讲两件事。

第一,我认为推动具身智能产业发展,不能复刻大模型“先通用、再落地”的发展方式。因为物理世界的数据天然稀缺且昂贵。更重要的是,各个物理技能之间的数据差异非常大。比如开车和包鸡蛋,这两个技能放在一起训练,相互之间可借鉴的地方并不多。没有必要等机器人会开车了,再去学别的技能。

所以我们提出,具身智能需要形成“场景和模型”的数据飞轮。在具备一定通用性以后,就应该进入具体场景,收集专业数据,再迭代通用模型能力。这件事非常关键。

逐际动力

第二,我们认为具身智能的未来不会是一枝独秀,所以大家不需要只押宝一条路线。这个行业会百花齐放。

因此,行业需要推动两个生态建设:开源生态、产业生态。逐际动力希望成为全球创新者的赋能者,也是产业生态的推动者。我们提供了开源训练架构,开发者可以用自然语言训练一个VLA模型。如果大家希望在自己的场景中尝试,也可以使用我们的机器人和开源设备。

逐际动力

总体来看,我认为人形机器人正在进入一个从“会动”到“能用”的关键节点。

2026年会是具身智能PoC验证的元年。到明年,我们希望看到一些规模化发展。

谢谢大家。

本文来自微信公众号: 明亮公司 ,作者:主编24小时在线

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。