

文章以机器人运动会的趣味场景切入,揭示当前人形机器人在高速奔跑等结构化任务上取得突破,但在摔倒后自主起身、复杂环境适应、多步骤操作等现实能力上仍严重受限;对比游戏幻想与工业落地案例,指出通用具身智能尚未迎来‘ChatGPT时刻’,技术成熟度与商业化之间存在巨大鸿沟。
朋友们,机器人运动会刷到了么,画面也太抽象了吧!
最火的应该是这个章若楠跑法的机器人,抱着脸羞答答的样子,跑的是真快!
当然也有起跑前平地就躺了的。
还有这个「打醉拳」的机器人,真就是「摇摇晃晃不肯倒」,当然最后还是倒了。
有抽象的机器人,就有抽象的项目。机器人拳击比赛,两方遥控机器人自由格斗,头都被打掉了……(其实是还没被打自己晃掉了)
首日400米的预赛里,天工机器人弯道处摔倒,当场火花带闪电,荣耀的机器人「闪电」41秒95破纪录完赛,结果冲线之后摔倒只好被工作人员用担架抬走。

但最终决赛上,天工Ultra以38.15秒超过了闪电的39.45秒夺得了冠军。要知道去年400米项目上,高羿科技使用宇树H1夺冠成绩也就是88.03秒,而且是由人遥控并非完全自主的。
就连马斯克也转发了100米组赛前测试,荣耀闪电9.32秒完赛的帖子。这个成绩已经超越了博尔特的世界纪录。

现场荣耀还有一个非常萌的小机器人小派,长这样。

摔倒了就是熊孩子一个。
整个运动会,站起来甚至保持站立的状态,都成了一个非常困难的事,现场好比范伟碰见了赵四,斗舞和没病走两步时不时就会出现。
为什么机器人已经跑得这么快了,爬起来反而成了一个很难的问题?
主要的原因在于,跑得快是一个设定好的程序,而摔倒之后有各种各样的问题要先做判断。
机器人倒地后要重新判断自己是怎么躺着的、哪里能支撑、身体有没有摔坏。关节只能解决力气的问题,解决不了最终怎么发力。
人摔倒时,眼睛、内耳的平衡感、皮肤触觉和肌肉拉伸会一起告诉大脑:哪里被压住了,要用哪里支撑一下来站起来。人不会先画一张受力图,再决定怎么爬起来,身体在动作中不断试探和修正。
但机器人只能从一串传感器读数里把自己重新拼出来。它先要分清自己俯卧、仰卧还是侧卧,手臂有没有卡在身下,身体是否还在滑动;再检查关节能不能响应,电流和温度是否异常。
接下来,它要选择先用手、肘、膝还是脚撑地,判断地面够不够硬、会不会滑。
起身时还得避开自己的胳膊和腿,不能超过关节活动范围,也不能让某个电机瞬间用力过猛。站起来以后,它还要重新找到跑道和前进方向。
这几步必须连续做对。而且大多数情况下,人闭着眼睛都能站起来,但机器人摄像头正扣在地上时,它可能看不见周围;手掌落点偏几厘米,支撑力就会换方向;一个关节在撞击后读数失准,原本能用的起身动作会让它再摔一次。
HumanUP团队在宇树G1真机上测试了六类地面,起身平均成功率只有78.3%。他们还把同一套动作放进一个省略部分身体碰撞的电脑模拟实验里,模拟成功率接近94%;但电脑里和现实完全是两回事。这套动作搬回真机平地,连续5次全部失败。电脑里少算了几次身体接触,现实里的机器人就一次也站不起来。
别忘了,这场运动会中参与的机器人,大多都是针对比赛项目进行改造的机器人,放到生产场景中,他们的表现和真人差得更多。
2025年首次公布的Table30测试,安排机器人完成30种桌面任务。最简单的任务只是把物品放进盒子,这类任务平均成功率42%;但复杂需要记住自己做到哪一步的任务,平均成功率只有5%。
例如考验「时序依赖」的按钮测试。机器人要依次按下粉色、蓝色和绿色按钮。每按完一个,手臂都会回到相似的位置,摄像头里仍然是那三个按钮。人知道刚才按了粉色,下一步该按蓝色;论文测试的模型每次做决定时只看眼前这一帧画面,没有把前几秒发生的事一起带进来。手臂回到原位以后,它就像刚刚失忆了一次,可能重复按粉色,也可能直接跳到绿色。
再比如对折抹布这样测试多步骤和柔软物体操作的测试。机器人需要把抹布连续对折2次然后放到旁边,机器人完成对折一次之后第二次伸手时,已经不能照搬第一次的抓取位置了。

Figure公司发布的第三代人形机器人Figure 03,宣称能自主完成浇花、洗碗、收纳等家庭任务,还能分拣快递、担任酒店前台等商业角色。
一家媒体公开过一组数据,在一个模拟汽车工厂,一台人形机器人把箱子搬到20米外,大约用了90秒,记者估算效率约为人的30%;在一家轴承厂,机器人把一个轴承从托盘放进塑料盒用了70秒,人只需2秒。
人分拣轴承时,手已经伸出去了,大脑还能根据位置和触感不断改动作。轴承歪一点、箱子滑一下、或者旁边突然有人经过,手腕和手指都会立刻跟着变。但机器人还做不到这些,它们通常要先看清位置,再计算手臂路线、摆好手指、抓稳、放下;中间条件一变,刚算好的动作就可能作废。
就好像吃饭夹菜,人看中的肉被别人先夹走,手还在半路,大脑已经选中了旁边那块,手腕跟着改方向。机器人接到的往往是「抓取这个位置的目标A」:A消失后,它可能继续伸向空位,也可能停下来重新识别。新模型可以再拍一张画面、另选目标、重算路线,但它还要明白「旁边那块肉也能完成任务」,并避开别人伸过来的筷子。
机器人能做好的,是那些设定好程序的工作,而不是在不确定的环境中随机应变。

宝马把美国人形机器人公司Figure的Figure 02放进了汽车生产线,10个月中累计工作了约1250小时,搬运9万多件钣金件,参与3万多辆X3生产。机器人做的就是把从固定位置来的零件,再送到固定位置去。
不知道大家有没有玩过一款叫做《底特律:变人》的电子游戏。这款游戏,把故事设在2038年。家政机器人卡拉会300种语言、9000多道菜,能打扫、做饭、辅导作业和照顾孩子;康纳能进警局分析犯罪现场;马库斯负责照顾行动不便的老人。

但现实中的客户买回机器人,还得固定物料、改造场地、采集数据,再让工程师为一个岗位重新训练。
「某某时刻」不是一个正式的技术术语,它一般指一项技术突然从圈内成果变成大众产品的那个拐点。
就比如2022年底,OpenAI开放ChatGPT研究预览。用户不用懂模型,也不用写代码,打开网页聊天,就能让它写作、翻译、解释知识、修改程序,大家称这个时间点是「ChatGPT时刻」。

再比如2025年1月,
所以尽管2025年1月,英伟达CEO黄仁勋在CES上说,通用机器人的ChatGPT时刻「就在眼前」;2026年1月,英伟达又宣布这个时刻「已经到来」,用户始终会觉得具身智能和大众还是太遥远了。
因为普通人还无法上这些服务,这些机器人的能力也达不到为普通人服务的程度。
根据宇树创始人王兴兴的说法,他的标准是在80%的陌生场景里,根据语音或文字完成80%的任务。

8月20日,宇树上市后的第一次公开演讲中,王兴兴判断这个时刻快则还要两三年,慢则五到十年。小米机器人在收鞋、装包、整理桌面和整理沙发4个陌生环境任务上做到75%至79%,已经接近80%这条线;可4项任务和80%的陌生生活,差着一整套现实世界。
机关通用机器人离用户还很遥远,但资本已经下了非常大的价码。
8月19日,宇树登陆科创板,发行价150.80元,开盘冲到了1100元,盘中市值最高4449亿元;当天收盘价845元,市值3418亿元。
但在此之后宇树的股价连续下跌,截至8月24日收盘报603.08元,已经跌到了开盘时最高点的几乎一半,不过总市值仍有2439亿元。

宇树2025年营收16.99亿元,扣掉非经常性收益后的净利润5.91亿元。拿8月24日市值计算,市场给它的价格约为去年营收的144倍、净利润的413倍。
这些机器人还是太抽象了。
本文来自微信公众号“硬核看板”(ID:yinghekb),作者:李沣