一只鹈鹕成了Agent时代最大的明星

AI观察员热度: 5053

文章以“鹈鹕骑自行车”这一社区流行测试任务为切入点,揭示大模型进入Agent时代后用户对能力稳定性的高度敏感。GPT-6 Astra虽具代际优势,但其推理波动、限流与算力供给紧张导致“降智”体感频发,促使开发者自发构建CodexRadar等工具监测实时智能水平,推动行业从追求峰值能力转向重视可持续、可量化的‘智力SLA’。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

“社区里每天有上万张鹈鹕踩单车的视频被发群里,问我这个鹈鹕降智了吗?”开源项目CodexRadar的发起人Lambda,在GPT-6 Astra发布之后,每天都收到巨量的鹈鹕视频,于是,他干脆在社区发起了一场“鹈鹕杯”比赛。

参赛者围绕“画一只骑自行车的鹈鹕”这个任务,用模型生成作品,再把结果发到社区里。

“深夜上线,没宣传就收到快一百份投稿了。”Lambda也没想到,大家对于“鹈鹕测试”的热情如此高。

每次新模型上线,都会有人用鹈鹕骑自行车来测试模型的能力。

一方面,这个任务足够简单、足够直观。模型的很多复杂能力很难靠一句话迅速判断,鹈鹕骑自行车却很容易让人一眼看出稳定性,比如腿和踏板对不对位,车轮是否跟着动,动作有没有穿帮,前后生成是否一致。

另一方面,这个任务又足够复杂。它看上去仅仅是一小句 prompt,背后牵扯到动作理解、时序一致性、空间关系、代码组织和连续执行能力。对一个已经进入 Agent 阶段的模型来说,这类任务非常适合做“体感温度计”。

GPT-6 Astra上线之后,这个鹈鹕“更火了”,原因就是这个最先进的模型,“智商”很不稳定,而智商却会对工作的结果产生直接的影响。

鹈鹕恰好可以把这种很难量化的体感,变得十分直观。

Agent

01 一只鹈鹕,怎么测模型“降智”

鹈鹕杯比赛分成两个赛道。Classic 赛道使用统一提示词“创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画”。只要模型状态正常,GPT-6 Astra生成出来的鹈鹕通常会保持相对一致的质量和画面结构。

Agent

图:用户上传到社交网络的鹈鹕图,可以看出,GPT-6 Astra在各种推理强度下,智商如果保持稳定,鹈鹕的出图基本保持一致

如果某一天大量用户突然发现,同一个提示词下,鹈鹕开始频繁踩空、车轮关系错乱、结构明显跑偏,“降智”的讨论就会迅速出现。

这种方法当然称不上严格的科学 benchmark。一道公开且高频重复的题目,也存在被模型逐渐熟悉的可能。但它非常适合观察短时间内的体感变化。用户不需要理解复杂指标,看几只鹈鹕就能发现差异。

Agent

图:“鹈鹕杯”作品截图,标注“降智的”作品,可以看出鹈鹕“明显不对”

Open 赛道不设统一提示词,参与者可以自由发挥。它更像是在测试 Astra 能把一个开放任务做到什么程度。

其中一个作品,最终做成了一部长达 30 分钟的“一镜到底”骑行故事。

整部作品共享一条 1800 秒时间轴和同一位骑手。地面、山川、城市、星球、车轮、羽毛和粒子全部由 SVG 元素组成,JavaScript 只负责计算位置、关节和时间。整个项目没有使用 Canvas、图片、视频、外部字体或者额外的大模型接口。

镜头可以连续平移、拉远和靠近,所有场景都存在于同一个矢量世界中。为了控制性能,屏幕之外的区域暂停绘制;用户拖动进度条后,所有物件会直接恢复到对应时间点,不需要重新随机生成。

甚至连骑车这个最容易穿帮的动作也被单独处理:车轮转动和脚蹬相位由行驶距离驱动,所以人物停下来之后,不会出现自行车已经停住、脚还在原地空蹬的情况。

作品前 20 分钟穿过 30 个城市和自然景点,其中深圳一章依次出现腾讯企鹅岛、深信服大厦和人才公园;后 10 分钟则进入宇宙,从火星一路来到太阳、冥王星、黑洞,再回到地球。

作者还专门在作品中注明哪些内容来自现实,哪些属于虚构。比如太空骑车、储存阳光的小灯、冥王星雪人,以及穿越黑洞回家,都只是故事设定;黑洞视界也没有被包装成真实可穿越的隧道。

这个作品,能看出GPT-6 Astra能力确实惊艳。

模型需要先理解一个开放目标,再完成页面架构、动画逻辑、时间系统、人物运动、镜头调度、场景设计、性能优化和说明文档,还要让这些部分在一个长达 30 分钟的作品里持续保持一致。

02 Astra为什么让大家格外敏感

CodexRadar 开源项目发起人最早只是想解决自己的问题:模型今天到底有没有变笨,及监测额度重置,可以最高效地把token额度用足。后来,他把监测工具做成社区开源项目,没想到迅速吸引了一批重度 Codex 用户一起参与众测。

CodexRadar 的“众测雷达”设置112 道真实开源编程题,由用户自己跑题,结果上传后再由服务器在干净环境中重新验证。官网显示,参与志愿者已经超过 500 人,累计贡献达到百亿级 Token。

一个最初为了自己监测“模型智商”的小工具,能吸引这么多人持续贡献额度,完全是因为模型能力波动正在成为重度用户共同的痛点。

Agent

Astra 上线之后,这种波动变得更影响工作。

一位大模型算法工程师表示,降智会直接影响自动化任务。“GPT-6降智加限流,自动化任务会积累,最后出现并发冲突。工单会话如果降智,错误还可能通过中枢传播到其他地方,最后把整个仓库搞坏。”

进入 Agent 阶段之后,一次模型调用往往只是整个任务链的一环。如果其中某一步判断出现明显偏差,后续步骤可能继续沿着错误结果向前推进。任务越长,这种风险越明显。

也因此,当模型真正进入生产流程后,用户关心的已经不只是平均能力。能力有没有波动,同样重要。

“Astra全面得强,尤其是computer use和多agent协同管理。从雷达的数据来看,Astra的解题所需要的步骤比前代模型少了一半,越少模型越强,Astra有质变。”

OpenAI 在发布 Astra 时,把 Computer Use、专业工作、软件工程和长程 Agent 任务放在非常重要的位置。多位大模型领域开发者表示,“Astra是有代差的强”。

也正是因为这种强,用户希望能够把过去一些更复杂、更长程的自动化任务去交给它,所以“降智”就会更大地影响工作的实际效果。

03 “降智”到底降了什么

“降智”其实是一个很社区的说法。站在用户一侧,只要同一个模型名、同一个产品入口,今天明显比昨天难用,就会被概括为“降智”。

但从工程上看,用户最后看到的结果已经由很多层共同决定。

底层模型是一层,推理强度是一层,上下文管理是一层,Harness、Skills、工具调用、模型路由、并发调度和服务容量也都会影响最终效果。

所以用户感受到的“变笨”,并不一定意味着模型权重本身发生了变化。

比如一个 Coding Agent 原来会主动跑三轮测试,现在只跑一轮;原来会调用多个子 Agent 检查结果,现在减少了并行探索;原来可以保留更完整的上下文,现在长任务里丢失了一些早期信息。对后台而言,这些可能对应完全不同的问题,对用户而言,最后的体感都是,怎么感觉没以前聪明了。

这也是 CodexRadar 出现的原因。

发布时的 模型的benchmark分数能看出模型的峰值能力有多高,但是却很难看出模型的实时状态,比如今天上午 10 点调用的 Astra,究竟处于什么状态。

但对于用Agent真正工作的人来说,这种实时状态十分重要。

04 “降智”背后的问题

目前并没有公开证据能够证明,OpenAI 在大规模主动把 Astra 替换成更弱的底模。

但 Astra 上线后的供给压力已经有比较明确的信号。9 月 10 日,OpenAI 暂停了每月 200 美元的 Pro 20x 套餐新订阅和升级。现有用户暂时不受影响。这个套餐提供约为 Plus 20 倍的使用额度,也是重度 Codex 用户的重要选择。

Astra 本身又是一款昂贵的模型。

其 API 标准价格为每百万输入 Token 10 美元、输出 Token 50 美元;Fast mode 可以提供更高速度,价格还会再翻一倍。

问题在于,Astra最受欢迎的能力恰好又很“烧算力”。

Computer Use 需要持续理解屏幕、执行操作、观察结果,再决定下一步;多 Agent 工作流还可能同时启动多个子任务;Coding Agent 一次完整任务,会不断读取文件、执行代码、运行测试、回看结果。

当大量重度用户同时开始这么使用模型,供给压力和过去已经完全不是一个量级。

所以这轮“降智”讨论背后,实际混合了模型质量波动、限流、资源调度,以及长任务本身对系统稳定性的放大。

社区里有人认为,最近的问题与 Astra 需求过强、Pro 20x 用户大量涌入和算力供给紧张有关。但 OpenAI暂停20x新增订阅,至少证明了,这个前沿模型出现了很真实的供需矛盾。

过去大模型竞争更多集中在谁能训练出更强的模型。现在,训练出来之后能不能稳定地把这份智能供应给大量用户,也开始成为竞争的一部分。

05 大模型开始需要“智力 SLA”

一只鹈鹕成为Agent时代的明星,说明用户在主动监控“智能”本身。模型在不同时间段的任务成功率、长任务稳定性,以及同一个workflow能否持续复现。可以把它理解成一种新的“智力SLA”。

SLA 原本是 Service Level Agreement,服务等级协议。云服务里通常约定可用率、延迟、故障恢复时间这类指标,比如 99.99% uptime。

模型越强,这个问题反而会越突出,未来模型公司的竞争,也会从峰值能力进一步延伸到另一层:把高水平智能长期、稳定、规模化地供应出去。

模型能不能每天都一样聪明,也成为了AI Agent真正走向工作场景的一个卡点。

本文来自“腾讯科技”,作者:晓静,编辑:徐青阳

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。