

文章指出AI行业正从追求模型智商(SOTA)转向关注‘智效比’——即单位成本下解决实际问题的能力。以DeepSeek V4 Flash和蚂蚁Ling-3.0-Flash为例,分析其在Agent高频调用场景中兼顾效果、速度与成本的优势,强调模型需在真实任务中稳定高效交付,推动AI从演示能力落地为可持续生产力。
在 AI 圈,大家过去选模型多少有点「颜控」,就看谁智商高,谁又占领 SOTA,哪怕它是个能一天烧光你额度的「渣男」,就先冲上去了。
Agent 一来,画风突变。它要自己搜资料、读文件、写代码、跑测试,报错了还得爬起来重做。你甩一句话,它可能在后台刷掉上百次 API。
但 AI 可不会给你免费加班,永远是钱到位再上班,少一分晚一秒都罢工。

这时终于发现不能光看「颜值」了,还得看它能不能踏实过日子。不光活干得漂亮,还得情绪稳定不嫌累,最重要的是,你要跟它能细水长流相濡以沫。
此前轰轰烈烈的 Token-maxxing,很多公司鼓励员工放开用 AI ,谁烧的 Token 多绩效就更好。可 Agent 一天跑上万轮,最后像微软这样的大厂也受不了。
前段时间

这还不能用性价比简单总结,我们不妨这它叫做「智效比」。
如果要写成一道公式,分子是模型真正解决问题的能力,分母是为此付出的激活参数、Token、时间和价格。
APPSO 已经做过很多模型实测,每次都是拿最慢的提示词来测试它的上限,这次我们想试试换一种方式,给AI 块钱,看它到底能跟我干出什么东西,能不能给我长期打工。
这两天 V4 Pro 上线是 AI 圈最受关注的事,我们用就让他自家兄弟
这不只是写一个能打开的页面就行,我要求 AI 需要自己查找资料,决定页面结构,设计状态信息的呈现方式,还要完成一个原创的二次元吉祥物。
先看测试的结果。

V4 Flash Max 跑了 25 次模型调用,输入量 122 万 Token,输出量则是 66,995 Token, 共花费 0.0758 美元,确实是是多快好省。

最近诺兰的《奥德赛》点映都一票难求,电影院怎么选还得做各种研究,那我们继续把这个任务交给

于是我又拿至 Claude Sonnet 4.6 ,这回审美确实更接近奥德赛的电影风格了,可因为单价更高,总共花费 2.5 美元,已经远远超过了我们最初设定的一块钱预算。

于是我们想重新找找看,有没同一个能做得效果比 V4 Flash 好,同时能比 Sonnet 4.6 省钱的模型,
APPSO 在第三方模型评测机构 Artificial Analysis 公布的智能指数(Intelligence Index)榜单上,发现了在 V4 Flash 之外 ,还有不少把经济适用玩出花的新面孔,其中还有个叫 Ling-3.0-Flash 的模型,它的表现明显超过了 10B 到 15B 激活参数的同级别 Flash 模型。

这个蚂蚁家的模型很低调以致我几乎没留意过,但 Ling-3.0-Flash 在 Intelligence Index 的综合得分是 38 分,追平了 MiMo-V2.5(38 分)和 Qwen3.6 27B(38 分)。
虽然 Ling-3.0-Flash 的总参数量是 124B,但推理时仅激活 5.1B 参数;跟体量接近的 Qwen3.6 122B 相比,激活参数只有一半。
如果把这个得分看成「干活能力」,激活参数就是 AI 每次出工要雇佣多少人,在这个坐标轴越靠近左上角,意味着它越能够「花小钱办大事」。
不过跑分不能完全代表实际表现,我们直接让 Ling-3.0-Flash 来把前面的任务再做一次看看。

而
这个结果有点出乎我们意料,这类任务很能体现高频 Agent 对模型响应速度的敏感程度, Ling-3.0-flash 能干过 V4 Flash Max ,似乎有点黑马的感觉了。
在《奥德斯》电影院指南的案例中, Ling-3.0-Flash 一共耗时 17m55s,后台记录了 137 次请求,共花了 326 万 Token 与 0.483 美元。

对比 Claude Sonnet 4.6 ,它用时 16.1 分钟比 Ling-3.0-Flash 略少,工具调用 14 次,消耗了 110 万Token 看起来少了,但因为单价更高,总共花费 2.5 美元,是 Ling-3.0-Flash 的六倍。
不过 Ling-3.0-Flash 也没有完胜 Sonnet 4.6 ,在给出的电影院推荐中部分错误,比如推荐了内地看不了的 IMAX 70mm 格式。
不过好在价格足够便宜,跑多两三次基本也能解决,整体还是更加划算。

综合测试下来,我我们发现Ling-3.0-Flash不是智能上限最高的那个,却很适合输入较短、字段固定的批量抽取,以及需要高频调用 API 的 Agent 场景。
调用量越大,它的优势就越明显,放在高频 Agent 的执行层里,妥妥是一匹黑马。
就像黄仁勋说的,The more you buy, the more you save……
看完前面的测试,你可能会说这么折腾一番,不就就省下了几块几毛钱有必要吗,但要如果把这个数字乘于成千上万呢,这恰恰就是 Agent 时代的日常。
AI 交付的单位正在从一次次对话变成一项完整的工作任务。
OpenAI 公布的数据显示,2026 年 5 月,已有 70.2% 的用户提交过至少需要人类工作一小时的 Codex 任务,25.6% 的用户提交过至少一项预计需要人类工作八小时以上的任务。
最活跃的那 1% 用户,甚至会在一天内产生超过 60 小时的 Codex Agent 运行时长。一天当然还是只有 24 小时,只是多个 Agent 已经开始同时加班。
一项任务会被拆成规划、搜索、执行、验证和复盘。一个 Agent 连续调用一百轮,五个 Agent 同时工作。
这也是为什么

这时,模型只有足够的「智效比」,Agent 才敢多查一个来源、同时尝试三条路线,验证失败后也还有预算重新来过。
开源 AI Agent 工具 OpenCode 发文称,

这个夸张的数据,就是被「智效比」撬动的,它这会决定 Agent 敢不敢多查一个来源,能不能同时尝试三条路线,也会决定验证失败后还有没有预算重新来过。
响应足够快,这些循环才不会层层排队,把原本十分钟的任务生生拖成一场马拉松。当然,一个无法交付结果的模型,价格再低,也只是在批量生产返工。

真正的高智效,是先把事情做成,再用更少的 Token、时间、算力和预算,把同样的事情稳定地做上千次、上万次。
V4 Flash 把 1M 上下文、代码和 Agent 能力放进了更低的价格区间,Ling-3.0-Flash 则用 5.1B 激活参数换来高吞吐和快速响应,让人在更多高频 API 场景使劲蹬。

「智效比」正在成为大模型新的 Benchmark,它不是把价格战再卷一遍,而在悄悄改变模型竞争的方向。
AI 下半场不只是通过堆砌参数来抬高智能上限,更要让已有的智能真正进入业务流程。
AGI 当然还是山顶,大家还会继续往上爬。但我们普通人大多数工作发生在山脚下:读代码、回消息、查资料、跑流程,再把一件件不起眼的小事做完。
当我们不再小心翼翼地计算每一次调用,智能才真正从一种令人惊艳的能力,变成了可以依靠的生产力。
本文来自微信公众号“APPSO”,作者:发现明日产品的APPSO