阿里拟投3亿美元抢"判卷权":大模型下半场,谁定义"好",谁决定下一代

Tao财经
个人专栏
热度: 5344

阿里巴巴拟领投AI评测与后训练公司UniPat约3亿美元,聚焦大模型下半场核心能力——Agent时代的真实任务评测与反馈闭环。UniPat通过SaaS-Bench、EvoCode-Bench等生产级评测集,构建从环境模拟、失败轨迹分析到强化学习数据供给的完整链条,争夺定义‘模型好不好’的判卷权,即任务定义权、评分标准权和反馈数据权。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

有消息说,阿里巴巴正考虑领投AI评测与后训练公司UniPat约3亿美元,估值约25亿美元,腾讯、老股东红杉中国被曝有意参与。必须先把话说在前面:这笔交易仍处谈判阶段,金额、估值、条款、最终名单都没敲定,远没到"已交割",后续随时可能变。

但比交易本身更值得写的,是UniPat这家公司戳中的那个问题。它成立于2025年末,创始人李宽是90后,创业前在阿里通义实验室实习,参与通义DeepResearch项目,做的是后训练分析、数据合成和强化学习。团队做过WebSailor等复杂推理研究,发布过BabyVision、SaaS-Bench、EvoCode-Bench、Terminal-X等一串评测集,方向是软件工程智能体、浏览器操作、企业SaaS长流程任务。

把这家公司简单说成"AI考官",是轻看它了。它真正卡的位置,是大模型下半场最容易被忽略的一层:模型答完题之后,谁来判断、如何纠错、怎样把纠错变成下一轮训练信号。而这一层,恰恰是当前整个行业最稀缺、又最容易被资本看走眼的地方。

模型答完题之后,谁来判断?

大模型的上半场,拼的是参数、算力、语料。判断一个模型好不好,靠的是Benchmark——输入一个问题,输出一个答案,算准确率。这套东西,在"答题"时代够用,也简单。

但Agent时代,它失效了。因为Agent的任务不再是一道题,而是一连串动作:理解环境、规划步骤、调用工具、改代码、查数据库、处理异常、回滚、交结果。中间几十步,任何一步歪了,末端答案再漂亮也没用。传统的静态题卡,测不出"它到底能不能把事办完"。

UniPat做的第一层,就是"生产级评测":不是问模型"知不知道",而是把它塞进近似真实的环境,看它能不能把事做完。SaaS-Bench把23个真实开源SaaS系统装进Docker,跑106个跨应用长流程任务;EvoCode-Bench考多轮需求变更下的连续开发;Terminal-X考复杂工程任务和版本升级。这是把评测从"判卷"升级成了"实战演练"。

举个最直观的例子。传统Benchmark考一道数学题,模型答对就是好。但在Agent场景里,模型接到"帮客户改一份ERP里的采购单"这个任务,它得先理解需求、再找到正确的页面、再改对字段、再保存、再确认没有改坏别的数据。中间任何一步断了,任务就失败了——哪怕它最后输出的那句话很漂亮。这就是为什么"答题型评测"在Agent时代彻底不够用:它测的是"模型知不知道",而企业真正关心的是"模型能不能把事办完"。

但真正值钱的,是第二层。

评测跑完之后,最有价值的不是分数,是失败轨迹:哪一步决策错了、验证器为什么拒、人工Rubric怎么扣、换一条路径能不能收敛。这些轨迹、中间状态、验证信号、偏好标注,可以直接进SFT、奖励模型或强化学习。

于是闭环形成了:评测找弱点 → 切失败轨迹 → 标Rubric和偏好 → 合成训练数据 → 后训练更新策略 → 再评测 → 再找弱点。UniPat卖的就不是一次考试,而是模型持续变好的反馈回路。报道里也提到,它和阿里的合作以强化学习后训练数据为主,先在较小模型上做低成本实验,筛出有效方案再放大。这套"先小后大"的打法,本身就是后训练数据生意最务实的路径——小成本试错,跑通了再规模化。

"判卷权":谁定义好,谁决定下一代

"判卷权"这个词,翻译准确了,其实是掌握三样东西。

第一是任务定义权。什么叫"完成"?是末端JSON对,还是跨系统状态一致?是代码能跑,还是测试通过且不影响既有逻辑?任务怎么设,模型就被逼着往哪卷。出题的人,其实在决定模型的方向。

第二是评分标准权。靠规则验证器,还是靠Rubric加人工专家?过程分怎么给?安全、合规、成本、可回滚要不要进目标函数?标准一变,模型的强弱排序会整个重写。

第三是反馈数据权。最稀缺的不是"问题—答案",而是"环境—行动—结果—奖励"。谁能稳定生产可验证的轨迹,谁就卡住了后训练的供给端。

所以"判卷权"=评价标准+奖励信号+训练数据来源。它值钱,不是因为某套Benchmark有多权威,而是因为模型可以换,但反馈层会被反复调用。谁掌握了"什么算好"的定义权,谁就参与了决定下一代模型往哪走。

这三样东西,环环相扣。任务定义决定了模型被训练去做什么,评分标准决定了模型被训练去优化什么,反馈数据决定了模型用什么信号去改进。一个掌握了全套的公司,等于握住了"什么算好"这个终极问题的答案。而在大模型的下半场,这个答案比"谁的参数多"值钱得多——因为参数可以堆、算力可以买,但"好"的定义权,只有一个。

阿里腾讯罕见同框,和三道绕不过的坎

阿里的逻辑最直接。通义要后训练,阿里云的企业客户要验收。模型在公开榜上排第几,企业不买单;能不能进ERP改单据、进客服系统闭环工单、进研发流跑通单元测试,才决定采购。UniPat这类能力若嵌进阿里云的交付标准,等于把"模型行不行"的验收尺子攥在了自己手里。再加上前通义人的信任链,技术对齐成本低。

腾讯若跟投,逻辑不同:它不一定押UniPat某套Benchmark长盛不衰,而是押"模型中立"的反馈基础设施。微信、企微、广告、客服,将来不管接混元还是外部模型,都要回答"Agent稳不稳、流程通不通"。投资评测层,比赌单一模型更底层——模型会换,但"验收"这件事,永远需要一把尺子。

阿里腾讯罕见同框,信号不在感情,在共识:评测和后训练数据不是配套小功能,是Agent时代的采购前置条件。

但闭环之外,还有三道坎,绕不过去。

第一道是中立性

阿里领投、腾讯跟投,客户却包含其他大模型厂,公信力天然会被问:你给自家模型松Rubric吗?Scale AI就是前车之鉴。UniPat要么把验证器做透明,要么把商业评测和公开Benchmark分拆,否则"考官"迟早被质疑成"自家教练"。这在中文AI圈里,是尤其绕不开的一关——因为客户和股东,本身就是同一批巨头。

第二道是收入

现在能确认的是评测集和技术口碑,确认不了的是可持续的合同和毛利结构。后训练数据定制客单价高,但依赖头部实验室的预算——头部一收缩,收入就抖。

第三道是工程

真实SaaS环境、浏览器环境、多工具调用,维护成本极高。Benchmark被刷是常态,验证器漏判会直接污染奖励信号。能不能把评测变成可调用的RL环境,而不是发完榜就过时,决定它最终是数据公司,还是基础设施公司。

这三道坎,其实是一件事的三面:UniPat想做的是"中立的基础设施",但它的大股东之一偏偏是模型厂商阿里,它的收入又依赖这些模型厂商的预算,它的工程又得时刻跟上模型的进化。一个想当中立裁判的公司,同时要讨好选手、靠选手吃饭、还得比选手跑得快——这个处境,注定了它每一步都走在钢丝上。

回到那笔传闻中的3亿美元。大模型上半场拼谁参数大、谁卡多、谁语料狠;下半场拼的是,模型出来后,怎么知道它真的变好了,而不是只在榜上变好了。预训练吃互联网存量,后训练吃可验证反馈。Agent一落地,正确答案不再是单点输出,而是长轨迹里的状态一致、工具成功、异常恢复、业务可验收。

资本盯UniPat,不是盯它现在的收入,是盯它能不能做成模型公司的反馈神经系统:测模型、找弱点、出数据、给奖励、再训模型。交易落不落定另说,方向已经亮出来——选手还会继续卷,考场也开始被抢了。而考场一旦被抢下来,下一场比赛的规则,就不再由选手自己定了。‍

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。