扫描下载APP
其它方式登录
阿里巴巴拟领投AI评测与后训练公司UniPat约3亿美元,聚焦大模型下半场核心能力——Agent时代的真实任务评测与反馈闭环。UniPat通过SaaS-Bench、EvoCode-Bench等生产级评测集,构建从环境模拟、失败轨迹分析到强化学习数据供给的完整链条,争夺定义‘模型好不好’的判卷权,即任务定义权、评分标准权和反馈数据权。
文章聚焦中国新一代AI数据服务创业公司崛起现象,以UniPat、智能知识、Copula Lab为代表,分析其创始人多来自阿里、字节、MiniMax等大厂模型团队,专注于AI模型后训练数据合成、强化学习环境构建与专业化评测,满足模型厂商从‘采购数据’转向‘购买能力提升’的新需求,推动AI产业链向专业化分工演进。
AI模型后训练催生专业评测与数据服务新赛道,UniPat、Mercor、Surge AI等公司通过提供专家评估、动态评测基准和强化学习环境,帮助大模型公司识别缺陷并优化性能,形成高增长、高毛利的新型AI基础设施服务。
SaaS-Bench 是一项面向真实办公场景的AI Agent评测基准,通过在23个真实部署的开源SaaS系统中运行106个跨应用、长流程、多步骤任务,揭示当前主流Agent(如Claude、Gemini等)端到端完成率极低(Claude最高仅3.8%),暴露其在状态保持、错误恢复、闭环验证和路径稳定性等方面的结构性缺陷,戳破‘全自动办公’幻象。