扫描下载APP
其它方式登录
AI模型后训练催生专业评测与数据服务新赛道,UniPat、Mercor、Surge AI等公司通过提供专家评估、动态评测基准和强化学习环境,帮助大模型公司识别缺陷并优化性能,形成高增长、高毛利的新型AI基础设施服务。
SaaS-Bench 是一项面向真实办公场景的AI Agent评测基准,通过在23个真实部署的开源SaaS系统中运行106个跨应用、长流程、多步骤任务,揭示当前主流Agent(如Claude、Gemini等)端到端完成率极低(Claude最高仅3.8%),暴露其在状态保持、错误恢复、闭环验证和路径稳定性等方面的结构性缺陷,戳破‘全自动办公’幻象。