一年暴涨100倍,AI最被低估的生意爆发了

硅基观察Pro
个人专栏
热度: 3894

AI训练数据行业正经历爆发式增长,一年内多家公司收入飙升(如Handshake增长100倍),成为AI产业第三大细分赛道。驱动因素包括模型迭代加速、数据需求从项目制转向高频按需、单条数据复杂度与信息密度大幅提升、专家级人力替代众包及服务模式升级(如评测-定制-验证闭环)。行业趋势聚焦真实工作流数据(Type 1)和强化学习环境(RL),头部公司正从标注服务商向AI研发深度服务商、政企总包商、高端精品服务商等高价值环节迁移。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

AI数据,可能是这轮AI浪潮中最被低估的生意之一。

不久前,Menlo Ventures合伙人Deedy在X上发布了一张AI训练数据公司全景图。

真实工作流数据

图中一共收录了28家创业公司,合计年收入约85亿美元,总估值接近1000亿美元。仅从收入规模看,训练数据可能已经成为继AI算力和大模型之后,AI产业第三大的细分赛道。

更值得关注的是,它仍在高速增长。

2025年9月,Mercor的年化收入约为5亿美元;2026年2月突破10亿美元;到6月,已经超过20亿美元。九个月时间,收入增长了三倍,规模变成原来的四倍。

Handshake的增长更夸张。

它原本是一家经营了12年的大学生招聘平台,直到2025年初才切入AI训练数据业务。刚起步时,这项业务的年化收入只有500万—1000万美元;2026年1月,已经增长至5.5亿美元;到4月,第三方机构Sacra估算,其年化毛收入已经接近11亿美元。

也就是说,一年时间Handshake的收入翻了整整100倍!

更重要的是,这还是一个高度集中的赛道。Scale AI、Surge AI、Mercor和Handshake四家公司,拿走了全行业超过四分之三的收入。

短短一年时间,AI训练数据不仅长出了一个近百亿美元的市场,还迅速诞生了数家十亿美元收入规模的公司。

那么,AI数据公司为什么会在今年突然爆发?今天,硅基君就来聊聊这门被长期低估的生意。

为什么数据公司开始集体印钞?

之所以数据公司赚钱越来越多,一个很重要的原因是,数据在模型训练中的角色变了,从一次性投入的原材料,转变为持续消耗的燃料

在大模型发展的早期,数据采购是项目制的。实验室在训练开始前备好数据集,跑完一轮训练,下一次采购要等到下一代模型立项,中间往往隔着一年半载。这决定了数据公司的收入是脉冲式的——有订单时忙一阵,交付完就进入空窗。

模型迭代节奏的加快,改变了这个模式。

2022年底ChatGPT上线,四个月后,OpenAI发布GPT-4。此后,GPT-4到GPT-4o间隔了13个月。到了2026年,GPT-5.4在3月推出,GPT-5.5在4月跟进,间隔只剩一个月。

Anthropic的节奏更快。5月底发布Opus 4.8后,仅过了11天,又在6月9日推出旗舰模型Claude Fable 5。

迭代越快,实验室发现的能力缺口就越多,对"新增的、针对性的、高价值数据"的需求也就越频繁。

数据采购从一年几次的项目,变成了随时发起的日常动作。供给端随之调整,Scale AI 的交付模式已经从按月打包,升级为 API 按需交付——客户发起标注任务,最快一小时就能拿到生产级的标签数据。

需求频次在上升,单位需求的数据体量也在同步膨胀,因为模型要学的任务变复杂了

代码智能体是最直观的例子。早期模型练代码,学习范围相当有限:行业基准 SWE-bench Verified 只覆盖 12 个 Python 仓库,模型翻来覆去学的是十几个项目的代码风格。

2025 年 9 月发布的 SWE-bench Pro,把范围扩张到 41 个仓库、4 种编程语言——模型要理解的问题域,从"一种语言、十几个项目"变成了"四种语言、四十多个项目"。

比覆盖面扩张更关键的,是单条数据的信息密度。

SWE-bench Verified 的任务平均只需修改 11 行代码,Pro 的任务平均要修改 107 行、跨越 4 个文件。

一条训练样本也不仅仅是"改几行代码",而是一整套包含需求理解、多文件定位、跨文件修改、测试验证的完整数据包——单条样本的容量,从几百个 token 涨到了几万个 token。

采购频次更高,场景更多,每个场景的单条数据更重。三个因素叠加,训练数据的总需求量被推高了一个数量级。

除了数量的增长,数据的价格也水涨船高

最早的数据标注按件计酬,NLP 基础文本标注一条约 0.02 美元;进入专家标注时代后,计价单位变成了时薪——Scale AI 的 STEM 专家时薪 30 到 50 美元,通才 15 到 30 美元;Mercor 的 STEM 专家时薪达到 90 到 110 美元。

供给侧的人从众包工人换成了博士和执业律师,成本上升自然推动价格上涨。

但仅靠人力涨价,撑不起这个行业的毛利率。更深层的变化是,数据公司与模型研发的结合更加紧密。

以Scale AI为例,它会先帮助客户评测模型,判断模型在哪些任务上表现较差,再针对这些能力缺口设计训练任务,组织专业人员生产数据,最后重新评测,验证模型能力是否得到提升。

也就是说,AI数据公司从简单的劳动力外包,转向开始承担部分模型研发、评测和工程服务的工作

数据公司赚的也不再是标注的人工费,而是深度参与模型研发所产生的服务溢价。利润率的变化反映了这一点。Mercor 的毛利率从早期的约 27% 提升到目前的 35%-40%,Scale AI 长期保持在 50% 以上,而传统人力外包公司的毛利率普遍只有 15%-20%。

当数据直接决定模型的能力上限,它的定价权自然水涨船高。而整个行业的天花板,也随之被彻底打开。这才是AI训练数据公司开始集体“印钞”的真正原因。

AI数据的两个趋势:真实工作流数据和RL环境

除了赚钱越来越多,AI数据行业也在发生新的变化。 

第一个变化,是真实工作流数据正在取代人工标注数据,成为新的稀缺品。

业内把训练数据分为两类:人工设计任务、由专家完成的,是 Type 2;从真实业务中直接捕获的,是 Type 1。

过去行业的主流供给是 Type 2,因为它可控、可规模化。但随着模型能力增强,Type 1 数据的边际收益正在快速上升:模型已经学会了"做题",现在需要学习真实世界里的工作是怎么完成的。

代码领域已经验证了这一点。大模型之所以在代码能力上进步最快,一个重要原因是 GitHub 是全球最大的 Type 1 数据宝库。

一条 commit 记录串起了问题描述、修改方案、代码评审和测试结果,完整保留了一个问题从出现到解决的全链路。其他领域缺的不是需求,而是像 GitHub 这样现成的数据源。

于是,供给端开始主动制造 Type 1 数据源。

四巨头中,Handshake 走得最激进:2026 年初,它与 OpenAI 达成合作,组织数千名自由职业者上传真实的日常工作成果,从原生的 Word 文档、PPT、Excel 表格到代码仓库。今年4 月,它进一步启动"雇主数据计划",直接付费从企业采购真实运营数据。

不断扩大的市场也在催生新玩家。Protege、Sunset、SF Data 等公司陆续冒头,核心业务只有一件事:帮企业把内部的工作流数据,加工成模型可训练的格式。

Protege 是其中的代表。这家 2024 年成立的公司聚焦医疗数据,这是一个需求旺盛但供给极难打通的领域:

受合规和内控约束,医疗数据的传统采购流程通常需要数月甚至一年以上。Protege 把交付周期压缩到了 30 天,靠的是把采购流程中最耗时的环节全部前置。

具体来说,Protege 的做法分三步:

第一步是提前聚合:单一数据源凑不齐数百万份影像,Protege 预先对接了上百家数据合作伙伴,所有数据源在入库前就完成了 AI 训练适用性预审,砍掉了传统采购中"先找数据、再谈合规、再谈价格"的反复拉扯。

第二步是精筛,AI 公司要的是有诊断价值的"阳性发现"(即异常病例),Protege 的数据实验室开发了定制化筛选技术,只保留高价值的阳性样本。

第三步是合规打包,所有数据源被纳入单一许可协议,客户签一份合同就能合法使用来自几十个数据源的数据;数据全部完成去标识化处理,全程符合 HIPAA 要求,同时通过收入分成机制让数据持有方持续获益,既保证了供给的连续性,也让授权结构可以重复使用。

Protege做的事,本质上就是给AI实验室当“数据买手”。当模型训练从“喂课本”变成“喂真实世界的工作记录”,这种连接数据持有方和模型厂商的中间层,就成了绕不开的基础设施。

第二个变化,是 RL 环境正在取代静态数据集,成为实验室的采购重点

RL 环境即强化学习环境,一个可控、可交互的模拟世界。如果说静态数据集是课本和标准答案,RL 环境就是给 AI 搭建的训练场:模型在其中自主探索、反复试错,做对了获得奖励,做错了受到惩罚,直到练出稳定的任务执行能力。

这个变化背后,是 AI 正在从"对话时代"进入"智能体时代"——模型的核心能力要求,从回答问题变成了完成任务。而完成任务的能力,靠静态数据教不会,只能在环境里练出来。

围绕这个新需求,市场目前有两种玩法。

一种是模型厂商自建:OpenAI 训练 ChatGPT Agent 所用的"UI Gym"浏览器环境,据 SemiAnalysis 估算,单个网站环境的搭建成本约 2 万美元,而 OpenAI 已经采购了数百个网站用于训练。

Anthropic 内部则讨论过,一年在 RL 环境上的投入可能超过 10 亿美元。

另一种是外包给数据公司。

Mercor 今年 7 月收购软件仿真公司 Deeptune,看中的正是这块业务——Deeptune 复刻了 Excel、Salesforce、Slack、Zendesk 等上班族日常使用的办公软件,做成高度仿真的沙盒环境。

据公司透露,Mercor 计划在 2026 年 9 月前,将 RL 环境业务的 ARR 提升至千万美元级别。

头部玩家开始分化

底层逻辑在变,四家头部公司的路线选择也随之分化。它们切入市场的资源禀赋不同,走的路各异,但方向一致:都在从"数据供应商"向价值链更深处迁移。

Scale 在向下游走,目标是成为"政企 AI 总包商"

这家 2016 年成立的公司是行业里资历最深的玩家,如今已不满足于数据生意本身,而是基于数据集优势,为政府和大型企业客户开发内部 AI 应用。

这块企业级应用业务的年化收入已达 2 亿美元,CEO 预计 18 个月内将反超传统数据标注,成为公司最大的收入来源。

Surge 在向上走,做高端精品。这家 2020 年成立的公司只有 110 人,未拿过一分钱外部融资,却做出了 12 亿美元营收。

它坚决不碰众包,只做高难度的 RLHF(基于人类反馈的强化学习)和安全评估,客户名单上只有五家顶级实验室:OpenAI、Google、Microsoft、Meta 和 Anthropic。

Mercor 在横向扩张专家网络。它是四家中最年轻的,2023 年才成立,但增长最快——估值从 2025 年 10 月的 100 亿美元,几个月内翻倍至 200 亿美元。

它构建了一张覆盖全球的专家网络:招募博士、律师、银行从业者、科学家和程序员制作专业训练数据,每天向 3 万名外包人员支付的报酬超过 400 万美元。

收购 Deeptune 进军 RL 环境,则是它在专家网络之外压下的第二注。

Handshake 做的是管道生意。12 年大学生招聘业务,让它左手握着 1800 万求职者,右手连着 970 家财富 500 强企业。

Handshake更愿意充当数据管道:一边组织职场人上传原生的 Word、Excel 和代码,一边付费从企业采购真实运营数据,转手供给 AI 实验室。

它是四家中唯一一个几乎不生产数据、只搬运数据的玩家——而在 Type 1 数据成为稀缺品的当下,掌握供给两端的管道,可能恰恰是最稀缺的位置。

把四条路线放在一起看,这个行业的演化方向已经清晰:单纯的数据标注正在贬值,被压缩为整个价值链中利润最薄的一环,所有人都在往价值链更深处迁移

上一代互联网巨头的能力边界,很大程度上由它们掌握的数据决定。这一轮 AI 竞赛中,同样的逻辑正在重演——只是这一次,数据不再是巨头的副产品,而是一门独立的、正在奔向千亿美元的生意。

本文来自微信公众号“硅基观察Pro”,作者:元元

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。