头部 AI 实验室和大型企业持续加码模型训练,带动训练数据与数据标注行业快速扩张。TechCrunch 援引知情人士称,成立四年的 Micro1 在过去八个月里将年化总流水从 1 亿美元提升至 5 亿美元,显示这一赛道仍在快速放量。
八个月内升至5亿美元
按知情人士说法,Micro1 目前的年化总流水约为 5 亿美元。公司通常雇佣医生、律师、科学家等领域专家,以合同形式参与数据生产与标注。按这一模式估算,Micro1 实际留存的收入比例约为 60% 至 70%,对应净年化收入约在 1.5 亿至 2 亿美元之间。
虽然规模仍落后于部分同行,但市场需求显然足以支撑多家供应商同时增长。报道提到,Mercor 今年夏季的年化收入已达到 20 亿美元,Handshake 也在更早前达到 10 亿美元。
- 年化总流水:约 5 亿美元
- 净年化收入:约 1.5 亿至 2 亿美元
- 过去八个月起点:约 1 亿美元
合成数据拉高利润率
Micro1 目前正更多使用无需人工参与的合成数据生产方式,例如自动生成视频内容描述。知情人士称,这类业务让公司合同规模继续扩大,也有助于后续利润率提升。
另一项变化是,部分数据产品可以向多个客户重复销售,而不是只服务单一客户。对于这类“现成数据集”,其毛利率据称可达到 80% 至 90%。这意味着,训练数据公司正从传统的人力密集型标注,逐步转向更标准化、可复制的产品模式。
- 现成数据集毛利率:约 80% 至 90%
- 业务方向:合成数据、可重复销售数据集
数据销售去向引发讨论
不过,可重复销售的数据集也带来争议。批评者认为,如果这类标准化数据被出售给中国 AI 开发者,可能会帮助其模型更快接近美国头部模型的能力水平。
Micro1 创始人 Ali Ansari 上月在 X 平台表示,公司不像部分同行那样向中国模型开发商出售数据。他还称,一些人力数据公司与“外国对手”合作,而 Micro1 不会采取这一做法。
从招聘转向数据业务
与 Mercor 类似,Micro1 最初是一家 AI 招聘公司。Ansari 发现,一些数据标注客户会使用其 AI 平台筛选并招募工程师参与标注工作,随后决定将业务重心转向训练数据。
除模型输出评估外,Micro1 还在建设机器人预训练数据集,做法是让数百名普通参与者在家中记录日常物体交互过程。这类数据通常用于训练机器人理解和执行现实环境中的基础动作。
报道还提到,Micro1 于去年 9 月以 5 亿美元估值完成 A 轮融资。TechCrunch 了解到,这家公司近期可能又完成了新一轮融资,估值较上一轮明显提高。对于相关信息,Micro1 未回应置评请求。










