虎嗅

前员工开的AI评测公司,阿里领投25亿美元估值

核心内容大白话总结

最近AI圈藏了个没上热搜的大交易:阿里打算领头给几乎没什么公众知名度的AI初创公司UniPat投3亿美元,直接把这家成立才不到2年的小公司估值抬到25亿美元,腾讯、红杉中国等头部机构也在跟进谈判。这家公司既不做大模型也不做聊天机器人这类C端应用,干的是AI圈的“特级考官”活:专门设计各种贴近真实工作、甚至涉及未来事件的测试场景,既解决了全球大模型行业“网上可爬的人类数据已经用光、榜单分数全是水分”的普遍痛点,又靠“用高质量标准答案省算力”的思路,刚好适配中国AI产业被芯片卡脖子的现实需求。阿里抢着投本质不是赚点投资回报,是给自己正在狂奔的AI商业化生态,提前拿下一套全行业认的“AI能力验收标准”,未来甚至可能靠这套标准掌握整个AI产业链的话语权。

---

分点详细解读

1. 别拿它当传统数据标注厂,它是专门给AI出“实战考题”的特级考官

很多人听到做数据、做评测,第一反应就是以前雇人给图片打“猫/狗”标签的外包厂,卖的就是人工时间,赚点辛苦钱。但UniPat干的活完全是降维打击:

  • 它出的题根本不是网上随便搜得到的死题,全是从真实场景里抠出来的实战任务:比如从GitHub真实开源项目里扒代码改bug的需求,测试AI能不能真的写完代码不报错;比如让AI提前预测大选、球赛、政策走向这类还没发生的事,等结果出来了再反过来给AI改作业;甚至医疗、法律题不仅看答案对不对,还要揪出“答案看起来没问题但漏了关键禁忌症、会出人命”的隐形错误。
  • 它出的考卷现在连美国的顶尖AI实验室都主动引用到自己的模型报告里,比现在市面上大家吐槽“水分十足”的AI排行榜靠谱得多,直接解决了行业的老痛点:以前很多大模型刷榜分数全球第一,真拿去企业里跑个报销流程都能错漏百出。

2. 它踩中了全AI行业的刚需,更是适配中国“缺算力”的最优解

现在全球AI圈都遇到了两个绕不开的死结,UniPat的业务刚好精准踩中了破局点:

  • 第一个是“缺原料”:互联网上能爬的小说、新闻、帖子这类人类生成的公开数据,已经被各大模型公司爬得差不多了,再想训更强的模型根本没新的训练素材。
  • 第二个是“算力太贵”:现在想堆出更强的模型,就要买更多高端芯片,光一台H100芯片就十几万人民币,国内还被禁运,根本不可能像美国公司那样无限堆卡砸钱。

而UniPat的思路相当于“用高质量的改作业标准,代替堆算力”:以前你喂给AI的训练数据只有“答案对不对”这一个判断,现在它给的标准答案细到“哪一步错了、为什么错、漏了什么关键规则”,用这种高质量的监督信号喂小模型,小模型在专业任务上的表现能追上参数大好几倍的大模型,等于你花1块钱的算力成本,能产出3块钱的效果,完全是给缺芯片的中国AI产业量身定做的升级路径。现在这个赛道的公司几乎全是成立不到2年,头部几家收入已经破1亿美元,热度比大家看到的高得多。

3. 阿里砸3亿根本不是财务投资,是给自己的AI帝国补最缺的一块拼图

阿里这次出手完全是战略卡位,根本不是想等公司上市赚几倍差价,你看它最近的组织调整就懂了:

  • 今年阿里直接把通义大模型团队和未来生活实验室合并,交给集团CEO吴泳铭亲自管,目标是把大模型、云服务、企业AI应用全串起来做完整链条,现在阿里云的AI相关收入一年涨45%,卖算力、卖模型的生意已经做起来了,但卡在一个最尴尬的环节:你跟企业客户吹我家通义大模型特别牛,客户凭什么信你?
  • 以前拿公开榜单的分数当证明,客户拿回去用发现根本干不了自己公司的活,下次肯定不掏钱。阿里现在最需要的就是一套中立、靠谱的“AI验收标准”:你买我家的AI智能体,能不能真的在你公司的财务系统里跑报销、能不能真的改代码不出错,全靠这套标准说了算。投下UniPat等于阿里提前把这套裁判规则握在手里,以后从训自己的大模型,到给企业交付AI服务,全用统一的验收标准,相当于开驾校的同时自己掌握了驾照考试的出题权,出来的学员上路真能开,客户自然愿意掏钱。

4. 这家小公司的终极野心是当AI时代的“ISO认证机构”,但有两个绕不开的生死坑

现在给UniPat估25亿美金,赌的根本不是它赚点评测服务费的小生意,而是它未来能成为AI行业的标准制定者:就像现在所有电子产品要过ISO质量认证才能进正规渠道卖,以后所有大模型要进企业采购、要落地商用,都得过UniPat的评测,那它就不再是产业链的小配角,是掌握准入权的规则制定者,话语权比很多大模型公司还大。

但它现在面前摆着两个几乎很难绕开的大坑:

  • 第一个是“独立性”难题:阿里是它的第一大股东,以后它出评测报告,阿里的通义大模型排第一,腾讯、字节的大模型排后面,全行业都会质疑它偏私,别的大模型公司根本不敢用它的评测标准,客户也不会信结果的公平性。
  • 第二个是“刷榜”死循环:只要它的测试集、评分标准被摸透,大模型公司完全可以针对性训练,专门应付它的考题,最后考分全是满分,一到真实场景全拉胯,最后整个评测体系就成了没人信的皇帝新衣。能不能跨过这两个坎,才是这家25亿估值公司的真正考验。