虎嗅

字节AI数据部门“升咖”,但还是没有交给科学家

该文章尚未提供 العربية 解读,以下为中文版内容。

核心内容总结

字节跳动最近把分散在各业务线的AI数据团队整合起来,成立了AI数据与安全部(和大模型部门Seed、Flow等平行),负责给旗下所有大模型提供跨模态数据服务。原负责人傅越离职,新负责人王赢磊是TikTok业务出身(管过直播和平台治理),而非模型研究员。这一调整是因为字节坚持大模型“自研路线”(不搞“蒸馏”捷径),数据从幕后支持变成公司级核心能力;同时也反映了行业趋势:AI数据生产已从“收集互联网”转向“主动制造”,成为科技公司的新基础设施,但字节的组织选择(用业务管理者而非研究员掌舵)也带来了“数据生产如何贴近前沿研究”的悬念。

一、为什么字节要把AI数据团队升为一级部门?

简单说:数据现在是大模型的“命根子”,分散着干不行了。

字节之前的AI数据能力是“东一块西一块”:有Global Data、数据中台DMC、Flow旗下的AIDP等,散在不同业务线。但自从张一鸣和梁汝波明确“不搞蒸馏(让小模型抄大模型答案)、坚持自研”后,数据的重要性就变了——自研模型需要持续、高质量、多样化的数据(比如文字、视频、代码、世界知识等),而且得跨业务统一调配。

举个例子:以前Seed模型要数据,可能得找Global Data要,TikTok模型要数据又得找另一个团队,效率低。现在整合后,就像建了一个“数据中央厨房”,所有模型需要什么数据,都能从这里统一供应,还能解决版权、隐私这些大问题。

这就像你开餐馆,以前买菜的、切菜的、洗菜的各干各的,现在把他们整合成一个厨房,统一给所有餐厅(模型)供货,既省成本又保证质量。

二、新负责人为啥是业务出身,不是模型研究员?

字节选王赢磊(TikTok前直播/平台治理负责人),而不是AI科学家,有两个原因:

1. 数据部门是“平台型组织”,需要中立和管理能力:这个新部门要服务所有模型(Seed基座、抖音业务模型、Coding模型等),如果让某个模型研究员来管,可能会偏向自己的模型需求。而王赢磊是业务运营出身,擅长组织管理和跨部门协调,能公平分配资源,把上千人的团队、千万美元的预算管好——毕竟数据生产现在是“规模化工程”,不是小实验室的活。

2. 安全合规是硬需求:王赢磊管过TikTok的平台责任(内容治理、安全合规),而数据部门还要负责数据的版权、隐私问题(比如用别人的内容会不会侵权?用户数据会不会泄露?),这正好是他的强项。

但这里也有个悬念:现在数据生产越来越像“研究”。比如模型哪里笨了?需要什么样的数据才能变聪明?这些问题不是写个需求单就能解决的,得懂模型的人才能判断。DeepSeek让核心研究员亲自标数据,就是为了缩短“发现问题→生产数据→训练模型”的反馈链。而字节让业务管理者管数据,会不会让反馈变慢?这是个待解的问题。

三、AI数据生产现在变成啥样了?不是“爬互联网”那么简单

以前大模型数据主要靠“爬”互联网,但现在不行了:

  • 互联网数据不够用:Cloudflare说机器人流量已经超过人类,五年后可能是人类的1000倍——互联网就像个粮仓,越吃越少,而且里面只有“答案”没有“思考过程”(比如一道数学题,互联网只有结果,没有解题步骤)。
  • 数据要“主动生产”:模型缺什么,就造什么。比如模型不会写代码,就找程序员写;模型不懂法律,就找律师编案例;甚至要造“虚拟环境”让模型练习(比如模拟Excel让AI学操作,模拟浏览器让AI学搜索)。

这就像以前你做饭只靠菜市场(互联网),现在菜市场不够了,你得自己种蔬菜(标注数据)、养家禽(合成数据),甚至建个厨房让厨师练手(强化学习环境)。

行业里的变化更夸张:招聘平台Handshake现在靠组织博士、律师生产数据,一年收入从千万美元涨到10亿美元;谷歌要花15亿买虚拟工作环境公司;Meta收集员工的键盘鼠标操作数据,让AI学怎么干活。数据已经从“原材料”变成了“定制化产品”。

四、这场调整背后的行业趋势:数据成了AI公司的“新基建”

字节的调整不是孤例,整个行业都在围绕数据重组:

  • 腾讯:虽然没成立一级数据部门,但在挖字节的数据人才(薪资翻几倍),还从50多个业务里收集反馈喂给模型,把“数据质量”列为模型增长的关键。
  • DeepSeek:让一半核心研究员标数据,因为“解决AI问题靠的就是标数据”。
  • Meta:为了数据买了Scale AI 49%的股份,现在Scale一半的业务都是做强化学习环境。

简单说:AI竞争已经从“比模型算法”变成“比数据生产能力”。谁能更快、更准地生产出模型需要的数据,谁就能在长期竞争中领先。而字节把数据部门升为一级,就是在押注这个“新基建”。

五、字节的选择:是优势还是风险?

字节的做法很“字节”——擅长用组织能力把事情做大:把数据生产变成专业平台,用业务管理者管规模。但风险也在这里:

  • 反馈链会不会变长? 模型变化快,今天有用的数据明天可能就没用了。如果研究员要数据得先找业务管理者审批,会不会错过最佳调整时机?
  • 数据生产和研究会不会脱节? 现在数据生产需要懂模型的人参与,如果管理者不懂模型,能不能判断哪些数据值得投钱?

不过字节也有自己的逻辑:自研模型是长期战,数据生产需要规模化、合规化,业务管理者能把这些基础打好。至于怎么平衡“规模”和“前沿性”,就是王赢磊接下来要解决的难题了。

总的来说,字节的这次调整,既是对大模型自研路线的坚定支持,也是对AI数据生产新趋势的回应。它告诉我们:AI时代,数据不再是“免费的午餐”,而是需要花大钱、搭组织、拼能力才能拿到的“核心燃料”。谁能把这个燃料管好用好,谁就能跑在前面。