虎嗅

10万亿参数大模型还没影,字节先造了个一级部门

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

字节跳动近期将分散在各业务线的数据团队整合为一级部门“AI数据与安全”,这背后是其研发超大规模(最高10万亿参数)AI模型的野心——由于创始人张一鸣明确反对“蒸馏外部模型”(抄别人的答案),字节必须自己解决数据供给问题;而当前整个大模型行业都面临“高质量数据荒”:公开互联网的优质文本快被用完,大厂们不得不通过买版权、雇专家、甚至扫描实体书等方式抢数据,还时常陷入版权纠纷(比如Anthropic因盗版书籍赔了15亿)。字节的这次组织调整,本质是为超级大模型提前“备粮”。

详细拆解

1. 字节把数据部门升为一级:不是小题大做,是“迫不得已”

字节这次成立的“AI数据与安全”部门,不是凭空新增,而是把原来分散在Global Data、数据中台DMC、Flow的AIDP平台等多个团队收拢整合。为啥要这么干?

因为大模型就像“超级学生”,参数越大(相当于大脑越发达),需要的“教材”(数据)就越多、越优质。字节要搞10万亿参数的模型,比主流模型大好几倍,对应的训练数据量也得同步翻倍。之前分散的团队各自搞数据,重复劳动多、效率低,现在整合为一级部门,直接和Seed(大模型部门)、抖音平级,就是要把数据当成核心工程来抓——毕竟,没有足够好的数据,再强的算力和算法也白搭。

而且字节在数据上已经砸了不少钱:Seedance的数据评测团队就有上千人(1个算法工程师配10个数据人员),今年在世界模型和Coding方向的数据预算已经到千万美元级。这早不是找外包做标注那么简单了,而是从采购、清洗、合成到评测的全链条工程。

2. 张一鸣不让“抄作业”:短期慢一步,长期要扎根

8月有消息说,张一鸣在Seed全员会上明确反对“蒸馏外部模型”。啥叫蒸馏?简单说就是把别人训练好的模型“压缩”一下,直接用人家的成果,短期能快速追赶,但长期会依赖别人,自己没有核心竞争力。

张一鸣选择“牺牲短期利益”,意味着字节必须自己从头积累数据。这就像学生不想抄同学的作业,就得自己啃课本、做练习册——虽然慢,但基础扎实。所以数据部门的升格,就是为了支撑这种“长期主义”:必须有专门的团队,把“找教材、编教材、改作业”这件事做到极致。

3. 大模型“吃”数据快到“粮荒”:公开互联网不够用了

过去大模型变强的逻辑很简单:参数更多+算力更强+数据更多。但现在问题来了——数据不够了。

DeepMind的Chinchilla论文说过:参数翻倍,训练数据量也得同步翻倍才能效果最好。但公开互联网上的优质人类文本(比如新闻、书籍、论文)是有限的。研究机构Epoch AI估算,考虑质量和重复利用,全球公开文本大概300万亿Token,按现在的消耗速度,2026-2032年就会被用完。如果模型还要“过度训练”(反复学同一批数据来降低推理成本),这个时间还会提前。

所以,大厂们不得不跳出公开互联网,去抢那些“围墙内”的数据:比如付费新闻、专业数据库、甚至没数字化的实体书。

4. 为抢数据,大厂们都拼了:买版权、雇专家、甚至“破坏性扫描”

数据荒逼得各家使出浑身解数:

  • 买版权:Google每年给Reddit6000万美元,买论坛内容;OpenAI和News Corp合作,用华尔街日报、泰晤士报的内容。
  • 雇专家:代码、数学、科学这些专业领域,直接请工程师、博士写数据、做评测——毕竟普通人写不出高质量的专业内容。
  • 扫描实体书:Anthropic更狠,启动“Project Panama”,批量买数百万册实体书,切掉书脊扫描数字化,花了数千万美元。甚至之前还从盗版图书馆下载书籍,结果被告,赔了15亿和解金。这15亿相当于给“高质量数据”标了个天价——好数据真的太值钱了。

5. 字节的10万亿模型梦:数据是最大的坎

字节要搞10万亿参数的模型,又不能抄别人的,等于给自己挖了个“数据大坑”:

  • 数据量需求爆炸:按Chinchilla规律,10万亿参数对应的训练数据量可能是现有主流模型的数倍,得从哪来?
  • 数据质量要求高:超级大模型需要的不是垃圾数据,而是精准、专业、无重复的优质内容,这需要大量人力和资金去筛选、标注。
  • 版权风险:如果字节也像Anthropic那样扫描实体书,会不会踩版权雷?这也是新成立的“安全”部分要解决的问题。

所以,这次数据部门升格,只是字节应对挑战的第一步。接下来,如何找到足够多、足够好、合法的数据,将是决定它能否在大模型赛道后来居上的关键。

最后一句话总结

字节的这次组织调整,是大模型行业“数据战争”的一个缩影——当算力和算法不再是唯一的壁垒时,谁能掌握优质数据,谁就能在未来的AI竞争中占得先机。而字节,正在为这场战争提前布局。