字节跳动成立AI数据与安全一级部门

Nashnova编辑部
Published todayAbout 4 min read

字节跳动将多支分散的数据团队整合为第三个AI一级部门——AI数据与安全,与Seed、Flow平行,这意味着数据供给正从辅助职能升格为大模型竞赛的核心战场。

01

这个新部门到底管什么?

新部门由原TikTok旗下的Global Data、集团数据中台DMC、以及Flow下属的AI数据平台AIDP等多支团队整合而成。
核心职能是为字节所有大模型提供跨模态数据服务,覆盖数据生产全流程:标准制定、寻源采购、合成清洗、质量评测。
这意味着→ 字节把原本散落在各业务线的数据能力收拢到一个横跨基座模型到应用层的统一组织,目标是一个入口服务全部模型
02

谁来带队,为什么是他?

负责人王赢磊(Adam Wang),此前担任TikTok平台责任负责人和TikTok直播负责人。
据接近字节的人士透露,他负责的直播业务曾是TikTok最主要的营收来源之一
用大白话说= 字节选了一个做过大规模商业化运营的人来管数据,而不是纯技术背景——这反映出数据部门的定位不只是"采集标注",还包括预算核算和供应商管理。
03

为什么要把数据提到这么高的位置?

直接原因:字节坚持"坚决不蒸馏"的自研路线。张一鸣在7月底Seed全员会上明确表态;CEO梁汝波8月5日全员会上也说"坚定自研,接受短期落后,坚持优化长期"。
这意味着→ 不蒸馏(不从别人的模型里提取能力来走捷径)就必须靠自己的数据质量和规模拉开差距,数据团队的战略地位因此被推到一级部门。
实际投入已经很重:2026年初世界模型和Coding模型的数据预算已超千万美元级别,且"觉得不够可以随时追加"。
04

这笔投入有多大、花在了哪里?

仅为视频生成模型Seedance做数据评测的团队就有上千人,每位算法工程师背后配有十余位数据同事
Seedance 2.0的成功被多位从业者称为"一场数据的胜利"
目前数据团队已采取赛马机制(多个团队同时跑同一方向、优胜劣汰),按世界模型、代码、高难学科等方向划分,每个数据项目均需核算投入产出比。
05

全行业的数据军备竞赛到了什么程度?

腾讯近半年频繁以高达三倍薪资从字节数据团队挖人;阿里巴巴、腾讯的数据采购预算也明显增长,部分大厂已设定数据集独家期限或阶段性买断供应商核心人员。
全球头部公司的外部数据预算正以每年数十亿美元的量级膨胀:Anthropic仅2025年就为强化学习数据拨出超10亿美元预算。
数据服务公司Mercor年化收入从去年的5亿美元增至今年年中的20亿美元,其中91%来自OpenAI、Anthropic等头部模型公司,估值飞涨至200亿美元
06

整合之后最大的挑战是什么?

新部门涉及多个原有团队整合、业务多有重叠,字节目前仍在持续梳理架构、优化人员
这反映出一个现实矛盾:数据组织已达千人规模,但大模型前沿变化极快——组织越大,响应速度越容易下降。
用大白话说= 这次架构整合能不能真正转化为模型竞争力,取决于一个千人团队还能不能像百人团队一样快速转向

Content is for reference only, not financial advice.

字节跳动成立AI数据与安全一级部门 · nashnova