第一财经

全球AI监管的下半场:数据成为战略资源后,谁来定义标准

核心内容总结

这篇新闻围绕AI时代的数据治理展开,核心观点是:数据已成为战略资源,其价值分配的关键不在于“谁拥有数据”,而在于“谁制定数据使用的规则和标准”。全球目前形成了欧洲(重规则与标准)、美国(重市场与投资)、亚洲部分地区(重基础设施与标准制定雄心)三条不同的推进路径;发展中国家面临“只提供数据原料却无规则话语权”的风险;AI企业普遍存在数据抓取不规范、缺乏溯源的问题;标准不兼容会阻碍科学进步,因此需强调标准“兼容”而非“统一”。

一、数据治理的核心:不是“谁拥有”,而是“谁定规则”

以前大家可能觉得“谁有数据谁牛”,但现在不一样了——数据的价值怎么分,要看谁来写使用规则。比如,同样是医疗数据,要是A国定了“AI就绪数据”(整理好能直接给AI训练的 data)的标准,那其他国家想用这些数据训练AI,就得按A国的规则来,收益自然也更多流向A国。UNCTAD说,现在数据治理的焦点已经从“谁占有数据”变成“谁定义数据能用、怎么用”,这就像玩游戏,定规则的人总能占最大便宜。

二、全球三大路径:欧洲、美国、亚洲各有打法

目前全球数据标准的竞争分三条路走:

  • 欧洲:强制规则+标准先行

欧洲把“开放数据”写进了科研资助里——比如“地平线欧洲”计划要求,拿了资助的研究,数据默认要开放;还推了FAIR原则(让数据好找、能访问、能互相用、能重复用),以及让论文免费读的PlanS。另外,GDPR(个人数据保护法)和AI法案给企业和研究者划了红线,必须合规。

  • 美国:市场主导+政策摇摆

美国靠市场驱动,比如国立卫生研究院要求科研项目提交数据管理计划,但政府政策不稳定——2022年白宫要求联邦资助的研究数据免费开放,结果特朗普上台后要废掉这个指令。所以美国吸引了更多资本投AI数据,但规则没欧洲稳。

  • 亚洲部分地区(比如中国):基建快+想自己定标准

亚洲在数据基础设施(比如存储、处理数据的系统)上推进很快,而且不想被动跟着欧美规则走,有自己制定标准的野心。

这三条路各有优劣:美国钱多人多,但规则乱;欧洲基础扎实,但可能限制创新;亚洲基建强,正在争取话语权。

三、发展中国家的困境:成了“数据原料供应商”

最让人担心的不是欧美亚的路径差异,而是“有没有AI数据基础设施”这条鸿沟。比如非洲的DNA样本,多年来被采集后运到欧美分析,研究成果和工具都在欧美,非洲自己只能提供原料,像农民种了菜卖给别人,别人做成大餐赚大钱,农民只拿点辛苦钱。UNCTAD警告,发展中国家如果没有自己的AI数据基础设施,就只能当“供应商”,既没法参与规则制定,也分不到收益。

四、标准不兼容的代价:科学进步被“征税”

如果各国数据标准不兼容,就像不同国家的插头不一样——你带个电器去别的国家,得买转换头,浪费时间和钱。科学研究也是如此:

比如罕见病,每个国家可能只有几百个病例,单独看找不到病因,但把欧洲、亚洲的病例合起来就能找到。如果数据标准不兼容,没法合并,那这个发现就会迟到甚至永远不会来。希尔把这叫做对科学的“直接课税”:研究者要重复劳动,科学进步变慢,公众要等更久的治疗,甚至等不到。所以他说,标准不用完全一样,但必须能互相用(兼容)。

五、AI企业的“数据乱象”:抓数据不问来源,缺溯源

很多AI企业用数据的方式很粗暴——先大规模抓取,来源问题事后再说,甚至不管。希尔说,AI公司用别人的数据,应该像研究者一样:知道数据从哪来、给数据提供者署名、尊重使用规则。比如,把数据打包成AI能用的“成品包”时,要把来源信息带上,不能去掉;数据质量认证得让独立专家来,用明确的标准一条条检查,不能凭感觉打分。只有这样,数据才可信,收益分配才公平。

总的来说,AI时代的数据治理,本质是规则和标准的争夺战。谁能制定兼容又合理的规则,谁就能主导数据价值的分配,同时避免科学进步被阻碍、发展中国家被边缘化。