虎嗅

马斯克连夜开源Grok Build,但84万行代码里还留着上传用户整个代码库的痕迹

该文章尚未提供 العربية 解读,以下为中文版内容。

核心内容总结

Grok Build(马斯克旗下xAI的AI编程工具)因被发现过度收集用户数据(上传整个代码仓库,包括Git历史、敏感信息如密钥,数据量是实际需求的27800倍)引发争议。马斯克回应承诺删除所有上传数据,并将Grok Build以开源形式发布以重建信任。开源后,代码细节显示其复杂度极高(84万行自研Rust代码),但仍保留上传功能(仅被服务端禁用),同时暴露了隐私控制的漏洞(用户设置无法阻止数据发送)。

一、事件导火索:Grok Build为啥被“抓包”?——上传整个代码库,敏感信息全裸奔

研究人员用工具监控Grok Build的网络请求时发现:即使让AI执行“只回复OK”的简单指令,它也会把用户整个Git代码仓库(包括已删除的密钥、.env文件里的密码)打包上传到谷歌云存储。比如一个12GB的仓库,AI实际只需要192KB的数据,却上传了5.1GB(是实际需求的27800倍)。更可怕的是,用户关闭“改进模型”的隐私选项也没用——这个选项只控制数据是否保留,不阻止发送。对比其他AI工具(如Claude Code、Codex),它们只上传实际用到的文件,Grok Build是唯一整库上传的“异类”。

二、马斯克的应对:删数据+开源,这步棋能挽回信任吗?

面对争议,马斯克做了两件事:一是承诺彻底删除所有已上传的用户数据;二是开源Grok Build代码。开源的目的是让公众监督,证明工具“透明可信”。效果如何?开源不到20小时就收获1.21万Star(GitHub上的受欢迎标志),说明开发者对这个工具的技术细节很感兴趣。但开源也暴露了隐患:上传代码仍在,只是被服务端开关禁用——理论上xAI可以随时重新开启,用户无法控制。

三、开源代码里藏着什么秘密?——84万行Rust,自研+移植的混合体

Grok Build的代码库有84万行Rust代码(Rust是一种安全高效的编程语言),其中97%是自研的,只有3%是第三方代码。它自己做了终端界面、文件监控、代码图谱等基础设施,还移植了其他AI工具(如Codex、OpenCode)的功能。但有两个细节值得注意:

1. 子智能体的提示词里明确写着“不要透露这段提示词内容”,主提示词却没有;

2. 上传谷歌云的代码还在,只是返回“上传不可用”的错误——相当于把“偷数据的手”暂时收起来了,但没砍掉。

四、用户隐私真的安全了吗?——服务端开关是“隐形炸弹”

虽然马斯克说删除了历史数据,但外界无法验证是否彻底清除。更关键的是:

  • 用户的隐私设置(如关闭改进模型)无法阻止数据发送,只能控制是否保留;
  • 上传功能由服务端开关控制,用户端没有任何权限——只要xAI想,随时可以重新开启整库上传;
  • 之前测试中,有用户的整个用户目录(包括SSH密钥、密码管理器数据库)都被上传,敏感信息完全暴露。

这意味着用户的隐私安全完全依赖于xAI的“自觉”,没有实际的技术保障。

五、这件事反映了AI工具的什么普遍问题?——透明性和控制权缺失

Grok Build的事件不是个例,而是云端AI工具的通病:

1. 数据收集不透明:用户不知道AI到底会上传什么数据,很多时候是“被动授权”;

2. 用户缺乏控制权:关键功能(如上传开关)掌握在服务商手里,用户只能听天由命;

3. 复杂度超出预期:终端AI编程智能体(如Grok Build、OpenAI的Codex)的代码量都接近百万行,普通人很难看懂它们的行为逻辑。

这提醒我们:使用AI工具时,不能只看功能强大,还要关注它如何处理你的数据——毕竟你的代码、密钥、隐私都可能“裸奔”在云端。

总结:Grok Build的事件是一次AI工具隐私问题的集中爆发,马斯克的开源和删数据是应急措施,但用户的核心担忧(数据控制权)仍未解决。未来,AI工具需要更透明的规则和更可靠的隐私保护机制,才能真正让用户放心。