虎嗅

建一台望远镜花十几年,天文数据却只“开采”了表层,AI能否激活宇宙档案

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

随着全球第四代巡天设施(如中国的CSST“中国哈勃”)将天文探索推入100PB(约1亿GB)量级的大数据时代,我国科学家正试图搭建“集中式AI中枢”来解决数据分散、利用率低的问题——让不同望远镜的数据交叉关联、反复挖掘,产生新科学发现;同时,天文研究的极端环境(高海拔、太空)能成为国产芯片、存储等硬科技的“压力测试场”,反向推动产业技术突破,但数据统一的实操难题仍需通过统一接口、共性框架等方式解决。

1. 天文大数据时代来了,但分散的数据只挖了表层

现在的天文研究像“开矿山”——望远镜(比如CSST)就是挖矿工具,产出的海量数据里藏着宇宙起源、演化的“金子”,但目前各家数据分散在不同团队手里,大多只被用一次就归档“沉睡”,相当于只挖了矿山表层。

比如CSST这类第四代巡天望远镜,要对宇宙做“人口普查”,产生100PB级数据(相当于1亿部1GB的电影),但处理这些数据需要精密清洗、校准,任何算法偏差在大尺度下都会被放大。更关键的是,很多科学发现是数据反复交叉比对出来的(比如把光学数据和红外数据放一起看),分散的数据根本做不到这点,浪费了望远镜十几年建设的投入。

2. 集中式AI中枢:让沉睡的数据“活”起来

科学家想建的“集中式AI中枢”,不是把所有原始数据都堆到一个地方(因为数据太大、有些还不能公开),而是通过统一的接口或协议,把分散的数据连成交互网络。

举个例子:以前A望远镜的光学数据和B望远镜的红外数据是“各玩各的”,现在通过AI中枢,能在同一框架下关联起来,科学家可以用同一批数据问不同问题——比如先找星系的位置,再看它的光谱变化,交叉出以前没发现的规律。清华大学的毛俊捷副教授说,这种“数据交叉”本身就是新发现的源泉。

3. 数据统一难?先搞“通用接口”和“共性框架”

不同望远镜的数据处理方式差异大(比如有的测光学、有的测射电,仪器芯片都不一样),直接集中原始数据不现实。怎么办?

业内给出的方案是:先找“共性”——比如不管什么望远镜,测光数据的常规处理流程(清洗、定标)是相似的,把这些共性模块打包成统一框架,再针对不同望远镜做个性化优化;同时,各家达成共识,用统一的接口或协议让数据能互相“对话”,不用真的把PB级数据搬来搬去(搬不动也存不下)。比如墨子巡天望远镜的负责人就说,如果CSST的AI系统效果好,他们愿意跟进用统一平台。

4. 天文极端环境:硬科技的“终极考场”

天文研究的环境太“苛刻”了——比如青海冷湖的望远镜在海拔4300米,低温、缺氧;太空里的望远镜要面对真空、强辐射、几百摄氏度的温差。这些极端条件刚好能测试硬科技的极限:

  • 存储:100PB数据对存储吞吐、查询速度要求极高,能暴露数据库的缺陷;
  • 芯片:太空辐射会干扰芯片元件,高海拔的GPU能不能正常工作?这些都是普通商业场景遇不到的考验;
  • 技术延伸:比如FAST(中国天眼)的巨型钢丝绳技术,原本是为天眼研发的,后来用到了工业场景;浪潮信息把国产服务器、液冷技术搬到海拔4410米的稻城,建了全球最高的宇宙线智算中心,就是用天文场景验证硬科技。

简单说,天文就像个“压力测试器”,能帮产业找出技术短板,反向推动芯片、存储等硬科技升级。

5. 科学与产业的双赢:天文的“反哺”逻辑

以前斯隆巡天助推了微软数据库的成长,现在中国天文也想走这条路——用基础科学的需求倒逼产业技术突破。比如解决天文数据处理的问题,可能会让国产AI芯片、存储系统变得更稳定、更高效;而产业技术的进步,又能反过来支持天文研究,形成良性循环。这不仅能让我们在宇宙探索上更领先,还能让硬科技“从实验室走向市场”,真正落地到各行各业。