虎嗅

До релиза: Главный контрольный пункт в управлении безопасностью искусственного интеллекта

原文:释放之前:AI安全治理的最高杠杆控制点

Основной вывод: «Лекарство от сожалений» в области безопасности ИИ потеряло свою эффективность; единственное решение — контроль на этапе предварительной разработки

Основная мысль статьи крайне остра и противоречит интуиции: в области искусственного интеллекта, как только определенные возможности моделей становятся доступны (особенно при использовании открытых алгоритмов или утечке данных), последующие меры по устранению угроз (например, блокировка аккаунтов или исправление ошибок) подобны попыткам собирать воду из протекающей лодки — они никогда не смогут догнать скорость протока. Поэтому наиболее эффективными и экономически выгодными средствами контроля являются меры, принимаемые до самой публикации продукта**.

Статья иллюстрирует это на примере инцидента с так называемой атакой пересылки данных между сессиями, раскрытого компанией Anthropic, и указывает на серьезные структурные недостатки существующих систем безопасности ИИ:

1. Последующая защита — это бесконечная борьба: злоумышленнику достаточно найти способ обойти защитные меры, в то время как защитникам приходится охраняться от всех возможных угроз; затраты злоумышленника снижаются с увеличением масштабов атаки, в то время как затраты защитников растут пропорционально.

2. Добровольные обязательства ненадежны: существующие механизмы, такие как предварительная оценка безопасности в США, основаны на добровольном сотрудничестве производителей и не имеют обязательной силы. Под давлением коммерческой конкуренции такие обязательства часто превращаются в показную соблюдение правил.

3. Невозвратимость является основной проблемой: вызовы через API можно отозвать, но открытые алгоритмы, как разлитая вода, уже нельзя вернуть назад. Поэтому критерии оценки безопасности открытых алгоритмов должны быть более строгими, чем для API, однако существующая система работает наоборот.

4. Предлагаемые решения: необходимо создать замкнутый цикл, включающий строгий предварительный контроль и суровую ответственность после публикации: обязательное предварительное одобрение, механизмы прекращения работы моделей в случае потери контроля во время их работы, а также страхование и законы, обязывающие нарушителей нести реальные последствия.

В общем, безопасность ИИ нельзя обеспечить путем устранения последствий после публикации продукта, а нужно создать систему предотвращения угроз на этапе разработки.