虎嗅

**Недостаток обучающих данных: крупные компании в сфере ИИ применяют жесткие меры**

原文:训练数据不够用,AI大厂开始下“毒手”

Обзор основного содержания

С развитием искусственного интеллекта (ИИ) общедоступные данные из Интернета были практически полностью использованы. Чтобы стать более умными (перейти от чат-ботов к «цифровым сотрудникам», способным выполнять реальные задачи), компании, занимающиеся ИИ, обратили внимание на внутренние данные закрытых или приобретенных стартапов — коды, записи чатов, электронные письма, аудиозаписи собраний и другие следы их деятельности. Торговля такими данными в этом году резко возросла, однако за ней стоят серьезные проблемы: утечки конфиденциальной информации, юридические неясности и этические конфликты. Ирония заключается в том, что такие гиганты, как Google и Meta, уже давно используют данные пользователей для обучения ИИ, «законно» изменив свои политики конфиденциальности, а Mercor лишь выдвинул этот процесс на более темные уровни. Эволюция ИИ по сути основана на потреблении человеческой цифровой приватности, и этот конфликт вряд ли удастся разрешить в ближайшем будущем.

Почему ИИ интересуется данными закрытых компаний? Общедоступных данных уже недостаточно

Ум ИИ не возникает из ниоткуда — для его развития требуются данные. Раньше крупные лаборатории собирали информацию со всего Интернета: веб-страницы, научные статьи, коды, посты на форумах и т. д.; это называлось «пиром общедоступных данных». Но теперь этот пир закончился: ИИ должен перейти от способности к ведению разговоров к выполнению реальных задач, и ему нужны не просто ответы, а процессы — например, как инженеры выявляют проблемы, обсуждают решения, вносят изменения в код и устраняют ошибки. Все это содержится в внутренних записях закрытых компаний (чаты в Slack, аудиозаписи собраний, история изменений кода) и представляет собой необходимый для обучения ИИ реальный бизнес-данный.

Например, GitHub позволяет ИИ быстро развиваться благодаря своим записям изменений кода (логам коммитов), которые сохраняют полный ход работы над проектом: от выявления проблемы до ее решения. Другие отрасли не имеют таких готовых источников данных, поэтому внутренние данные закрытых компаний становятся ценным ресурсом; именно поэтому Mercor готов заплатить 300 тысяч долларов за их приобретение, что привело к росту этого рынка.

Риски при покупке таких данных: утечка конфиденциальности — это лишь вершина айсберга

В этих внутренних данных содержится много чувствительной информации, и ее неправильное использование может привести к серьезным проблемам:

1. Невозможность сохранить конфиденциальность: Mercor утверждает, что может скрыть сensitive данные, но все в отрасли знают, что наиболее ценной информацией является то, кто что и когда сказал, а также какие действия это вызвало. Например, можно заменить имена сотрудников на «инженер А», но информация о должностях, проектах и клиентских отношениях все равно может быть раскрыта.

2. Отсутствие согласия сотрудников: Компании, продающие данные, часто не уведомляют сотрудников о том, что их чаты и записи собраний используются для обучения ИИ. Даже подписание соглашений об интеллектуальной собственности не означает согласия на использование рабочих разговоров в целях обучения.

3 Коммерческая конфиденциальность и предубеждения: В данных могут содержаться информация о клиентах и компании; более того, человеческие предубеждения (например, дискриминация по отношению к определенным клиентам или ошибки в принятии решений) могут быть перенесены на алгоритмы ИИ.

4 Отсутствие юридической ясности: Во всем мире нет четких правил, позволяющих компаниям продавать внутренние рабочие данные ИИ-компаниям; это создает юридический вакуум, который может способствовать быстрому развитию ИИ или привести к утечке конфиденциальности.

Гиганты уже давно занимаются этим: изменяя политику конфиденциальности, они «законно» используют ваши данные

Не думайте, что только Mercor занимается такой темной коммерцией — Google и Meta уже давно используют данные пользователей для обучения ИИ:

  • В 2023 году Google незаметно изменил свою политику конфиденциальности, разрешив использовать общедоступные данные для обучения ИИ (включая письма в Gmail, документы в Google Docs и результаты поисковых запросов). В 2026 году все пользователи были автоматически включены в программу обучения ИИ; чтобы выйти из нее, нужно было сделать это осознанно.
  • Meta также изменил свою политику в 2023 году, начав использовать публичные посты и фотографии с Facebook и Instagram для обучения ИИ. В 2024 году они временно прекратили использование данных пользователей ЕС, но в 2026 году возобновили эту практику, предоставив пользователям право на отказ (а не согласие).

Фактически Mercor лишь вынес на поверхность то, что гиганты делали ранее «втайне», но в отличие от них использует более темные методы (изменение условий обслуживания).

Как разрешить эту ситуацию? Необходимы юридические регулирования, технологии и саморегуляция, но путь еще долог

Этот конфликт не является безвыходным, но для его разрешения потребуются усилия всех сторон:

1. Юридические регулирования: необходимо уточнить, кому принадлежат данные (компании, сотрудникам или клиентам) и кто должен давать согласие на их продажу.

2. Технологические решения для защиты конфиденциальности: например, технологии типа «федеративного обучения» (обучение ИИ непосредственно на месте хранения данных без необходимости передачи оригинальных данных) и «дифференциальной конфиденциальности» (внесение помех в данные, чтобы не было видно, кому они принадлежат, но это не мешает обучению ИИ).

3. Саморегуляция отрасли и компаний: компании, работающие с данными, должны внедрять механизмы отслеживания источников данных и уведомлять сотрудников о продаже данных, получая их согласие.

Однако все эти решения требуют времени: компании ИИ нуждаются в развитии, пользователи хотят сохранить свою конфиденциальность, а гиганты — получить прибыль; поэтому конфликт будет продолжаться. В ближайшем будущем эволюция ИИ все еще будет основываться на потреблении человеческой цифровой приватности, и гонка за прогресс еще далека от конца.

Заключение

Каждый шаг в развитии ИИ сопровождается потреблением наших цифровых следов — от общедоступных данных до рабочих записей, от «законного» сбора информации гигантами до темных сделок. Мы восхищаемся мощью ИИ, но должны признать: его основой является цифровое наследие, которое многие люди так и не смогли сохранить в безопасности. В будущем появятся новые правила регулирования, но пока игра «за конфиденциальность в обмен на интеллект» продолжается.