虎嗅

Антидистилляция: Действительно ли Чжан Иминг стремится к славе за счет пустых заявлений или он ищет истинные корни своих убеждений?

原文:反蒸馏:张一鸣到底是沽名钓誉,还是正本清源?

Краткое содержание

6 августа произошли два значимых события в мире искусственного интеллекта: основатель Google DeepMind ушел с поста генерального директора из-за неудачи своей модели Gemini; руководитель компании ByteDance, Zhang Yiming, принял решение не использовать методы «дистилляции» при обучении больших моделей. Это решение вызвало раскол в индустрии: некоторые считают его попыткой привлечь внимание, другие — проявлением стремления к честности и надежности. Статья анализирует природу метода дистилляции, логику решения ByteDance, споры в отрасли и различные подходы криптонавтики в Китае, указывая, что компания выбрала дорогой и сложный путь, но именно такое разнообразие необходимо для развития китайской экосистемы ИИ.

Подробный анализ

1. Что такое «дистилляция» и почему ее все используют?

«Дистилляция» — это метод обучения ИИ, который подразделяется на два вида:

  • Использование собственных моделей: обучение меньших моделей на основе больших (например, GPT-4 для обучения GPT-3.5); это стандартная практика в индустрии и не вызывает споров;
  • Использование данных других моделей: обучение собственной модели на основе ответов других систем (например, ChatGPT); это является предметом дискуссий.

Пример: использование данных других моделей похоже на копирование решений отличников — быстрое улучшение показателей (рейтингов в списках моделей), но не обязательно приводит к освоению истинных алгоритмов. Почему этот метод популярен? Потому что он эффективен и экономит ресурсы: например, компания DeepSeek смогла улучшить результаты своей модели (AIME24) за счет использования данных от 800 тысяч моделей R1, при этом затраты на обработку были минимальными.

Однако ситуация усложнилась: США начали использовать это как повод для санкций; компания Anthropic обвиняет китайские компании в использовании поддельных аккаунтов для сбора данных и может выявлять практику дистилляции по IP-адресам и способу доступа.

2. Решение Zhang Yimingа не использовать методы дистилляции: страх перед наказаниями или собственные убеждения?

Многие предполагают, что ByteDance боится проблем с TikTok из-за действий США, но статья приводит контраргументы: компания не разрешает использование даже открытых моделей (например, Kimi K3), которые не содержат синтетических данных и не представляют угрозы для TikTok. Какова настоящая причина?

  • Технические требования: в прошлом году ByteDance выпустила открытую модель без синтетических данных, чтобы избежать их влияния на последующие исследования;
  • Глобальные интересы: у ByteDance крупнейший зарубежный бизнес; компания не хочет быть обвинена в нарушениях (вспомним, что ранее аккаунт проекта Project Seed был приостановлен из-за подозрений в использовании данных от OpenAI);
  • Личные убеждения Zhang Yimingа: после ухода с поста генерального директора он активно занимается исследованиями в области ИИ (посещает собрания команды Seed, читает научные статьи, привлекает профессоров из Сингапура для консультаций). Это его первое серьезное решение после ухода от руководства.

3. Является ли дистилляция «коротким путем» или «тупиком»?

Мнения разделились:

  • Защитники дистилляции: эффективно и экономит ресурсы; исследования Цинхуа показали, что модели, полученные с использованием этого метода, превосходят базовые по производительности; сама компания Anthropic признает дистилляцию легальным способом обучения;
  • Противники дистлляции: это может привести к потере эффективности моделей (по результатам исследований Оксфордского университета);
  • Нейтральные мнения: исследователь Lambert считает, что дистлляция — это лишь имитация чужих решений, в то время как обучение на основе ошибок способствует развитию уникальных навыков; однако использование синтетических данных может предотвратить этот эффект.

4. Китайские компании в области ИИ: не только дистилляция

Статья приводит три примера, демонстрирующих, что дистлляция — лишь один из инструментов в развитии ИИ:

  • Zhispu GLM-5.3: модель была улучшена без использования дистлляции и дополнительных параметров за счет методов обучения на основе алгоритма резонансного распределения (RL) и структуры с длинным контекстом;
  • DeepSeek: модель была разработана путем самостоятельных вычислений, без использования данных от других систем; главный исследователь OpenAI признал, что они независимо открыли основные принципы работы этого метода;
  • Alibaba Qianwen: хотя компанию обвиняют в использовании дистлляции, ее модели используются многими разработчиками по всему миру, что свидетельствует о ее качестве.

Вывод

Споры вокруг метода дистлляции в основном связаны с негативным восприятием китайской ИИ-индустрии; на самом деле он лишь влияет на темпы развития, но не определяет ее потенциал.

5. Ставка ByteDance: выбор сложного пути и возможность изменить историю

Внутри компании обсуждается создание моделей с более чем 5 триллионами (а возможно, даже 10 триллионами) параметров. Насколько сложен этот путь?

  • Краткосрочные риски: Лян Рубо признал увеличение отставания от лидирующих зарубежных компаний;
  • Долгосрочные перспективы: в случае успеха ByteDance может стать важным игроком на мировом рынке ИИ и изменить ход развития китайской индустрии; в случае неудачи — это будет дорогим уроком для всей отрасли.

Тем не менее такое разнообразие подходов полезно для китайской экосистемы ИИ: каждая компания может выбирать путь, соответствующий своим возможностям. Выбор Zhang Yimingа заслуживает уважения, но не обязательно должен становиться общепринятым стандартом для всей индустрии.

Заключение

Дистлляция — это технический инструмент, а не символ политической позиции. Выбор ByteDance сложен, но именно такая независимость необходима для инноваций в области ИИ. Независимо от результатов, этот подход открывает новые возможности для китайской экосистемы ИИ.