Краткое содержание анализа
Marin — это проект открытого базового моделирования, проводимый Стэнфордским университетом. В настоящее время в рамках этого проекта тренируется гибридная экспертная (MoE) модель с общим количеством параметров 535 миллиардов. Главной особенностью Marin не является количество параметров, а полная прозрачность процесса обучения: все этапы — от гипотез экспериментов, настройки кода, кривых обучения до записей о неудачах — публикуются в реальном времени в интернете. Даже в случае возможных сбоев в процессе обучения информация не скрывается. Цель проекта — решить одну из ключевых проблем индустрии ИИ: с учетом того, что вычислительные ресурсы становятся все более концентрированными, а алгоритмы обучения все более замкнутыми, может ли базовая модель, подобно программному обеспечению с открытым исходным кодом, позволить всем участвовать в ее исследовании и разработке? Индра Дадж (Indra Daj) называет Marin «ценным примером защиты открытости ИИ», однако окончательные результаты пока еще предстоит оценить.
1. Почему Marin привлекает столько внимания? Не из-за большого количества параметров, а из-за прозрачности обучения
Многие считают, что Marin популярен благодаря своим 535 миллиардам параметров, но на самом деле ключевым моментом является его **степень открытости*. Предыдущие модели с открытым исходным кодом (например, Llama, Gemma) раскрывали только окончательные веса модели, в то время как алгоритмы обучения (данные, код, процесс принятия решений) оставались секретами. Даже более открытые проекты, такие как BLOOM и OLMo, публиковали результаты обучения только после его завершения.
Marin отличается тем, что превращает повседневную работу лаборатории в «прямую трансляцию**:
- Перед началом экспериментов на GitHub четко описываются цели и используемые методы;
- Во время обучения в реальном времени публикуются кривые обучения (эффективность модели при адаптации к данным) и состояние оборудования;
- Даже в случае неудач или изменения подходов в процессе обучения весь процесс записывается.
Это похоже на просмотр процесса приготовления еды: не только предлагается готовое блюдо, но и показывается весь процесс от покупки ингредиентов до приготовления. В мире ИИ это довольно радикальный подход, поскольку алгоритмы и процессы обучения крупных моделей обычно считаются коммерческими секретами компаний.
2. Гибридная экспертная модель с 535 миллиардами параметров: большой объем, но не такой уж и эффективный
535 миллиардов параметров — это общее количество параметров; фактически каждый Token использует всего около 23 миллиардов параметров. Это характерно для моделей типа MoE (гибридных экспертных моделей):
- В модели есть множество «экспертов» (отвечающих за математические вычисления, программирование, общение и т. д.);
- При поступлении Tokenа модуль маршрутизации определяет, какие эксперты должны участвовать в обработке (например, математические вычисления выполняются специализированными экспертами);
- Только выбранные эксперты начинают работу, остальные отдыхают.
Преимущество такого подхода заключается в том, что модель может обрабатывать большой объем информации, но затраты на обработку одного Tokenа остаются низкими (не все эксперты работают одновременно). Однако следует учесть, что 23 миллиарда активных параметров не равны 23 миллиардам параметров обычной модели из-за наличия дополнительных компонентов (модуль маршрутизации и т. д.), поэтому нельзя просто сравнивать их производительность.
3. Какие технические проблемы возникли при обучении такой большой модели?
Основная сложность при работе с моделями типа MoE заключается в обмене данными между экспертами и распределении нагрузки:
- Проблемы с обменом данными: эксперты работают на разных GPU, и передача Tokenов между ними замедляет процесс обучения;
- Чрезмерная нагрузка на некоторых экспертов: некоторые эксперты (например, те, которые обрабатывают повседневные разговоры) получают слишком много Tokenов, что приводит к их потере и снижению эффективности модели;
- Нестабильность результатов обучения: во время обучения градиенты могут резко изменяться, что может привести к смещению модели от правильного решения.
Как команда Marin справилась с этими проблемами?
- Методы масштабирования: сначала были отработаны более простые модели с количеством параметров от 160 до 27,7 миллиардов; на основе этих результатов были предложены решения для больших моделей;
- Изменение длины контекста: длина контекста была сокращена с 65 тысяч до 4 тысяч, чтобы улучшить распределение нагрузки между экспертами;
- Использование функции logit z-loss: ограничение колебаний результатов обучения для предотвращения нестабильности.
4. Какое значение имеет этот проект для индустрии ИИ?
Ценность Marin не в создании самой мощной модели, а в разрушении замкнутости и предоставлении большего количества возможностей для участия в исследованиях крупных моделей:
- Малые команды могут изучать записи обучения Marin и учиться решать технические проблемы (обмен данными между экспертами, настройка нагрузки);
- Публикация записей о неудачах важнее, чем успехов: раньше были видны только успешные результаты, а не проблемы, возникшие на этапах разработки;
- Проект способствует возвращению индустрии ИИ к принципам совместной работы (как на GitHub, где все вместе работают над кодом).
Индра Дадж утверждает, что публичное распространение результатов исследований когда-то было обыденностью в индустрии, и Marin призван восстановить эту практику.
5. Можно ли считать Marin самой мощной моделью сейчас? Еще рано
Несмотря на большое количество параметров и вычислительные ресурсы, сделать окончательные выводы пока рано:
- Эффективность модели зависит от четкого разделения обязанностей между экспертами;
- Обучение еще не завершено: в настоящее время проводится только предварительное обучение; для оценки полных характеристик модели необходимы дополнительные этапы;
- Публичность не гарантирует успеха: в процессе обучения могут возникнуть проблемы с оборудованием, данными или изменения в алгоритмах; даже неудачи могут стать ценным опытом.
Следовательно, наибольшая ценность проекта Marin заключается в его «дневнике обучения», а не в окончательных результатах через несколько месяцев.
Заключение
Marin — это попытка превратить исследования в области ИИ из сферы секретов нескольких компаний в открытую науку, доступную для всех. Независимо от того, удастся ли модель стать самой мощной, сама попытка уже имеет большое значение.