Краткое содержание статьи
Статья рассматривает значительные изменения в логике обучения больших моделей: ранее основное внимание уделялось созданию основных моделей (Base Models), призванных максимально впитать всё человеческое знание; сейчас же роль этих моделей изменилась — они больше не являются «контейнерами для знаний», а служат наборами базовых инструментов, предоставляющих такие «атомарные способности», как знание Python и структура кода. Финальные сложные функции моделей (например, разработка программного обеспечения или решение длительных задач) достигаются с помощью усиленного обучения (RL) и новой технологии среднего обучения (Mid-training). Кроме того, данные для предварительного обучения изменились с хаотичной смеси веб-страниц на более целенаправленные и точные наборы данных; границы между этапами обучения стали размытыми, и процесс обучения упростился до двух основных шагов: обучение с использованием надзора (supervised learning) для получения базовых знаний и усиленное обучение для развития прикладных способностей.
1. Основные модели: от «супербиблиотек» к наборам инструментов
Ранние основные модели напоминали супербиблиотеки, включающие в себя интернет-ресурсы, Википедию и книги; например, для GPT-3 85% данных для предварительного обучения приходилось из веб-страниц и Википедии, и считалось, что чем лучше предварительное обучение, тем сильнее модель. Последующее обучение заключалось лишь в незначительной настройке поведения модели (например, стиля общения), и роль усиленного обучения была ограничена.
Сейчас цель основных моделей изменилась: они больше не должны выполнять сложные задачи самостоятельно (например, разрабатывать программное обеспечение на протяжении 10 часов), но должны владеть базовыми инструментами — знанием Python-языка, структурой кода, работой с Git и API. Это как если бы вы учились готовить: основные модели помогают вам научиться нарезать овощи, переворачивать кастрюлю или приготавливать соусы, а затем усиленное обучение показывает, как комбинировать эти навыки для создания полноценного блюда. Основные модели перешли от «знания всего» к обладанию необходимыми базовыми способностями, которые являются отправной точкой для развития более сложных функций.
2. Данные для предварительного обучения: от хаотичной смеси к целенаправленному использованию
Раньше данные для предварительного обучения включали большое количество веб-страниц (около 85%); сейчас их доля снизилась до 15%, а основным источником данных стал код. Причина в том, что компании, разрабатывающие модели, точно знают, какие способности им необходимы (например, программирование, логическое мышление или решение сложных задач), и предоставляют соответствующие данные. Также увеличилось значение синтетических данных — не используются данные с веба, а создаются специально для нужд обучения моделей. Например, обычный фрагмент кода может быть преобразован в образцы для тренировки, включающие задачи по поиску ошибок, их исправлению, вызову инструментов и выполнению последовательных действий; это позволяет модели заранее познакомиться с реальными сценариями использования знаний, а не просто запоминать информацию. Это похоже на изучение слов: раньше нужно было запоминать слова отдельно, а теперь — вместе с примерами использования и ситуативными диалогами, что делает обучение более практичным.
3. Усиленное обучение и последующее обучение: от незначительной корректировки к усилению способностей
Раньше последующее обучение заключалось лишь в незначительных изменениях поведения модели (например, улучшении её способности к общению); сейчас усиленное обучение стало ключевым инструментом для развития её способностей. Если усиленное обучение выполнено хорошо, модель после предварительного обучения может значительно улучшить свои показатели. По словам экспертов, объем вычислительных ресурсов, затрачиваемых на предварительное и последующее обучение, уже почти одинаков. Это означает, что финальные способности модели теперь зависят не только от предварительного обучения, но и от последующего этапа. Это подобно покупке неотделанного дома: раньше для его достройки требовалось немного средств, а теперь расходы на строительство сопоставимы с затратами на покупку самого дома, и качество строительства напрямую влияет на комфорт проживания.
4. Среднее обучение: переходный этап между предварительным и последующим обучением
Раньше данные для предварительного обучения содержали статическую информацию (веб-страницы, книги), а данные для последующего обучения были совершенно другого типа (логические задачи, взаимодействие с агентами, вызов инструментов); это приводило к тому, что модели плохо адаптировались к новым условиям. Технология среднего обучения решает эту проблему, предоставляя переходный этап между предварительным и последующим обучением, позволяющий модели заранее познакомиться с длинными контекстами, логическими задачами и инструментами. Это как переход из начальной школы в университет — без подготовки можно не справиться с учебой; среднее обучение помогает сделать этот переход более плавным.
5. Упрощение процесса обучения: два основных шага для создания больших моделей
Теперь весь процесс обучения можно свести к двум этапам:
- Первый этап: обучение с использованием надзора (supervised learning), включающее предварительное и среднее обучение, позволяет модели освоить базовые знания и инструменты (атомарные способности).
- Второй этап: усиленное обучение (RL), позволяет модели в реальных условиях испытывать различные варианты решения задач и получать обратную связь, чтобы комбинировать базовые навыки для решения сложных проблем (например, разработка программного обеспечения или принятие решений).
Границы между этапами предварительного, среднего и последующего обучения стали размытыми; основная идея заключается в том, чтобы сначала заложить хорошую базу, а затем развивать прикладные способности — это делает процесс обучения более логичным.
Заключение
Заголовок статьи «The Base Model Is Dead» звучит преувеличенно, но роль основных моделей действительно изменилась: они больше не являются центральным элементом системы, а служат отправной точкой для развития более сложных функций. Однако их значение не уменьшилось — без базовых навыков усиленное обучение не сможет эффективно работать. Сейчас основной акцент смещен с количества знаний на способность моделей их применять в практических задачах. Это ключевой шаг в переходе индустрии больших моделей от стремления к накоплению знаний к развитию прикладных способностей.