虎嗅

Краткая история крупных китайских моделей 01: Модели становятся всё больше и больше, но никто не знает, во что они должны превратиться

原文:中国大模型简史01:模型越做越大,却没人知道它该变成什么

I. Краткое изложение основного содержания

Это вступление к книге «Краткая история китайских больших моделей», в котором рассказывается о двух беспорядочных годах в отрасли китайских больших моделей с лета 2021 года до выхода ChatGPT в конце 2022 года: в то время не существовало ни одного успешного примера применения таких моделей, никто не знал, в каком формате они в итоге могут развиться. Научные институты, крупные компании и начинающие предприниматели действовали наугад. Некоторые создавали сверхбольшие модели с параметрами, в 10 раз превышающими параметры GPT-3, но не могли найти для них применение; другие, получив инвестиции, даже не думали, что именно нужно делать в первом продукте. Только в конце 2022 года произошли два события, которые окончательно направили развитие отрасли в ту сторону, которую мы знаем сейчас — на гонку за создание популярных больших моделей.

---

II. Популярное разъяснение по пунктам

1. Большие модели 2021 года вовсе не были созданы для обычных пользователей

Сейчас большие модели ассоциируются с чат-ботами, но те модели, которые были разработаны в Китае в 2021 году, имели совершенно другое назначение. Например, модель «Wudao 2.0» имела 1,75 триллиона параметров, что в 10 раз превышало количество параметров GPT-3, и включала в себя функции мультимодального распознавания, прогнозирования структуры белков и другие научные инструменты, но не предусматривала интерфейс для общения с обычными пользователями.

Все участники отрасли имели очень амбициозные представления о функциях больших моделей: кто-то считал их подобными электростанциям, которые производят интеллект, обеспечивая работу всех малых AI-систем; кто-то видел в них промышленные конвейеры, позволяющие компаниям не заново собирать данные и обучать модели для каждого конкретного приложения. Никто не мог предвидеть, что в итоге большие модели превратятся в простые чат-боты, с которыми можно будет общаться. Это было совершенно неожиданным результатом.

2. Соревнование по количеству параметров в начале развития отрасли не было попыткой обмануть инвесторов

Многие считают, что соревнование по количеству параметров больших моделей было бессмысленным. Однако научные исследователи действительно открыли новые закономерности: ранее разработка AI происходила в узких областях (перевод, анализ эмоций и т. д.), и каждый исследователь мог заниматься своей областью всю жизнь. Но с появлением GPT-3 стало ясно, что достаточно просто увеличить размер модели и предоставить ей большое количество данных, чтобы она могла выполнять различные задачи (перевод, написание текстов, решение математических задач) без дополнительного обучения. Также был обнаружен закон, согласно которому увеличение количества параметров, данных и вычислительных ресурсов приводит к улучшению функциональности модели без видимого предела. Раньше для исследований требовалось несколько видеокарт, а теперь для проверки этого закона необходимо использовать сотни карт; это похоже на ситуацию в играх, где для прохождения уровня раньше хватало нескольких обычных устройств, а теперь нужен целый набор современных инструментов.

3. У разных участников отрасли были совершенно разные представления о функциях больших моделей

В 2021 году у первых китайских разработчиков больших моделей не существовало единого подхода к их использованию. Например, институт «Zhiyuan», возглавляемый Пекином, сотрудничал с Технологическим университетом Пекина, Пекинским университетом и компаниями вроде Baidu и ByteDance, и считал большие модели общественной инфраструктурой, предназначенной для использования всеми отраслями; Huawei, занимавшаяся разработкой AI-решений для предприятий, рассматривала их как инструменты, устраняющие необходимость занового сбора данных и обучения моделей; Baidu, имея опыт работы с поисковыми системами, считала важным включение в модели знаний, накопленных человечеством. Эти компании говорили разное, но никто не мог утверждать, что его подход неверен, поскольку никто не видел на практике действительно эффективных больших моделей.

4. Начальный этап развития отрасли был полон безумных идей

Те, кто решил заняться разработкой больших моделей в 2021 году, считались сумасшедшими с точки зрения окружающих. Например, Янь Цзюньцзе, создатель MiniMax, не знал, что делать с первым продуктом своей модели, даже несмотря на наличие ChatGPT. Инвесторы инвестировали в него, потому что его идеи казались им перспективными, хотя они и были не совсем понятны. Позже они создали модель с 30 миллиардами параметров, но она не могла выполнять никаких практических задач, поэтому был создан чат-бот Glow, позволяющий пользователям создавать виртуальных персонажей для общения. Создание больших моделей в то время не основывалось на четком бизнес-плане; сначала создавалась модель, затем искались способы ее применения.

5. Два события в конце 2022 года полностью изменили правила развития отрасли

До октября 2022 года китайская отрасль больших моделей развивалась без четкого направления. Однако два события полностью изменили ситуацию: США ввели ограничения на экспорт высокотехнологичных AI-чипов, а ChatGPT стал доступен бесплатно для всех пользователей. Это позволило отрасли перейти к новому этапу развития — гонке за создание популярных больших моделей.