Краткое содержание
Бенчмарки в области искусственного интеллекта изначально предназначались инженерами для оценки эффективности моделей, но сейчас они стали своего рода “отчетами о результатах” при их публикации — производители сравнивают свои результаты с конкурентами, демонстрируя свои достижения. Однако по мере сближения уровней моделей возникли споры относительно достоверности и практической ценности этих показателей: значения бенчмарков обновляются ежемесячно, но качество пользовательского опыта не улучшается; целенаправленная оптимизация может исказить реальные результаты; сценарии тестирования оторваны от реальных потребностей пользователей. Индустрия начинает адаптироваться: некоторые производители прекращают публикацию отдельных показателей, другие сравнивают свои результаты только с прошлыми значениями, а некоторые предлагают включить в бенчмарки такие критерии, как затраты и время выполнения задач. В будущем бенчмарки должны будут улучшиться, и важность будет придаваться не столько их числовым значениям, сколько реальной эффективности моделей.
Подробный анализ
1. Бенчмарки: от внутреннего инструмента разработки к публичному индикатору
Изначально бенчмарки использовались инженерами для тестирования моделей и выявления их недостатков. Сейчас производители публикуют результаты тестирования, чтобы сравнить свои модели с конкурентами. Это стало общепринятым стандартом в индустрии. Почему? Потому что числовые показатели служат визуальным подтверждением качества моделей и позволяют производителям привлечь внимание к своим достижениям. Например, покупатели смартфонов сравнивают их характеристики, а производители ИИ используют бенчмарки, чтобы доказать превосходство своих решений.
2. Споры вокруг бенчмарков: почему они теряют актуальность?
С учетом сходства уровней моделей проблемы, связанные с бенчмарками, становятся все более очевидными:
- Повышение показателей без улучшения качества: значения бенчмарков растут ежемесячно, но пользователи не замечают существенных улучшений в работе моделей. Например, показатель SWE-bench для оценки программирования от OpenAI увеличился с 74,9% до 80,9% за 6 месяцев, что недостаточно для отражения реальных возможностей современных моделей; поэтому OpenAI прекратил его публикацию.
- Искусственное повышение показателей: некоторые производители оптимизируют свои модели специально для тестов, что приводит к завышенным результатам без реального улучшения качества. Станфордский отчет также указывает на несоответствие результатов независимых тестов показателям, предоставляемым производителями.
- Оторванность от реальности: сценарии тестирования слишком упрощены (например, ограничиваются выполнением математических задач), в то время как реальные потребности пользователей гораздо сложнее (например, составление отчетов, обработка мультимодальных данных). Пользователи задаются вопросом: “Что значат высокие показатели в реальных условиях использования?”
3. Изменения в индустрии: от сравнения показателей к оценке реальной эффективности
В ответ на эти проблемы индустрия начинает менять подход:
- Прекращение публикации устаревших показателей: OpenAI прекратил публикацию бенчмарка SWE-bench, поскольку он больше не отражает реальные возможности современных моделей.
- Отказ от сравнения с конкурентами: при выпуске модели Sonnet 5 компания Anthropic сравнивала свои результаты только с прошлыми значениями, избегая бессмысленных соревнований.
- Включение дополнительных критериев: ученый из OpenAI, Ноам Браун, предлагает учитывать такие факторы, как затраты на выполнение задач (количество используемых ресурсов, время выполнения). Это аналогично выбору смартфона, где важны не только характеристики, но и цена и скорость доставки.
4. Будущее бенчмарков
Споры не исчезнут, но бенчмарки будут постепенно совершенствоваться:
- Улучшение стандартов тестирования: будущие бенчмарки будут более соответствовать реальным сценариям использования моделей (например, включение сложных задач и факторов затрат). На конференции ICML по машинному обучению около четверти докладов посвящены этим вопросам.
- Бенчмарки перестанут быть единственным критерием оценки: в конечном итоге важность будут иметь не только числовые показатели, но и реальная эффективность моделей. Покупатели будут ориентироваться на такие критерии, как способность моделей решать конкретные задачи, удобство их использования и экономичность.
- Важность разработочного процесса: несмотря на споры, бенчмарки по-прежнему играют важную роль внутри команд разработчиков и при внедрении моделей клиентами. Они помогают выявлять проблемы, но уже не могут служить единственным критерием оценки качества моделей.
Вывод
Споры вокруг бенчмарков связаны с переходом от этапа технологического развития к этапу их реального применения. В будущем бенчмарки станут вспомогательным инструментом, а главным критерием оценки эффективности моделей будут их реальные возможности. Победителями станут те модели, которые способны решать конкретные проблемы пользователей.