虎嗅

Соревнование по набору баллов: споры о тестировании Benchmark и его будущем

原文:分数竞赛:关于Benchmark基准测试的争论和未来

Краткое содержание

Бенчмарки в области искусственного интеллекта изначально предназначались инженерами для оценки эффективности моделей, но сейчас они стали своего рода “отчетами о результатах” при их публикации — производители сравнивают свои результаты с конкурентами, демонстрируя свои достижения. Однако по мере сближения уровней моделей возникли споры относительно достоверности и практической ценности этих показателей: значения бенчмарков обновляются ежемесячно, но качество пользовательского опыта не улучшается; целенаправленная оптимизация может исказить реальные результаты; сценарии тестирования оторваны от реальных потребностей пользователей. Индустрия начинает адаптироваться: некоторые производители прекращают публикацию отдельных показателей, другие сравнивают свои результаты только с прошлыми значениями, а некоторые предлагают включить в бенчмарки такие критерии, как затраты и время выполнения задач. В будущем бенчмарки должны будут улучшиться, и важность будет придаваться не столько их числовым значениям, сколько реальной эффективности моделей.

Подробный анализ

1. Бенчмарки: от внутреннего инструмента разработки к публичному индикатору

Изначально бенчмарки использовались инженерами для тестирования моделей и выявления их недостатков. Сейчас производители публикуют результаты тестирования, чтобы сравнить свои модели с конкурентами. Это стало общепринятым стандартом в индустрии. Почему? Потому что числовые показатели служат визуальным подтверждением качества моделей и позволяют производителям привлечь внимание к своим достижениям. Например, покупатели смартфонов сравнивают их характеристики, а производители ИИ используют бенчмарки, чтобы доказать превосходство своих решений.

2. Споры вокруг бенчмарков: почему они теряют актуальность?

С учетом сходства уровней моделей проблемы, связанные с бенчмарками, становятся все более очевидными:

  • Повышение показателей без улучшения качества: значения бенчмарков растут ежемесячно, но пользователи не замечают существенных улучшений в работе моделей. Например, показатель SWE-bench для оценки программирования от OpenAI увеличился с 74,9% до 80,9% за 6 месяцев, что недостаточно для отражения реальных возможностей современных моделей; поэтому OpenAI прекратил его публикацию.
  • Искусственное повышение показателей: некоторые производители оптимизируют свои модели специально для тестов, что приводит к завышенным результатам без реального улучшения качества. Станфордский отчет также указывает на несоответствие результатов независимых тестов показателям, предоставляемым производителями.
  • Оторванность от реальности: сценарии тестирования слишком упрощены (например, ограничиваются выполнением математических задач), в то время как реальные потребности пользователей гораздо сложнее (например, составление отчетов, обработка мультимодальных данных). Пользователи задаются вопросом: “Что значат высокие показатели в реальных условиях использования?”

3. Изменения в индустрии: от сравнения показателей к оценке реальной эффективности

В ответ на эти проблемы индустрия начинает менять подход:

  • Прекращение публикации устаревших показателей: OpenAI прекратил публикацию бенчмарка SWE-bench, поскольку он больше не отражает реальные возможности современных моделей.
  • Отказ от сравнения с конкурентами: при выпуске модели Sonnet 5 компания Anthropic сравнивала свои результаты только с прошлыми значениями, избегая бессмысленных соревнований.
  • Включение дополнительных критериев: ученый из OpenAI, Ноам Браун, предлагает учитывать такие факторы, как затраты на выполнение задач (количество используемых ресурсов, время выполнения). Это аналогично выбору смартфона, где важны не только характеристики, но и цена и скорость доставки.

4. Будущее бенчмарков

Споры не исчезнут, но бенчмарки будут постепенно совершенствоваться:

  • Улучшение стандартов тестирования: будущие бенчмарки будут более соответствовать реальным сценариям использования моделей (например, включение сложных задач и факторов затрат). На конференции ICML по машинному обучению около четверти докладов посвящены этим вопросам.
  • Бенчмарки перестанут быть единственным критерием оценки: в конечном итоге важность будут иметь не только числовые показатели, но и реальная эффективность моделей. Покупатели будут ориентироваться на такие критерии, как способность моделей решать конкретные задачи, удобство их использования и экономичность.
  • Важность разработочного процесса: несмотря на споры, бенчмарки по-прежнему играют важную роль внутри команд разработчиков и при внедрении моделей клиентами. Они помогают выявлять проблемы, но уже не могут служить единственным критерием оценки качества моделей.

Вывод

Споры вокруг бенчмарков связаны с переходом от этапа технологического развития к этапу их реального применения. В будущем бенчмарки станут вспомогательным инструментом, а главным критерием оценки эффективности моделей будут их реальные возможности. Победителями станут те модели, которые способны решать конкретные проблемы пользователей.