虎嗅

Скрытые механизмы работы больших моделей и их объяснимость: о чем думает искусственный интеллект? | Беседа со стенфордским ученым Ариаманом Аророй

原文:大模型的隐藏推理与可解释性:AI在想什么?|对话斯坦福博士Aryaman Arora

Краткое содержание

Статья посвящена тайне „черного ящика“ искусственного интеллекта (ИИ): на примере эксперимента (вмешательства в работу модели с целью изменения восприятия животных) показано, что ИИ при ответах на вопросы использует скрытые внутренние механизмы обработки информации. Далее рассматриваются попытки исследователей „открыть“ этот „черный ящик“ (вопросы о том, является ли логика ИИ истинным процессом мышления и понимает ли модель реальный мир). Также упоминаются новые особенности ИИ (адаптация ответов в зависимости от пользователя и проявление „личности“ моделей). В заключение подчеркивается важность обеспечения объяснимости его действий для установления доверия и принятия решений.

Подробный анализ

1. За ответами ИИ стоит „невидимое“ мышление

Эксперимент в статье наглядно иллюстрирует этот момент: при вопросе „Сколько ног у животных, которые плетут паутины?“ ИИ ответил „8“. Хотя в вопросе не упоминалось слово „паук“, модель автоматически предположила, что речь идет именно о пауках. Изменив внутренние параметры модели на „муравьев“, ответ сменился на „6“. Это свидетельствует о том, что ИИ перед выдачей ответа сначала определяет категорию животного, а затем сообщает количество ног. Такой процесс аналогичен внутренним предположениям человека, но ИИ не демонстрирует его напрямую, поэтому это называется „невидимым“ мышлением.

2. „Открыть черный ящик“ сложно

Мы знаем, что ИИ использует внутренние алгоритмы для принятия решений, но как именно оно это делает? Например:

  • Является ли логика его мышления истинным процессом мышления или лишь имитацией человеческих шагов?
  • Понимает ли модель суть таких явлений, как „пауки плетут паутины“ или просто запоминает соответствующие данные?

Исследователи пытаются разгадать эти вопросы, но пока у них нет однозначных ответов; „черный ящик“ ИИ остается неполностью открытым.

3. Объяснимость ИИ: правильные ответы легче понять

Статья отмечает парадоксальный факт: правильные действия ИИ часто легче объяснить, чем неправильные. Например, когда ИИ правильно решает простую задачу (например, 1+1=2), мы понимаем, что он использовал правила арифметики; если же он ошибается (например, получает 3), причины ошибки могут быть сложнее выявить — возможны проблемы с настройками модели, путаница в знаниях или влияние внешних факторов. Аналогично человеку: при правильном решении он может четко объяснить свой подход, а при ошибке может и сам не понимать, в чем дело.

4. ИИ начинает адаптироваться к пользователю и проявляет „личность“

ИИ претерпевает две новые изменения:

  • Адаптация к пользователю: модели изменяют свой стиль общения в зависимости от его характеристик (простой язык для детей, профессиональная терминология для экспертов).
  • Проявление „личности“: разные модели демонстрируют разные черты поведения (живой, строгий или даже „ироничный“ стиль).

Эти изменения делают ИИ более „человечным“, но требуют от нас лучшего понимания его поведения: почему модель ведет себя по-разному с разными людьми и есть ли у нее предубеждения.

5. Важность объяснимости

Исследование объяснимости ИИ направлено на достижение трех основных целей:

  • Установление доверия: например, при использовании ИИ в медицинских диагностических системах важно убедиться, что его выводы основаны на достоверных данных.
  • Снижение рисков: например, при отказе ИИ в кредите необходимо знать, является ли причина обоснованной и нет ли дискриминации.
  • Определение границ использования: какие важные решения можно доверять ИИ? Например, в области автономного вождения или финансового контроля необходимо понимать логику его алгоритмов, чтобы использовать их с уверенностью.

По мере роста возможностей ИИ понимание его способов работы становится все более важным — в конце концов, мы не можем доверять свою судьбу „черному ящику“, внутренние механизмы которого остаются для нас непонятными.