虎嗅

По результатам тестирования DeepSeek проявил значительные улучшения в распознавании объектов: он узнает Илона Маска, но не может идентифицировать Лян Вэньфэна.

原文:实测“开了眼”的DeepSeek:认得马斯克,认不出梁文锋

Краткое содержание анализа

DeepSeek наконец-то добавил поддержку многомодальных функций (включая распознавание изображений) и выпустил экспериментальную версию модели Vision-Exp по доступной цене — один цент за 8 изображений. Однако результаты тестирования пользователей оставляют желать лучшего: модель не узнает своего основателя Лян Вэньфэна (принимает его за Ван Синга или Чжан Иминга), путает реальных людей с изображениями, созданными AI, и плохо справляется с сложными задачами (например, с копированием веб-страниц). Хотя официальные показатели модели близки к уровню лидирующих моделей, реальный опыт использования сильно отличается от лабораторных данных. Выпуск этой экспериментальной версии направлен на сбор обратной связи от пользователей для дальнейшего совершенствования официальной версии.

Основные моменты:

1. Положительные аспекты: Теперь модель может обрабатывать изображения, что значительно расширяет ее возможности. Цена также остается доступной (один цент за 8 изображений).

2. Проблемы с распознаванием: Пользователи сталкиваются с ошибками в распознавании лиц (например, основателя DeepSeek принимают за других людей) и плохим выполнением сложных задач.

3. Отличие между лабораторными и реальными условиями: Официальные тесты проводятся в стандартизированных условиях, в то время как реальные изображения могут быть размытыми или содержать юмористические элементы, с которыми модель не справляется.

4. Цель экспериментальной версии: Сбор обратной связи для улучшения официальной версии модели.

Заключение:

Хотя экспериментальная версия Vision-Exp обладает потенциалом, ей еще предстоит много работы для устранения недостатков. DeepSeek использует этот подход, чтобы снизить затраты и получить полезную информацию от пользователей. Такой подход уже использовался ранее (версия V3.2-Exp была выпущена спустя два месяца после экспериментальной версии V3.2).