Краткое содержание анализа
Atlas, разработанный компанией World Labs, не является обычным инструментом для рисования, а представляет собой симулятор мира, способный генерировать структурированные трехмерные модели, доступные для использования машинами. С помощью таких технологий, как глубинные изображения, точечные облака и 3D-гауссовские отражения, Atlas превращает обычные фотографии в измеряемые трехмерные данные (например, диаметр стакана, расстояние от стола до стены). Кроме того, он позволяет совмещать реальные снимки с результатами работы искусственного интеллекта, что обеспечивает возможность тренировки роботов в виртуальной среде без необходимости использования реальных данных. Основной прорыв Atlas заключается в переходе от рендерера, предназначенного исключительно для отображения изображений, к симулятору, способному выполнять практические задачи, тем самым преодолевая пробел между технологиями искусственного интеллекта и промышленным применением.
I. Atlas: симулятор для хранения данных, а не инструмент для рисования
В статье система искусственного интеллекта разделена на три уровня:
- Рендер: отвечает только за создание красивых изображений; например, при нажатии кнопок направления он формирует соответствующий обзор, но не знает размеров предметов или расстояний между ними (машины не могут использовать такие данные);
- Симулятор: хранит информацию о состоянии мира (положение предметов, размеры объектов, условия их взаимодействия); эти данные могут быть использованы механическими руками для выполнения действий;
- Планировщик: более продвинутый уровень, который не только определяет местоположение объектов, но и рекомендует наилучшие способы их использования.
Atlas относится к категории симуляторов. Например, при съемке кухни он может определить глубину каждого пикселя и воссоздать трехмерную модель кухни; полученные данные могут быть использованы в игровых движках, программном обеспечении для проектирования или в коде управления роботическими руками.
II. Умные функции Atlas: решение сложных задач с помощью хранения информации о положении объектов
Технологические инновации Atlas заключаются в использовании мультимодальных входных данных и памяти пространственных отношений:
- Мультимодальные входные данные: Atlas обрабатывает текст, изображения, информацию о положении и направлении камеры (описываемую шестью числами) и глубинные изображения; например, снимки одного и того же предмета с разных точек позволяют системе распознать его;
- Память пространственных отношений: предыдущая версия продукта RTFM сталкивалась с проблемами: при длительном использовании слишком много данных занимало вычислительные ресурсы, или информация терялась (например, положение предметов менялось после перехода в другую часть симулированного пространства); Atlas использует информацию о положении объектов в качестве индекса для быстрого поиска нужных данных (аналогично тому, как мы сразу вспоминаем детали прошлых встреч).
III. Сочетание воссоздания реальности и вмешательства искусственного интеллекта: новый подход к созданию трехмерных сцен
Ранее для создания трехмерных сцен использовались два подхода:
- Реконструкция: воссоздание сцен на основе реальных фотографий; недостающие элементы оставались невидимыми;
- Генерация: искусственный интеллект создавал недостающие элементы на основе знаний о физических законах.
Atlas сочетает оба подхода: при наличии множества фотографий он использует их полностью; при их недостатке создает необходимые элементы. Например, на основе одной фотографии сада система может воссоздать окружающие объекты; при наличии фотографии домика — заменяет недостающие элементы на реальные. Для роботов важно только правильное положение и размеры объектов; их форма не играет ключевой роли.
IV. Использование симулятора для тренировки роботов
Основное применение Atlas — тренировка роботов:
После покупки компанией World Labs компании SceniX симулятор Atlas используется для обучения роботов; роботы могут выполнять задачи (упаковка, намотка кабелей, перенос пробирок) без участия человека; некоторые процессы могут продолжаться в течение часа без вмешательства. Симулятор не обязательно должен точно соответствовать реальности; например, коэффициенты трения стен в симуляторе могут отличаться от реальных, но если симуляция показывает, что определенный алгоритм работает лучше другого, робот будет действовать так же в реальности.
V. Путь команды Ли Фэйфэй от ImageNet к Atlas
Проект ImageNet, разработанный командой Ли Фэйфэй в 2009 году, позволял компьютерам распознавать объекты на фотографиях; теперь Atlas направлен на понимание их положения в пространстве: где находятся предметы, где они находились ранее, и могут ли они изменить свое положение после перемещения.
Существуют два подхода к решению этой задачи:
- Один подход предполагает автоматическое формирование трехмерной структуры на основе большого количества данных (например, проект Meta V-JEPA 2);
- Другой подход (Atlas) предполагает прямое вводение информации о положении камеры, геометрии объектов и физических законах в модель с самого начала.
Подход Atlas более практичен: трехмерные данные сложнее текста (онлайн-коллекции текстов ограничены), поэтому прямое задание правил модели обеспечивает более эффективное выполнение задач.
VI. Создание интерактивных виртуальных миров
Главная цель Atlas — сделать виртуальные миры интерактивными: роботы должны иметь возможность действовать в них (дотягиваться до предметов, пробовать различные варианты действий).
В заключение статьи приводится пример из книги «Изобретения Мореля»: его машина может идеально воссоздать прошедшие события, но не может совершать новых действий (например, опрокинуть стакан); Atlas же должен позволить роботам взаимодействовать с виртуальными объектами. Для обычных пользователей Atlas может не оказать сразу же значительного влияния на их жизнь, но он способствует повышению эффективности в таких областях, как робототехника, промышленное проектирование и создание цифровых двойников объектов. Например, роботы смогут оттачивать свои навыки в виртуальной среде, а затем применять их в реальности. Это важный шаг на пути от простого качественного визуального представления к полезному инструменту.