Корона

ИИ научился создавать интерактивные миры, по которым можно ходить в реальном времени

Google DeepMindработа от 5 августа 2025 г.3 мин чтения
Схема: сетка в перспективе уходит к горизонту с горами — мир, который достраивается на ходу
Схема: редакция «Короны»

Генераторы видео умеют снимать ролики по описанию, но в ролик нельзя войти. В августе 2025 года Google DeepMind показала Genie 3 — модель мира, которая по текстовому запросу создаёт среду, где можно перемещаться, и генерирует её в реальном времени в ответ на ваши действия. Это шаг к тренажёрам для ИИ-агентов и роботов, которым нужен безграничный запас разных сред.

Что именно исследовали

«Модель мира» — это ИИ, который строит внутреннюю картину среды и умеет предсказывать, что в ней произойдёт дальше, особенно в ответ на действия. Такие модели считаются важными для агентов: чтобы планировать, полезно уметь «проиграть» последствия в уме.

Genie 3 — третья модель серии. Задача была сделать мир не только красивым, но и интерактивным и устойчивым: чтобы он реагировал на управление без задержки и не рассыпался через несколько секунд.

Как это работает

Модель рисует мир кадр за кадром. Каждый новый кадр она строит, глядя на предыдущие кадры и на действие пользователя — повернуть, шагнуть вперёд. Готовой трёхмерной сцены внутри нет: связность мира модель «держит» сама.

Это похоже на сон, который помнит обстановку: вы отвернулись от дома, прошли по улице, вернулись — и дом на месте, такой же, как был.

Помимо движения мир можно менять текстом: например, изменить погоду или добавить объекты и персонажей.

Что ИИ теперь умеет

  • Создавать мир по текстовому описанию и достраивать его в реальном времени, пока пользователь двигается
  • Помнить уже показанные места примерно в течение минуты и сохранять связность несколько минут
  • Менять мир по текстовой команде прямо во время прогулки: погода, новые объекты и персонажи

Что показал эксперимент

  • Разрешение 720p, 24 кадра в секунду, генерация в реальном времени.
  • Мир остаётся в целом связным несколько минут.
  • Визуальная память — примерно минута: вернувшись, вы увидите то же, что оставили.

Отдельной научной статьи с цифрами на бенчмарках к модели не выходило: результаты описаны в техническом отчёте в блоге DeepMind и показаны на примерах.

Что пока не работает

  • Набор действий, которые может совершать агент в таком мире, пока ограничен.
  • Сложные взаимодействия нескольких агентов модель воспроизводит плохо.
  • Реальные места с географической точностью модель не воспроизводит.
  • Текст внутри мира получается неразборчивым.
  • Взаимодействие длится минуты, а не часы.

Эти ограничения DeepMind называла при анонсе в августе 2025 года.

Почему это важно

Агентов и роботов трудно учить в реальном мире: это дорого, медленно и небезопасно. Модель мира может стать бесконечным тренажёром, где среду можно создать под любую задачу.

Для обычного пользователя это новый тип медиа: не ролик, который смотришь, а пространство, по которому можно пройти.

Можно ли попробовать

Оригинальное исследование

Genie 3: A new frontier for world models

Авторы
Jack Parker-Holder, Shlomi Fruchter и команда Google DeepMind
Организация
Google DeepMind
Дата
5 августа 2025 г.
Тип
Технический отчёт или блог лаборатории
Разбор опубликован 21 сентября, 16:13Поделиться