ИИ научился создавать интерактивные миры, по которым можно ходить в реальном времени

Генераторы видео умеют снимать ролики по описанию, но в ролик нельзя войти. В августе 2025 года Google DeepMind показала Genie 3 — модель мира, которая по текстовому запросу создаёт среду, где можно перемещаться, и генерирует её в реальном времени в ответ на ваши действия. Это шаг к тренажёрам для ИИ-агентов и роботов, которым нужен безграничный запас разных сред.
Что именно исследовали
«Модель мира» — это ИИ, который строит внутреннюю картину среды и умеет предсказывать, что в ней произойдёт дальше, особенно в ответ на действия. Такие модели считаются важными для агентов: чтобы планировать, полезно уметь «проиграть» последствия в уме.
Genie 3 — третья модель серии. Задача была сделать мир не только красивым, но и интерактивным и устойчивым: чтобы он реагировал на управление без задержки и не рассыпался через несколько секунд.
Как это работает
Модель рисует мир кадр за кадром. Каждый новый кадр она строит, глядя на предыдущие кадры и на действие пользователя — повернуть, шагнуть вперёд. Готовой трёхмерной сцены внутри нет: связность мира модель «держит» сама.
Это похоже на сон, который помнит обстановку: вы отвернулись от дома, прошли по улице, вернулись — и дом на месте, такой же, как был.
Помимо движения мир можно менять текстом: например, изменить погоду или добавить объекты и персонажей.
Что ИИ теперь умеет
- Создавать мир по текстовому описанию и достраивать его в реальном времени, пока пользователь двигается
- Помнить уже показанные места примерно в течение минуты и сохранять связность несколько минут
- Менять мир по текстовой команде прямо во время прогулки: погода, новые объекты и персонажи
Что показал эксперимент
- Разрешение 720p, 24 кадра в секунду, генерация в реальном времени.
- Мир остаётся в целом связным несколько минут.
- Визуальная память — примерно минута: вернувшись, вы увидите то же, что оставили.
Отдельной научной статьи с цифрами на бенчмарках к модели не выходило: результаты описаны в техническом отчёте в блоге DeepMind и показаны на примерах.
Что пока не работает
- Набор действий, которые может совершать агент в таком мире, пока ограничен.
- Сложные взаимодействия нескольких агентов модель воспроизводит плохо.
- Реальные места с географической точностью модель не воспроизводит.
- Текст внутри мира получается неразборчивым.
- Взаимодействие длится минуты, а не часы.
Эти ограничения DeepMind называла при анонсе в августе 2025 года.
Почему это важно
Агентов и роботов трудно учить в реальном мире: это дорого, медленно и небезопасно. Модель мира может стать бесконечным тренажёром, где среду можно создать под любую задачу.
Для обычного пользователя это новый тип медиа: не ролик, который смотришь, а пространство, по которому можно пройти.
Можно ли попробовать
Оригинальное исследование
Genie 3: A new frontier for world models
- Авторы
- Jack Parker-Holder, Shlomi Fruchter и команда Google DeepMind
- Организация
- Google DeepMind
- Дата
- 5 августа 2025 г.
- Тип
- Технический отчёт или блог лаборатории