• Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов
AITechWorld
Самые важные события в мире искусственного интеллекта
Автор

admin

admin

    Генерация видео

    Runway показала GWM Worlds 2 — интерактивный мир вместо видеоролика

    admin 05.09.2026


    Runway 3 сентября показала GWM Worlds 2 — мировую модель, которая выдаёт живое интерактивное пространство вместо готового ролика. Картинка идёт непрерывным потоком в 720p при 24 кадрах в секунду, звук генерируется вместе с ней, а происходящим управляют текстом и движением камеры прямо во время генерации.

    Содержание

    1. Джетпак, зонт и затопленная комната
    2. WorldPrompt делит мир на два слоя
    3. От киносценария до реального времени
    4. Мультиплеер и мир одной фразой
    5. Почему картинку уводит при быстрых движениях
    6. Google и World Labs идут иначе
    7. Граница между роликом, игрой и агентом

    Мировые модели — отдельная ветка генеративного видео. Вместо готового клипа они держат сцену, по которой можно перемещаться, и достраивают её под действия зрителя. Runway описывает свой релиз как переход от генерации видео к симуляции и называет четыре области применения: интерактивные развлечения, виртуальные персонажи, робототехника с симуляцией агентов и генеративный дизайн. Пока это research preview, исследовательская демонстрация без публичного доступа.

    Джетпак, зонт и затопленная комната

    У сессии в GWM Worlds 2 нет заранее заданной длины. Модель не проигрывает заготовленный клип и не следует сценарию — каждый новый ввод продолжает мир с того состояния, в котором он находится. Пользователь задаёт окружение, действующих персонажей, визуальный стиль, физические правила и атмосферу, а дальше управляет происходящим командами и непрерывным движением камеры.

    Заявленный набор действий заметно шире перемещения по локации:

    • навигация от первого и от третьего лица — ходьба, бег, полёт, езда, осмотр по сторонам, причём камера и персонаж управляются независимо;
    • произвольные действия субъектов, от лазания и рывка на джетпаке до выстрела из лазерного пистолета, включения лампы и раскрытия зонта;
    • события всей сцены целиком, например затопление комнаты или смена погоды;
    • диалоги персонажей с контролем голоса, интонации и языка речи, причём артикуляция генерируется синхронно с озвучкой.

    WorldPrompt делит мир на два слоя

    Для описания мира Runway предложила собственный формат ввода — WorldPrompt. Он разделяет состояние сцены на то, что сохраняется постоянно, и то, что меняется во времени.

    Постоянный слой включает genesis prompt, описание сцены с её геометрией, материалами, освещением и фоновым звуком. Туда же идут список субъектов с их свойствами и «законы» мира — гравитация, столкновения, способности персонажей, ракурс камеры. Дополнительно задаётся первый кадр, который визуально заземляет генерацию.

    Второй слой — поток событий с временными метками. Каждое действие представляет собой свободный текст с началом и концом, адресованный конкретному субъекту или сцене целиком. Действия могут накладываться друг на друга, а отдельным потоком идёт покадровое положение и поворот камеры.

    От киносценария до реального времени

    Runway описывает три режима работы с моделью:

    • заранее — весь поток событий пишется до старта, при желании с помощью языковой модели, после чего система генерирует итоговое видео со звуком целиком; это ближе к режиссуре;
    • пошагово — генерация останавливается в точках выбора, подходит для визуальных новелл;
    • в реальном времени — действия влияют на поток немедленно, и именно этот режим нужен играм и интерактивным проектам.

    Здесь же обозначено главное техническое ограничение подхода. Набирать текст на ходу слишком медленно, а внешние мультимодальные модели не успевают реагировать за десятки миллисекунд. В демонстрации проблему обходят привязкой готовых промптов к клавишам и мыши: клавиша движения вперёд соответствует фразе «персонаж идёт вперёд», клик — броску мяча. Разработчики признают, что качество в таком режиме ниже, чем при заранее написанном сценарии, потому что развёрнутый текст успевает описать гораздо больше деталей сцены. Свободный текст как интерфейс управления пока остаётся на бумаге — в живом демо это обычная игровая раскладка.

    Мультиплеер и мир одной фразой

    Поскольку GWM Worlds 2 оперирует понятием субъекта, разные пользователи могут управлять разными персонажами одновременно. В демоверсии это сделано через роли — «игрок 1», «игрок 2», «режиссёр», — у каждой свой набор доступных действий. Трансляция видео и звука всем участникам организована на базе LiveKit, а клиент выбирает роль при подключении.

    Отдельно показан сценарий авторинга. Вместо ручного написания genesis prompt и списка действий пользователь вводит короткую фразу вроде «кроссовый мотоцикл от третьего лица в заснеженном ландшафте», а языковая модель сама собирает первый кадр, описание мира и раскладку действий по клавишам. Всё это можно отредактировать до запуска, и путь от идеи до готового мира занимает секунды.

    Почему картинку уводит при быстрых движениях

    GWM Worlds 2 устроена как авторегрессионная диффузионная модель, генерирующая видео и аудио разом. На каждом шаге она опирается на три типа контекста — глобальный (genesis prompt и первый кадр), текущий кадр (положение камеры и активные текстовые действия) и уже сгенерированные кадры, которые хранятся в скользящем окне кэша. Старые кадры из этого окна вытесняются, декодеры видео и звука работают с кэшем ради скорости.

    Отсюда и слабые места, которые Runway перечисляет открыто. Генерация в реальном времени меняет качество на скорость, и при быстрых движениях камеры детали, текстуры и геометрия начинают плыть. Долговременная согласованность мира несовершенна, а референсные изображения, кроме первого кадра, не поддерживаются. Полноценное управление свободным текстом требует внешней обвязки, которая отслеживала бы состояние мира и генерировала действия на лету, например реплики неигровых персонажей.

    Компания сравнивает нынешний этап с ранней историей офлайновой генерации видео. Та прошла путь от коротких грубых клипов до материала продакшен-качества. В реальном времени, по мнению разработчиков, повторится та же кривая, а GWM Worlds 2 они называют очень ранней точкой на ней.

    Google и World Labs идут иначе

    GWM Worlds 2 продолжает линейку GWM-1, представленную в декабре 2025 года вместе с вариантами для миров, роботов и аватаров. С тех пор Runway закрыла раунд Series E на 315 млн долларов при оценке в 5,3 млрд, пообещав направить деньги на предобучение следующего поколения мировых моделей.

    Конкуренция в сегменте плотная. Google раздаёт доступ к экспериментальному Project Genie на базе Genie 3 подписчикам старших тарифов, World Labs вывела на рынок Marble для генерации трёхмерных пространств, а профильные стартапы за 2026 год привлекли сотни миллионов долларов каждый. Ставка Runway на этом фоне выглядит специфично. Компания строит непрерывный аудиовизуальный поток, которым управляют текстом, без трёхмерной сцены и игрового движка под ним, с расчётом на то, что тот же интерфейс пригодится и для развлечений, и для обучения роботов.

    Граница между роликом, игрой и агентом

    Публичного доступа, ценника или листа ожидания Runway пока не объявляла, анонс ограничен исследовательской страницей и демонстрационным роликом. Судить об успехе можно будет по первому показу вне демо — когда мир придётся держать дольше пары минут и на чужом сценарии.

    Практический смысл релиза для отрасли скорее концептуальный. Если управление симуляцией сводится к тексту с временными метками, граница между «снять видео», «сделать игру» и «обучить агента» становится куда менее чёткой, чем сейчас.



    Источник

    05.09.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Новости

    Росстандарт предложил написать первый в мире стандарт для ИИ в измерениях

    admin 05.09.2026
    05.09.2026

    Росстандарт вышел с инициативой разработать межгосударственный стандарт по применению ИИ в измерениях — такого документа в мире пока нет ни …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Spotify запускает инструмент для создания аудиокниг на базе ElevenLabs

    admin 05.09.2026
    05.09.2026

    Spotify представила сразу несколько новинок — в том числе новый ИИ-инструмент на базе ElevenLabs, который позволит самостоятельно создавать и публиковать …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    ИИ меняет кибербезопасность быстрее, чем компании успевают адаптироваться — даже Google

    admin 05.09.2026
    05.09.2026

    За кулисами мероприятия в Лос-Анджелесе операционный директор Google Cloud Фрэнсис деСоуза сформулировал главный тезис о безопасности ИИ: её нельзя «прикрутить …

    0 VKOdnoklassnikiEmail
  • Новости

    Роботакси Baidu массово «зависли» в Ухане, заперев пассажиров и спровоцировав аварии и пробки

    admin 05.09.2026
    05.09.2026

    Многочисленные роботакси, эксплуатируемые китайским технологическим гигантом Baidu, во вторник «зависли» в крупном городе, из-за чего, как сообщается, пассажиры оказались заперты …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI раздаёт кибермодель по пропускам: GPT-5.6-Cyber уже нашёл уязвимость в Chrome

    admin 04.09.2026
    04.09.2026

    GPT-5.6-Cyber нашёл в движке Chrome две неизвестные уязвимости, которые связываются в цепочку и позволяют выйти за пределы защиты браузера. Google …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    YouTube начнёт автоматически маркировать ИИ-видео

    admin 04.09.2026
    04.09.2026

    ИИ-видео на YouTube теперь будут маркироваться автоматически. Платформа больше не будет полагаться только на авторов: если внутренние системы обнаружат использование …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Разработчики отказываются работать без ИИ — и это может им аукнуться

    admin 04.09.2026
    04.09.2026

    В 2026 году, как выяснили исследователи, разработчиков уже невозможно вырвать из железной хватки ИИ-инструментов для программирования. Но хотя ИИ, несомненно, …

    0 VKOdnoklassnikiEmail
  • Новости

    Anthropic случайно заблокировала тысячи репозиториев на GitHub, пытаясь скрыть утечку исходников Claude Code

    admin 04.09.2026
    04.09.2026

    Во вторник один инженер-программист обнаружил, что Anthropic, по всей видимости случайно, включила доступ к исходному коду Claude Code в недавний …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    OpenAI представила GPT-6 Astra — модель умеет работать за пользователя на компьютере

    admin 03.09.2026
    03.09.2026

    OpenAI представила GPT-6 Astra — новую модель с упором на работу с компьютером, программирование, исследования и многошаговые задачи. Компания описывает …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • Anthropic пустила ИИ-агентов к микроскопам, дозаторам и роботам-манипуляторам
  • ByteDance отложила глобальный запуск генератора видео Seedance 2.0 из‑за правовых рисков
  • Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной графики и спорная реакция аудитории
  • Encyclopedia Britannica и Merriam‑Webster подали в суд на OpenAI из‑за нарушения авторских прав
  • Google пустила Gemini в полные тексты книг — по одной купленной копии на читателя

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • Anthropic пустила ИИ-агентов к микроскопам, дозаторам и роботам-манипуляторам

    17.09.2026
  • ByteDance отложила глобальный запуск генератора видео Seedance 2.0 из‑за правовых рисков

    17.09.2026
  • Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной графики и спорная реакция аудитории

    17.09.2026
  • Encyclopedia Britannica и Merriam‑Webster подали в суд на OpenAI из‑за нарушения авторских прав

    16.09.2026
  • Google пустила Gemini в полные тексты книг — по одной купленной копии на читателя

    16.09.2026
  • Picsart представила маркетплейс ИИ-агентов для создателей контента и продавцов

    16.09.2026

Рубрики

  • Генерация видео (113)
  • Генерация звука (23)
  • Генерация изображений (87)
  • Генерация текста (68)
  • Новости (113)
  • Обзор сервисов (77)

Anthropic пустила ИИ-агентов к микроскопам, дозаторам и роботам-манипуляторам

17.09.2026

ByteDance отложила глобальный запуск генератора видео Seedance 2.0...

17.09.2026

Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной...

17.09.2026

Encyclopedia Britannica и Merriam‑Webster подали в суд на...

16.09.2026

Google пустила Gemini в полные тексты книг —...

16.09.2026

Обзоры

  • ByteDance отложила глобальный запуск генератора видео Seedance 2.0 из‑за правовых рисков

    17.09.2026
  • Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной графики и спорная реакция аудитории

    17.09.2026
  • Picsart представила маркетплейс ИИ-агентов для создателей контента и продавцов

    16.09.2026

Выбор редакции

  • Adobe представила инструмент Project Res-Up на базе ИИ для повышения качества видео и GIF-файлов.

    23.08.2026
  • SANA-Sprint: новая эра генерации изображений – молниеносно и качественно

    08.07.2026
  • Промт для Nano Banana: Гиперреалистичная рождественская фотосцена

    14.07.2026

Популярное

  • 1

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 2

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 3

    Google встроил в Gemini генератор музыки Lyria 3

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026 - aitechworld.ru


Наверх
AITechWorld
  • Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов