• Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов
AITechWorld
Самые важные события в мире искусственного интеллекта
Автор

admin

admin

    Генерация видео

    MiniMax выпустила видеомодель H3 — ролики в 2K со звуком

    admin 10.08.2026


    MiniMax 31 июля представила H3 — мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики до 15 секунд в 2K с нативным стереозвуком. Модель уже работает через API, а веса компания обещает открыть в ближайшие дни.

    Содержание

    1. Один запрос вместо четырёх режимов
    2. 2K по умолчанию, от 4 до 15 секунд
    3. Цена как главный аргумент MiniMax
    4. H3-VAE и регенерация вместо апскейла
    5. Открытые веса обещаны «в ближайшие дни»
    6. Реклама, товарные карточки и заставки
    7. Всё упирается в дату публикации весов

    MiniMax — китайская компания, известная по линейке видеомоделей Hailuo (Хайлуо) и текстовым моделям серии M. H3 продолжает эту линию: в документации API модель проходит под рабочим именем Hailuo-03, но в публичном анонсе название сменили. Компания подаёт релиз как попытку убрать границы между отдельными режимами генерации и заодно вернуть видеомодели в открытый доступ.

    Один запрос вместо четырёх режимов

    До сих пор видеогенерация была разбита на отдельные задачи: текст в видео, картинка в видео, первый и последний кадр, перенос движения, референс по персонажу, редактирование. Под каждую обычно шла своя модель или свой режим. H3 принимает всё это в одном запросе — текст, изображения, ролики и аудио складываются в общий контекст, а связь между ними описывается обычными словами.

    Пример из анонса MiniMax выглядит так: «Возьми движение камеры из видео 1, пусть персонаж с изображения 2 поёт, а голос совпадает с аудио 3». Модель сама разбирается, что здесь референс движения, что источник внешности, а что образец голоса. Отдельных переключателей режима нет.

    2K по умолчанию, от 4 до 15 секунд

    В API H3 доступна асинхронно: запрос возвращает идентификатор задачи, готовый ролик забирается отдельным вызовом. Разрешение сейчас одно — 2K. Длительность задаётся целым числом секунд в диапазоне от 4 до 15. Пропорции кадра выбираются из набора 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 либо подбираются автоматически под входной материал.

    Ограничения на вход у MiniMax довольно щедрые:

    • до 9 референсных изображений, до 3 референсных видео и до 3 аудиодорожек в одном запросе;
    • каждый референсный клип от 2 до 15 секунд, суммарно не больше 15;
    • изображение до 30 МБ, видео до 50 МБ, аудио до 15 МБ, всё тело запроса до 64 МБ.

    Текстовый промпт обязателен всегда, даже когда основную работу делают референсы. Аудио отдельно, без картинки или видео, модель не примет.

    Цена как главный аргумент MiniMax

    Экономику MiniMax описывает в относительных величинах: секунда в 2K обходится меньше трети от цены основных конкурентов, а в 768p — меньше половины от их же 720p. Абсолютных цифр в анонсе нет, конкретные модели для сравнения не названы.

    Здесь нужно оговориться. Режим 768p упомянут в тексте про цены, но в самой документации API разрешение пока предлагается только одно, 2K. Либо более дешёвый режим появится позже, либо сравнение приведено для внутренних расчётов. Проверить утверждение о цене на своей задаче получится не раньше, чем откроется второй режим или появится публичный прайс-лист.

    H3-VAE и регенерация вместо апскейла

    Техническая часть у MiniMax держится на нескольких решениях. Новый токенизатор H3-VAE даёт четырёхкратный выигрыш по эффективной длине последовательности, и именно он позволяет считать 2K нативно, а не догонять разрешение постобработкой. Архитектура H3-Omni Transformer разводит вычисления на понимание и на генерацию по разным контурам, что подняло пропускную способность обучения почти на 30%.

    Самое любопытное решение — отказ от отдельного модуля апскейла. Вместо него H3 заново генерирует собственный черновик низкого разрешения, снова опираясь на исходный контекст. По замыслу MiniMax это возвращает мелкие детали и текст на вывесках, которые обычный увеличитель разрешения способен только додумать. Полный технический отчёт компания обещает опубликовать позже.

    Открытые веса обещаны «в ближайшие дни»

    Видеогенерация до сих пор остаётся вотчиной закрытых моделей — открытых релизов сопоставимого уровня почти нет, и экосистема вокруг них развивается медленнее, чем вокруг языковых моделей. MiniMax собирается выложить веса H3 «в ближайшие дни, с учётом применимого законодательства». Формулировка осторожная, срок мягкий, но совместимость с разным железом компания закладывала в архитектуру с самого начала.

    Если обещание выполнят, H3 станет одной из первых крупных открытых моделей для мультимодальной генерации видео. Развернуть её у себя и дообучить под конкретную нишу — сценарий, которого рынку сейчас не хватает больше, чем очередного роста качества.

    Реклама, товарные карточки и заставки

    Целевые сценарии MiniMax называет прямо: реклама, брендинг, электронная коммерция, промышленный дизайн, интерфейсы, игры. В демонстрациях — киношные титры, промо-ролик для сайта продукта, оживший постер и рекламные вставки для магазина. Отдельно компания подчёркивает аккуратную отрисовку текста и логотипов, что для товарной съёмки важнее эффектных планов.

    Подбор примеров говорит о приоритетах. H3 продают не как инструмент для авторского кино, а как рабочую лошадь для контента, который производят пачками и по техзаданию.

    Всё упирается в дату публикации весов

    Заявленные MiniMax цифры пока опираются только на собственные тесты компании: независимых замеров качества и сравнений с конкурентами нет, абсолютных цен тоже. Ближайшая проверочная точка — выкладка весов. Появятся они в течение недели-двух, и у сообщества будет чем мерить; затянется срок или изменится формулировка про «применимое законодательство» — и H3 останется ещё одним API среди прочих, с хорошим прайсом и обычной для отрасли закрытостью.



    Источник

    10.08.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    GPT-5.5-Cyber. Почему новую версию не покажут обычным пользователям

    admin 10.08.2026
    10.08.2026

    Недавно британский государственный институт, который проверяет ИИ-модели на предмет опасных способностей, дал нейросети GPT-5.5 необычную задачу. Ей подсунули программу со …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    OmniVoice от Xiaomi. Как работает ИИ, способный говорить на сотнях языков

    admin 10.08.2026
    10.08.2026

    Несколько секунд чьего-то голоса, и нейросеть от Xiaomi уже готова заговорить этим голосом хоть на суахили, хоть на узбекском. Да …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Как оплатить Higgsfield AI и какие есть тарифы: подробный гайд

    admin 10.08.2026
    10.08.2026

    ???? Введение С каждым днём всё больше пользователей интересуются продвинутыми возможностями нейросети Higgsfield AI — от уникальных эффектов до создания …

    0 VKOdnoklassnikiEmail
  • Новости

    DoorDash представила новые инструменты на базе ИИ для продавцов: ускоренный онбординг, улучшение фото и создание сайтов

    admin 10.08.2026
    10.08.2026

    DoorDash добавила новые инструменты на базе ИИ, которые позволяют продавцам ускорить подключение к платформе, редактировать фотографии, чтобы блюда выглядели лучше, …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    OpenAI выпустит умную колонку в форме пончика — она может стоить $300–400

    admin 08.08.2026
    08.08.2026

    OpenAI разрабатывает портативную умную колонку без экрана размером примерно с хоккейную шайбу и с отверстием в центре. Из-за этой особенности …

    0 VKOdnoklassnikiEmail
  • Новости

    Цифровые паспорта в России — революция или эволюция?

    admin 08.08.2026
    08.08.2026

    Скоро в России можно будет использовать цифровые паспорта вместо бумажных. Что это даст и есть ли подводные камни? . Эксперты …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Почему все снова говорят о китайской модели DeepSeek? Чем удивила новая модель V4

    admin 08.08.2026
    08.08.2026

    Полтора года назад китайская компания DeepSeek выпустила модель R1, и за один день акции Nvidia потеряли почти 600 миллиардов долларов …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Google научила нейросеть монтировать видео через чат. На что способна Gemini Omni

    admin 08.08.2026
    08.08.2026

    Если взглянуть на то, что происходит с искусственным интеллектом прямо сейчас, возникает чувство, что технологические компании только и делают, что …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Higgsfield AI vs Pika Labs vs Runway — Сравнение лучших нейросетей для генерации видео

    admin 08.08.2026
    08.08.2026

    ???? Введение С развитием генеративных нейросетей всё больше креаторов и SMM-специалистов задаются вопросом:какая из платформ — Higgsfield AI, Pika Labs …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • 20 промтов для осенней ИИ-фотосессии в нейросетях
  • Anthropic пустила ИИ-агентов к микроскопам, дозаторам и роботам-манипуляторам
  • ByteDance отложила глобальный запуск генератора видео Seedance 2.0 из‑за правовых рисков
  • Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной графики и спорная реакция аудитории
  • Encyclopedia Britannica и Merriam‑Webster подали в суд на OpenAI из‑за нарушения авторских прав

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • 20 промтов для осенней ИИ-фотосессии в нейросетях

    17.09.2026
  • Anthropic пустила ИИ-агентов к микроскопам, дозаторам и роботам-манипуляторам

    17.09.2026
  • ByteDance отложила глобальный запуск генератора видео Seedance 2.0 из‑за правовых рисков

    17.09.2026
  • Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной графики и спорная реакция аудитории

    17.09.2026
  • Encyclopedia Britannica и Merriam‑Webster подали в суд на OpenAI из‑за нарушения авторских прав

    16.09.2026
  • Google пустила Gemini в полные тексты книг — по одной купленной копии на читателя

    16.09.2026

Рубрики

  • Генерация видео (113)
  • Генерация звука (23)
  • Генерация изображений (87)
  • Генерация текста (69)
  • Новости (113)
  • Обзор сервисов (77)

20 промтов для осенней ИИ-фотосессии в нейросетях

17.09.2026

Anthropic пустила ИИ-агентов к микроскопам, дозаторам и роботам-манипуляторам

17.09.2026

ByteDance отложила глобальный запуск генератора видео Seedance 2.0...

17.09.2026

Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной...

17.09.2026

Encyclopedia Britannica и Merriam‑Webster подали в суд на...

16.09.2026

Обзоры

  • ByteDance отложила глобальный запуск генератора видео Seedance 2.0 из‑за правовых рисков

    17.09.2026
  • Nvidia представила DLSS 5: генеративный ИИ для фотореалистичной графики и спорная реакция аудитории

    17.09.2026
  • Picsart представила маркетплейс ИИ-агентов для создателей контента и продавцов

    16.09.2026

Выбор редакции

  • Kling AI прокачала генерацию видео — теперь персонажи «живут» на экране

    12.07.2026
  • Банки Беларуси интегрируют искусственный интеллект для борьбы с мошенничеством

    27.07.2026
  • OpenAI выпустила GPT-5.1 — ChatGPT стал «умнее» и с характером

    27.06.2026

Популярное

  • 1

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 2

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 3

    Google встроил в Gemini генератор музыки Lyria 3

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026 - aitechworld.ru


Наверх
AITechWorld
  • Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов