• Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов
AITechWorld
Самые важные события в мире искусственного интеллекта
Автор

admin

admin

    Генерация текста

    Qwen открыла исходный код Qwen3-TTS — это ИИ для генерация речи с задержкой от 97 мс

    admin 26.06.2026


    Команда Qwen объявила об открытии исходного кода и весов всей серии Qwen3-TTS. Это набор моделей для генерации речи, клонирования голоса и «Voice Design» — создания нового тембра по текстовому описанию.

    Модели уже доступны в открытом доступе на ModelScope, Hugging Face и GitHub. Также они подключаются через Qwen API для облачного использования.

    Нейросеть Qwen3-TTS — что это и что умеет

    Qwen3-TTS — это стриминговые TTS-модели с архитектурой Dual-Track. Ключевая особенность — сверхнизкая задержка: первый аудиофрагмент может приходить уже после ввода одного символа, а заявленная сквозная задержка начинается от 97 мс.

    Линейка построена без DiT-подхода и ориентирована на end-to-end генерацию речи. Модели выпускаются в двух размерах: версия на 1,7 млрд параметров для максимального качества и версия на 0,6 млрд — для более экономичных и быстрых сценариев.

    Отдельный акцент сделан на многоязычность. Модели поддерживают 10 языков: китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский, а также различные диалектные варианты.

    Как пользоваться

    Для быстрого старта доступны онлайн-демо на платформах с моделями. Для локального запуска можно скачать веса и код из репозиториев, например на Hugging Face. Там же доступно демо:

    В облаке Qwen3-TTS работает через API с оплатой по количеству входных символов, без необходимости разворачивать инфраструктуру самостоятельно.

    Почему это важно? Минимальная задержка делает Qwen3-TTS пригодным для реального диалога — голосовых ассистентов, игр, интерактивных интерфейсов и live-озвучки.

    Для рынка это означает появление мощного open-source инструмента, который может конкурировать с закрытыми решениями. Поддержка русского языка «из коробки» и отсутствие привязки к сложной диффузионной архитектуре делают модель привлекательной для создания локальных голосовых помощников и систем озвучки контента.

    Таким образом, индустрия ИИ активно движется в сторону мультимодальности и снижения задержек (low latency). Ранее стандартом считалась потоковая передача после генерации предложения или фразы, теперь борьба идет за миллисекунды. Qwen продолжает стратегию открытия своих разработок, следуя тренду, заданному релизами Llama и Mistral, но с фокусом на мультимедийные возможности.

    Итог: Разработчики получили бесплатный доступ к быстрой и мультиязычной нейросети для синтеза речи, способной работать практически в реальном времени.

    Ранее Google выпустила TranslateGemma — открытые ИИ-модели для перевода.



    Источник

    26.06.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Генерация изображений

    Промты для зимней ИИ-фотосессии, +нейросети для генерации фото

    admin 26.06.2026
    26.06.2026

    Приближается зима — самое время для атмосферных фотосессий. Но не везде всё так просто: где-то снег ещё не выпал или …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    Вышел Kling O1 — рассуждающая нейросеть для генерации и редактирования видео

    admin 26.06.2026
    26.06.2026

    Kling AI выпустила новую ИИ-модель Kling O1 (Omni One). Это рассуждающая нейросеть, которая генерирует видео по тексту и редактирует уже …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    OpenAI запустила групповые чаты в ChatGPT — ИИ можно добавить в диалог с друзьями или коллегами

    admin 26.06.2026
    26.06.2026

    OpenAI запустила групповые чаты в ChatGPT: теперь в одном диалоге могут общаться сразу несколько человек и чат-бот. Функция уже работает …

    0 VKOdnoklassnikiEmail
  • Генерация изображений

    Kuaishou выводит Kolors 2.1 в элиту генерации изображений

    admin 26.06.2026
    26.06.2026

    Kolors 2.1 от Kuaishou Kling AI уверенно ворвалась в пятёрку лидеров рейтинга Artificial Analysis Image Arena — престижной площадки, оценивающей …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    LetzAI выпустила V4: видео на основе изображений, новый редактор и доступные цены

    admin 26.06.2026
    26.06.2026

    Компания LetzAI представила четвертое поколение своей платформы — LetzAI V4. Новая версия открывает пользователям доступ к первым видеомоделям, обновленному редактору …

    0 VKOdnoklassnikiEmail
  • Новости

    ComfyUI получила поддержку Hunyuan 3D 3.0 — генерация 3D-моделей по тексту и изображениям

    admin 26.06.2026
    26.06.2026

    Платформа ComfyUI подключила к своей экосистеме модель Hunyuan 3D 3.0 от Tencent и фактически вывела генерацию трёхмерных объектов на новый …

    0 VKOdnoklassnikiEmail
  • Генерация изображений

    Промт для Nano Banana: Сочный флэтлей для рекламы уходовой косметики с застывшими брызгами

    admin 26.06.2026
    26.06.2026

    Nano Banana идеально подходит для создания сочных, аппетитных и гипердетализированных изображений, которые являются золотым стандартом в рекламе премиальной косметики и …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    Luma AI Prompts: Оживление HD фото с Dream Machine

    admin 26.06.2026
    26.06.2026

    Технологии генеративного ИИ совершили революцию в работе с визуальным контентом. Особый интерес вызывает Luma AI Dream Machine — инструмент, преобразующий …

    0 VKOdnoklassnikiEmail
  • Генерация звука

    ElevenLabs запустил генерацию музыки для видео

    admin 25.06.2026
    25.06.2026

    Нейросеть ElevenLabs научилась генерировать саундтреки для видео. Загружаете ролик — сервис анализирует картинку, ритм и настроение и за несколько секунд …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • Google выпустила Gemini 3.5 Transcribe: диктовка сама убирает «эм» и правит оговорки
  • City Detect помогает городам выявлять запущенность зданий и районов с помощью компьютерного зрения и ИИ
  • Для ИИ — мегаватты, для землевладельцев — ад: как новые ЛЭП к дата-центрам перекраивают Америку
  • Claude получил собственный браузер и перестал спрашивать разрешение на каждый шаг
  • OpenAI приобрела стартап Promptfoo для улучшения безопасности ИИ-агентов

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • Google выпустила Gemini 3.5 Transcribe: диктовка сама убирает «эм» и правит оговорки

    20.09.2026
  • City Detect помогает городам выявлять запущенность зданий и районов с помощью компьютерного зрения и ИИ

    20.09.2026
  • Для ИИ — мегаватты, для землевладельцев — ад: как новые ЛЭП к дата-центрам перекраивают Америку

    20.09.2026
  • Claude получил собственный браузер и перестал спрашивать разрешение на каждый шаг

    19.09.2026
  • OpenAI приобрела стартап Promptfoo для улучшения безопасности ИИ-агентов

    18.09.2026
  • Alibaba открыла веса Qwen3.8-Flash-Next и показала, из чего будет собрана Qwen4

    18.09.2026

Рубрики

  • Генерация видео (113)
  • Генерация звука (23)
  • Генерация изображений (87)
  • Генерация текста (69)
  • Новости (118)
  • Обзор сервисов (81)

Google выпустила Gemini 3.5 Transcribe: диктовка сама убирает...

20.09.2026

City Detect помогает городам выявлять запущенность зданий и...

20.09.2026

Для ИИ — мегаватты, для землевладельцев — ад:...

20.09.2026

Claude получил собственный браузер и перестал спрашивать разрешение...

19.09.2026

OpenAI приобрела стартап Promptfoo для улучшения безопасности ИИ-агентов

18.09.2026

Обзоры

  • City Detect помогает городам выявлять запущенность зданий и районов с помощью компьютерного зрения и ИИ

    20.09.2026
  • Для ИИ — мегаватты, для землевладельцев — ад: как новые ЛЭП к дата-центрам перекраивают Америку

    20.09.2026
  • YouTube расширяет технологию выявления дипфейков: доступ получат политики, чиновники и журналисты

    18.09.2026

Выбор редакции

  • OpenAI добавила в Codex плагины для анализа данных, дизайна и других рабочих задач

    02.07.2026
  • Google пустила Gemini в полные тексты книг — по одной купленной копии на читателя

    16.09.2026
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

    15.09.2026

Популярное

  • 1

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 2

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 3

    Google встроил в Gemini генератор музыки Lyria 3

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026 - aitechworld.ru


Наверх
AITechWorld
  • Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов