• Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов
AITechWorld
Самые важные события в мире искусственного интеллекта
Автор

admin

admin

    Генерация текста

    DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

    admin 22.06.2026


    Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает страницу в визуальные токены, чтобы LLM могла читать документы быстрее и дешевле.

    На vLLM 0.8.5 модель выдаёт около 2500 токенов в секунду на GPU A100-40G. Postium собрал ключевые детали о новинке.

    DeepSeek-OCR — что это и как работает

    DeepSeek-OCR — новая система распознавания текста от компании DeepSeek, созданная специально для работы с большими языковыми моделями (LLM).

    Главная идея — не просто превращать изображение в текст, а сжимать визуальный контекст страницы (документа, PDF) в компактный набор токенов, которые LLM потом «распаковывает» и понимает.

    Как это работает:

    1. Страница превращается в визуальные токены. Модель анализирует изображение (скан, PDF) и кодирует его в десятки, а не тысячи токенов.
    2. LLM получает компактное представление. Эти токены уже содержат информацию о тексте, структуре (таблицы, списки) и формате документа.
    3. Распаковка и понимание. Внутри LLM эти токены преобразуются обратно в текст и структуру — без необходимости видеть каждый пиксель.

    Результат — LLM понимает документ целиком, но тратит в 10–20 раз меньше контекста, чем при обычном OCR.

    На бенчмарке OmniDocBench DeepSeek-OCR опережает GOT-OCR 2.0 и MinerU 2.0, используя при этом в 2–3 раза меньше визуальных токенов.

    Почему это важно: DeepSeek-OCR делает работу LLM с документами быстрее — до 2500 токенов/с на GPU A100, дешевле — за счёт меньшего числа токенов при инференсе, точнее — сохраняя 97% точности при 10-кратном сжатии, и гибче — поддерживая PDF, сканы и изображения напрямую через vLLM.

    Где может применяться:

    • Автоматический разбор контрактов, отчётов, форм;
    • Быстрое извлечение данных из длинных PDF;
    • Подготовка структурированных ответов (JSON, Markdown, таблицы);
    • Встраивание в RAG-пайплайны и чат-ботов с документами.

    Как пользоваться? DeepSeek-OCR — инструмент для разработчиков, а не конечных пользователей. Модель можно скачать с Hugging Face или GitHub и встроить в свои пайплайны — например, в веб-сервисы, системы анализа документов или обработку больших данных.

    Она принимает на вход изображения, сканы и PDF-страницы, возвращая компактные визуальные токены или распознанный текст. Совместима с vLLM 0.8.5, Transformers, PyTorch 2.6+ и работает на CUDA 11.8+.

    Итог: DeepSeek-OCR не делает ИИ «зрячим» в человеческом смысле, но приближает его к тому, как человек воспринимает документ.

    Раньше OCR видел только буквы и строки, не понимая, где таблица, где подпись, а где заголовок. Теперь модель передаёт LLM сжатое, но осмысленное представление страницы — так, как человек видит её целиком: и текст, и структуру, и логику оформления.

    Также, недавно стало известно, что DeepSeek V4 может выйти в октябре.



    Источник

    22.06.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Генерация видео

    Промты для Sora 2 — OpenAI выпустила подробный гайд

    admin 22.06.2026
    22.06.2026

    OpenAI опубликовала самый подробный гайд по созданию видео с помощью Sora 2. Документ под названием «Sora 2 Prompting Guide» рассказывает, …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    Скоро выйдет Veo 3.1? Обещают стабильных персонажей и киношные пресеты

    admin 22.06.2026
    22.06.2026

    На платформе WaveSpeedAI появился тизер будущего релиза Google Veo 3.1. Судя по описанию, новое поколение видеомодели решит главную проблему ИИ-видео …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    Alibaba представила Qwen3.5-397B-A17B — открытую нейросеть для ИИ-агентов

    admin 22.06.2026
    22.06.2026

    Команда Qwen представила Qwen3.5-397B-A17B — флагманскую визуально-языковую модель с открытыми весами. Её позиционируют как основу для «нативных мультимодальных агентов»: от …

    0 VKOdnoklassnikiEmail
  • Генерация изображений

    Промты для улучшения качества фотографии: +9 готовых промтов и нейросети

    admin 22.06.2026
    22.06.2026

    У вас есть старое фото ваших предков (родителей, бабушек/дедушек) — выцветшее, с шумом и размытыми деталями. Или, скажем, вам прислали …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    Консистентность персонажей и стилей в нейросетях — что это и как сохранить

    admin 22.06.2026
    22.06.2026

    Представьте: вы потратили битый час на промт и наконец получили идеального персонажа. Делаете следующий шаг — просите его повернуть голову, …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    OpenAI начала определять возраст пользователей ChatGPT — подросткам ограничат чувствительные темы

    admin 22.06.2026
    22.06.2026

    Компания OpenAI внедрила в ChatGPT систему прогнозирования возраста пользователей. Если сервис сочтёт, что аккаунтом пользуется человек младше 18 лет, он …

    0 VKOdnoklassnikiEmail
  • Генерация изображений

    ByteDance выпустила Seedream 4.0 — ИИ модель для генерации изображений, обгоняющую Nano Banana

    admin 22.06.2026
    22.06.2026

    ByteDance представила Seedream 4.0 — новую модель генерации и редактирования изображений, которая работает быстрее и стабильнее конкурентов. По заявлениям компании, …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    xAI представила Grok Imagine 1.0 — новый уровень ИИ-генерации видео

    admin 22.06.2026
    22.06.2026

    ​Компания xAI анонсировала Grok Imagine 1.0 — крупное обновление системы генерации видео на базе ИИ. Новая версия позволяет создавать 10-секундные …

    0 VKOdnoklassnikiEmail
  • Новости

    Anthropic выпустила Claude Sonnet 4.6 с акцентом на код и агентные сценарии

    admin 22.06.2026
    22.06.2026

    Компания Anthropic представила обновлённую языковую модель Claude Sonnet 4.6. Новая версия усилила позиции в программировании, автоматизации и работе с большими …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • OpenAI выпустила GPT-6 Sol и GPT-6 Luna — новые модели уже доступны в ChatGPT и Codex
  • Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и игровом бизнесе Microsoft
  • Anthropic обвинила DeepSeek, MiniMax и Moonshot в незаконной «дистилляции» модели Claude
  • Google отвечает ИИ-браузерам конкурентов: в Chrome появились ИИ-агент и боковая панель с Gemini
  • ElevenLabs представила Studio 4.0 с генерацией видео, изображений и звука

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • OpenAI выпустила GPT-6 Sol и GPT-6 Luna — новые модели уже доступны в ChatGPT и Codex

    23.09.2026
  • Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и игровом бизнесе Microsoft

    23.09.2026
  • Anthropic обвинила DeepSeek, MiniMax и Moonshot в незаконной «дистилляции» модели Claude

    23.09.2026
  • Google отвечает ИИ-браузерам конкурентов: в Chrome появились ИИ-агент и боковая панель с Gemini

    23.09.2026
  • ElevenLabs представила Studio 4.0 с генерацией видео, изображений и звука

    22.09.2026
  • Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

    22.09.2026

Рубрики

  • Генерация видео (113)
  • Генерация звука (24)
  • Генерация изображений (87)
  • Генерация текста (71)
  • Новости (120)
  • Обзор сервисов (87)

OpenAI выпустила GPT-6 Sol и GPT-6 Luna —...

23.09.2026

Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и...

23.09.2026

Anthropic обвинила DeepSeek, MiniMax и Moonshot в незаконной...

23.09.2026

Google отвечает ИИ-браузерам конкурентов: в Chrome появились ИИ-агент...

23.09.2026

ElevenLabs представила Studio 4.0 с генерацией видео, изображений...

22.09.2026

Обзоры

  • Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и игровом бизнесе Microsoft

    23.09.2026
  • Anthropic обвинила DeepSeek, MiniMax и Moonshot в незаконной «дистилляции» модели Claude

    23.09.2026
  • Пентагон пригрозил Anthropic: откройте ИИ для неограниченного военного применения — или лишитесь контракта

    22.09.2026

Выбор редакции

  • Sora 2 увеличила длину видео до 25 секунд и позволила прописывать сценарий по кадрам

    21.06.2026
  • ChatGPT еженедельно пользуются 900 миллионов пользователей

    21.09.2026
  • Анимация лиц в Higgsfield AI: как добиться реалистичной мимики

    16.08.2026

Популярное

  • 1

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 2

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 3

    Google встроил в Gemini генератор музыки Lyria 3

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026 - aitechworld.ru


Наверх
AITechWorld
  • Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов