Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает страницу в визуальные токены, чтобы LLM могла читать документы быстрее и дешевле.

На vLLM 0.8.5 модель выдаёт около 2500 токенов в секунду на GPU A100-40G. Postium собрал ключевые детали о новинке.

Реклама. Erid 2Vtzqw9oHvr. ООО «Клик.ру». Промопульт
Реклама. Erid 2Vtzqve9YHx. ООО «Клик.ру». Промопульт

Читайте также: Как писать промты для DeepSeek

DeepSeek-OCR — что это и как работает

DeepSeek-OCR — новая система распознавания текста от компании DeepSeek, созданная специально для работы с большими языковыми моделями (LLM).

Главная идея — не просто превращать изображение в текст, а сжимать визуальный контекст страницы (документа, PDF) в компактный набор токенов, которые LLM потом «распаковывает» и понимает.

Как это работает:

  1. Страница превращается в визуальные токены. Модель анализирует изображение (скан, PDF) и кодирует его в десятки, а не тысячи токенов.
  2. LLM получает компактное представление. Эти токены уже содержат информацию о тексте, структуре (таблицы, списки) и формате документа.
  3. Распаковка и понимание. Внутри LLM эти токены преобразуются обратно в текст и структуру — без необходимости видеть каждый пиксель.

Результат — LLM понимает документ целиком, но тратит в 10–20 раз меньше контекста, чем при обычном OCR.

На бенчмарке OmniDocBench DeepSeek-OCR опережает GOT-OCR 2.0 и MinerU 2.0, используя при этом в 2–3 раза меньше визуальных токенов.

DeepSeek-OCR на бенчмарке OmniDocBench

Почему это важно: DeepSeek-OCR делает работу LLM с документами быстрее — до 2500 токенов/с на GPU A100, дешевле — за счёт меньшего числа токенов при инференсе, точнее — сохраняя 97% точности при 10-кратном сжатии, и гибче — поддерживая PDF, сканы и изображения напрямую через vLLM.

Где может применяться:

  • Автоматический разбор контрактов, отчётов, форм;
  • Быстрое извлечение данных из длинных PDF;
  • Подготовка структурированных ответов (JSON, Markdown, таблицы);
  • Встраивание в RAG-пайплайны и чат-ботов с документами.

Как пользоваться? DeepSeek-OCR — инструмент для разработчиков, а не конечных пользователей. Модель можно скачать с Hugging Face или GitHub и встроить в свои пайплайны — например, в веб-сервисы, системы анализа документов или обработку больших данных.

Она принимает на вход изображения, сканы и PDF-страницы, возвращая компактные визуальные токены или распознанный текст. Совместима с vLLM 0.8.5, Transformers, PyTorch 2.6+ и работает на CUDA 11.8+.

Итог: DeepSeek-OCR не делает ИИ «зрячим» в человеческом смысле, но приближает его к тому, как человек воспринимает документ.

Раньше OCR видел только буквы и строки, не понимая, где таблица, где подпись, а где заголовок. Теперь модель передаёт LLM сжатое, но осмысленное представление страницы — так, как человек видит её целиком: и текст, и структуру, и логику оформления.

Также, недавно стало известно, что DeepSeek V4 может выйти в октябре.

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

Комментарии: DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM
⚡ В тренде
Недавно вышла новая модель ChatGPT Images 2.5, и в плане визуала она творит чудеса — делает всё от обложек и рекламных креативов до логотипов, упаковки, стикеров и постеров. Раньше нужно было долго расписывать промт: свет, стиль, детали, ограничения и надеяться, что всё получится с первого раза. Теперь стало проще: можно ввести, что хочешь получить, дать […]
Adidas выпустила две модели бутс для американского футбола по мотивам мультфильма Pixar «Тачки»: Adizero Electric II «Молния Маккуин» и Adizero Impact II Mid «Мэтр». Релиз приурочен к 20-летию мультфильма. Обе пары уже продаются в США. Adizero Electric II «Молния Маккуин» стоит $130 (≈11 300 ₽), а Adizero Impact II Mid «Мэтр» — $110 (≈9 600 […]
Xiaomi представила складной смартфон Xiaomi 18 Fold 7 сентября 2026 года в Китае. Это первый флагманский смартфон компании с процессором XRING O3. Xiaomi называет XRING O3 флагманской системой-на-чипе с ИИ-ускорителями, встроенными в ключевые компоненты. Подробности — в материале Postium. Читайте также: Цифровая репутация: как SERM спасает бренды в эпоху Интернета Что известно о Xiaomi 18 […]
Apple представила iPhone 18 Pro и iPhone 18 Pro Max. Смартфоны получили 2-нм чип A20 Pro, основную 48-Мп камеру с переменной диафрагмой, уменьшенный Dynamic Island и новую систему охлаждения. Дизайн в целом остался близким к iPhone 17 Pro. Предзаказы откроются 12 сентября, продажи начнутся 18 сентября. В США iPhone 18 Pro стоит от $1199, iPhone […]
OpenAI выпустила ChatGPT Images 2.5 — новую модель для генерации и редактирования изображений. Она вышла вскоре после GPT-6 Astra и стала следующим крупным обновлением. Главное изменение — более точная работа с исходным изображением. Модель лучше сохраняет людей и объекты из референсов, точнее вносит локальные правки и стабильнее ведёт себя при нескольких последовательных изменениях. В этой […]
Блоги компаний
Новости
Свежие статьи