SEO
7
Вес: Значительный

Baidu выпустила Unlimited-OCR для обработки длинных документов

Mikeblazerx 17.07.2026 — 06:15

Ключевые факты

  • 1 Baidu выпустила Unlimited-OCR для обработки длинных документов.
  • 2 Модель использует механизм «скользящего окна» для фиксированного потребления памяти.
  • 3 Unlimited-OCR обеспечивает стабильную скорость генерации независимо от длины документа.
  • 4 На бенчмарках модель достигает 93% точности, превосходя предыдущие решения на 6 пунктов.
  • 5 Уровень ошибок остается ниже 0.11 даже при обработке более 40 страниц.
  • 6 Модель доступна бесплатно и имеет открытый исходный код.

Baidu представила Unlimited-OCR, инновационную модель для документного ИИ, разработанную для эффективной обработки очень длинных текстов, таких как целые книги. В отличие от большинства существующих vision-моделей, которые теряют контекст и снижают производительность при работе с многостраничными документами, Unlimited-OCR решает эту проблему благодаря уникальной архитектуре. Модель построена на базе DeepSeek OCR, но с ключевым изменением в механизме внимания. Она имитирует процесс ручного переписывания книги, где каждый токен анализирует только текущую страницу и последние 128 слов. Это создает «скользящее окно», которое обеспечивает постоянное потребление памяти, независимо от длины обрабатываемого документа. Такой подход гарантирует фиксированный объем потребляемой памяти, стабильную скорость генерации даже для массивных документов и способность обрабатывать десятки страниц за один проход. Тесты показывают, что Unlimited-OCR достигает 93% на стандартных бенчмарках парсинга, превосходя предыдущие бейзлайны на шесть пунктов. При обработке более 40 страниц уровень ошибок остается ниже 0.11, а скорость генерации сохраняется ровной, в то время как старые модели замедлялись до 35%. Модель доступна бесплатно и имеет открытый исходный код.

Источник