Специалисты компании DeepSeek разработали уникальную модель DeepSeek-OCR, кардинально изменяющую процесс распознавания текста. В отличие от традиционных систем, которые оперируют текстовыми токенами, новая модель работает с визуальными представлениями страниц. Это позволяет иначе подходить к хранению и анализу информации.
В обычных OCR-системах текст разбивается на символы, что требует больших вычислительных ресурсов, особенно для длинных документов. DeepSeek предлагает альтернативный метод: преобразовывать текст в изображение, затем кодировать его через собственный DeepEncoder в компактные визуальные токены и восстанавливать текст. Это позволяет значительно сократить затраты при сохранении высокой точности.
Эксперименты показали, что даже при десятикратном сжатии модель сохраняет точность около 97%, а при двадцатикратном — около 60%. Это означает, что DeepSeek-OCR может эффективно хранить длинные документы без потери смысла. Архитектура модели включает три ключевых этапа: локальное внимание для детального анализа, свёрточное сжатие в 16 раз и глобальное внимание для изучения структуры страницы. Также в модель добавлен механизм забывания, который позволяет снижать разрешение старого контекста, освобождая место для новой информации.
Не упустите возможность автоматизировать рутинные задачи с BotHub! Доступ к сервису не требует VPN, и вы можете использовать российскую карту. По ссылке доступны 100 000 бесплатных токенов для начала работы с нейросетями!


