На выходных в Твиттере вновь заговорили о DeepSeek, который представил инновационную технологию контекстного оптического сжатия. Этот инструмент, отличающийся от традиционных моделей, решает проблему обработки длинных текстов, используя визуальные методы. Многие пользователи языковых моделей сталкиваются с потерей памяти при анализе обширных документов. DeepSeek-OCR предлагает решение, превращая текст в изображения и сжимая информацию, что позволяет ИИ извлекать данные более эффективно.
Модель состоит из двух компонентов: DeepEncoder для сжатия изображений и декодера DeepSeek-3B-MoE для восстановления текста. В отличие от других систем, DeepSeek-OCR использует визуальные токены, которые обеспечивают более высокую плотность информации и лучшее понимание контекста. В сравнении с PaddleOCR-VL, DeepSeek, хоть и мощен, показал менее точные результаты в некоторых задачах. Тем не менее, его уникальные возможности по сжатию данных открывают новые горизонты для исследователей и разработчиков, работающих с большими объемами информации.


