На выходных в Twitter вновь заговорили о DeepSeek, и на этот раз обсуждали их новаторскую технологию контекстного оптического сжатия. Она не просто распознает текст, а использует визуальные методы для оптимизации обработки больших объемов информации. Пользователи языковых моделей часто сталкиваются с ограничениями при обобщении длинных текстов, поскольку модели теряют память при обработке больших массивов данных. DeepSeek-OCR предлагает решение, преобразуя текст в изображения и используя визуальные токены для сжатия. Это позволяет значительно уменьшить количество токенов, необходимых для обработки, что улучшает эффективность. Технология включает в себя два основных компонента: DeepEncoder и декодер DeepSeek-3B-MoE, что позволяет системе восстанавливать текст из визуальных данных. В отличие от других моделей, таких как PaddleOCR-VL, DeepSeek имеет свои уникальные преимущества, ориентированные на исследовательские задачи. Вопрос остается: насколько эта технология изменит будущее обработки информации?
Posted on : 29.11.2025 By Redactor
