
L’OCR (Optical Character Recognition) est devenu un pilier de la transformation numérique des organisations. Pourtant, les modèles actuels restent souvent limités face à des documents complexes : mises en page imbriquées, tableaux, structures logiques ou hiérarchies visuelles.
Avec DeepSeek-OCR 2, les chercheurs explorent une nouvelle approche inspirée de la perception humaine pour améliorer la compréhension des images et documents.
Découvrir le projet DeepSeek‑OCR 2 sur GitHub
DeepSeek-OCR 2 est un modèle présenté dans le papier “Visual Causal Flow”, conçu pour repenser la manière dont les modèles vision-langage interprètent les images.
Le point de départ est simple : la plupart des modèles traitent les images dans un ordre rigide, généralement de gauche à droite et de haut en bas, avec un encodage positionnel fixe.
Problème : cette logique ne correspond pas à la vision humaine, qui suit des parcours flexibles guidés par la structure sémantique d’une image.
Pour répondre à cet écart, DeepSeek-OCR 2 introduit DeepEncoder V2, un encodeur capable de réorganiser dynamiquement les tokens visuels en fonction du sens de l’image avant leur interprétation par un LLM.
L’objectif : permettre une compréhension plus logique et cohérente des documents complexes.
Le modèle repose sur une idée centrale : intégrer un raisonnement causal dans l’encodeur afin d’ordonner intelligemment les informations visuelles.
Cette approche explore un nouveau paradigme : atteindre une véritable compréhension 2D via deux structures de raisonnement causal en 1D, ouvrant la voie à une architecture alternative pour l’analyse d’images.
Concrètement, le projet propose :
Le système supporte également une résolution dynamique, combinant plusieurs tailles d’images et un nombre variable de tokens visuels.
Résultat : un pipeline pensé pour gérer des documents réels plutôt que des exemples simplifiés.
Le modèle s’appuie sur l’idée que la perception visuelle humaine suit des séquences causales dictées par la logique interne d’une image — notamment dans les layouts complexes.
Cela pourrait réduire les erreurs d’interprétation dans les documents riches.
Globalement, les modèles DeepSeek sont réputés pour leur rapidité d’inférence. DeepSeek-OCR 2 ne déroge pas à la règle.
Selon les benchmarks récents, ce dernier affiche le meilleur ratio nombre de pages analysées par seconde sur GPU. Cette performance ouvre la voie à des traitements à grande échelle, et ce à moindre coût !
Au lieu d’un parcours figé, DeepSeek-OCR 2 réordonne les tokens selon la sémantique, ce qui améliore potentiellement la compréhension globale du contenu.
Un changement architectural rare dans un domaine souvent dominé par des optimisations incrémentales.
Le projet examine si un raisonnement causal peut permettre une compréhension authentique des images en 2D.
Si cette hypothèse se confirme, elle pourrait influencer la conception des futurs modèles multimodaux.
Le code, les modèles et les instructions d’installation sont disponibles publiquement sous licence Apache-2.0.
Un atout pour les équipes R&D comme pour les entreprises souhaitant tester rapidement la technologie.
Les progrès en OCR ont un impact direct sur de nombreux workflows métier.
Extraction de contenu depuis des contrats, des factures ou des rapports, même lorsque la mise en page est complexe.
Une lecture plus “logique” pourrait améliorer la structuration des données et faciliter leur exploitation par des systèmes analytiques.
En réorganisant les informations avant leur passage dans un LLM, le modèle s’inscrit naturellement dans les architectures modernes mêlant vision et langage.
Moins de traitement manuel, plus de données exploitables = un levier clé pour la productivité.
DeepSeek-OCR 2 ne se contente pas d’améliorer l’OCR : il propose une nouvelle façon de penser la compréhension visuelle.
En introduisant un encodeur capable de réordonner les tokens selon la logique d’une image, le projet explore un futur où les modèles pourraient voir davantage comme des humains et donc comprendre mieux.
À mesure que les systèmes multimodaux gagnent en importance, ce type d’innovation architecturale pourrait devenir un standard pour l’analyse documentaire avancée.
Lire le papier DeepSeek‑OCR 2 sur arXiv