21.08.2026

DeepSeek-OCR 2 : le modèle OCR qui change la donne !

DeepSeek-OCR 2 : le modèle OCR qui change la donne !

DeepSeek-OCR 2 : vers une compréhension visuelle plus “humaine” des documents

L’OCR (Optical Character Recognition) est devenu un pilier de la transformation numérique des organisations. Pourtant, les modèles actuels restent souvent limités face à des documents complexes : mises en page imbriquées, tableaux, structures logiques ou hiérarchies visuelles.

Avec DeepSeek-OCR 2, les chercheurs explorent une nouvelle approche inspirée de la perception humaine pour améliorer la compréhension des images et documents.

Découvrir le projet DeepSeek‑OCR 2 sur GitHub

DeepSeek-OCR 2 : qu’est-ce que c’est ?

DeepSeek-OCR 2 est un modèle présenté dans le papier “Visual Causal Flow”, conçu pour repenser la manière dont les modèles vision-langage interprètent les images.

Le point de départ est simple : la plupart des modèles traitent les images dans un ordre rigide, généralement de gauche à droite et de haut en bas, avec un encodage positionnel fixe.

Problème : cette logique ne correspond pas à la vision humaine, qui suit des parcours flexibles guidés par la structure sémantique d’une image.

Pour répondre à cet écart, DeepSeek-OCR 2 introduit DeepEncoder V2, un encodeur capable de réorganiser dynamiquement les tokens visuels en fonction du sens de l’image avant leur interprétation par un LLM.

 L’objectif : permettre une compréhension plus logique et cohérente des documents complexes.

DeepSeek-OCR 2, comment ça marche ?

Le modèle repose sur une idée centrale : intégrer un raisonnement causal dans l’encodeur afin d’ordonner intelligemment les informations visuelles.

Cette approche explore un nouveau paradigme : atteindre une véritable compréhension 2D via deux structures de raisonnement causal en 1D, ouvrant la voie à une architecture alternative pour l’analyse d’images.

Concrètement, le projet propose :

  • un modèle et des poids accessibles publiquement,
  • des scripts d’inférence pour images et PDF,
  • des outils d’évaluation batch (ex. OmniDocBench).

Le système supporte également une résolution dynamique, combinant plusieurs tailles d’images et un nombre variable de tokens visuels.

Résultat : un pipeline pensé pour gérer des documents réels plutôt que des exemples simplifiés.

Pourquoi DeepSeek-OCR 2 est particulièrement intéressant ?

Une approche inspirée de la cognition humaine

Le modèle s’appuie sur l’idée que la perception visuelle humaine suit des séquences causales dictées par la logique interne d’une image — notamment dans les layouts complexes.

Cela pourrait réduire les erreurs d’interprétation dans les documents riches.

Une rapidité d’inférence record

Globalement, les modèles DeepSeek sont réputés pour leur rapidité d’inférence. DeepSeek-OCR 2 ne déroge pas à la règle. 

Selon les benchmarks récents, ce dernier affiche le meilleur ratio nombre de pages analysées par seconde sur GPU. Cette performance ouvre la voie à des traitements à grande échelle, et ce à moindre coût ! 

Une rupture avec le raster-scan traditionnel

Au lieu d’un parcours figé, DeepSeek-OCR 2 réordonne les tokens selon la sémantique, ce qui améliore potentiellement la compréhension globale du contenu.

Un changement architectural rare dans un domaine souvent dominé par des optimisations incrémentales.

Une exploration vers un véritable raisonnement visuel

Le projet examine si un raisonnement causal peut permettre une compréhension authentique des images en 2D.

Si cette hypothèse se confirme, elle pourrait influencer la conception des futurs modèles multimodaux.

Un projet open source prêt à être expérimenté

Le code, les modèles et les instructions d’installation sont disponibles publiquement sous licence Apache-2.0.

Un atout pour les équipes R&D comme pour les entreprises souhaitant tester rapidement la technologie.

Les applications concrètes de DeepSeek-OCR 2

Les progrès en OCR ont un impact direct sur de nombreux workflows métier.

Automatisation documentaire

Extraction de contenu depuis des contrats, des factures ou des rapports, même lorsque la mise en page est complexe.

Compréhension avancée des documents

Une lecture plus “logique” pourrait améliorer la structuration des données et faciliter leur exploitation par des systèmes analytiques.

Pipelines IA multimodaux

En réorganisant les informations avant leur passage dans un LLM, le modèle s’inscrit naturellement dans les architectures modernes mêlant vision et langage.

Accélération de la transformation digitale

Moins de traitement manuel, plus de données exploitables = un levier clé pour la productivité.

Conclusion

DeepSeek-OCR 2 ne se contente pas d’améliorer l’OCR : il propose une nouvelle façon de penser la compréhension visuelle.

En introduisant un encodeur capable de réordonner les tokens selon la logique d’une image, le projet explore un futur où les modèles pourraient voir davantage comme des humains  et donc comprendre mieux.

À mesure que les systèmes multimodaux gagnent en importance, ce type d’innovation architecturale pourrait devenir un standard pour l’analyse documentaire avancée.

Lire le papier DeepSeek‑OCR 2 sur arXiv

Mathieu Poissard