PaddleOCR-VL-1.6, un modèle vision-langage compact de 0,9B paramètres, a établi un nouvel état de l'art sur le benchmark OmniDocBench v1.6 avec une précision de 96,3%. Le modèle démontre des améliorations significatives dans la reconnaissance de texte, de formules et de tableaux, tout en renforçant les capacités pour des scénarios difficiles comme les textes anciens, les caractères rares, les sceaux et les graphiques complexes. Une caractéristique clé est sa capacité à produire des résultats structurés en formats Markdown et JSON, ce qui simplifie l'intégration dans les flux de traitement de documents. Pour les développeurs travaillant sur l'OCR, la numérisation de documents ou l'extraction automatisée de données, cette version offre une alternative open-source solide aux solutions commerciales. La taille compacte du modèle le rend déployable dans des environnements à ressources limitées, abaissant potentiellement la barrière pour une compréhension de documents de haute qualité dans les systèmes de production.
PaddleOCR-VL-1.6 atteint 96,3% sur OmniDocBench, améliorant la reconnaissance de texte, de formules et de tableaux avec une sortie structurée.