PaddleOCR-VL-1.6, ein kompaktes Vision-Language-Modell mit 0,9B Parametern, hat mit 96,3% Genauigkeit einen neuen Stand der Technik auf dem OmniDocBench v1.6-Benchmark gesetzt. Das Modell zeigt deutliche Verbesserungen bei der Erkennung von Text, Formeln und Tabellen und verbessert gleichzeitig die Fähigkeiten für herausfordernde Szenarien wie alte Texte, seltene Zeichen, Siegel und komplexe Diagramme. Ein Hauptmerkmal ist die Fähigkeit, strukturierte Ergebnisse sowohl im Markdown- als auch im JSON-Format auszugeben, was die Integration in Dokumentverarbeitungsworkflows vereinfacht. Für Entwickler, die an OCR, Dokumentdigitalisierung oder automatisierter Datenextraktion arbeiten, bietet diese Veröffentlichung eine starke Open-Source-Alternative zu kommerziellen Lösungen. Die kompakte Größe des Modells macht die Bereitstellung in ressourcenbeschränkten Umgebungen möglich und senkt möglicherweise die Hürde für hochwertiges Dokumentverständnis in Produktionssystemen.
PaddleOCR-VL-1.6 erreicht 96,3% auf OmniDocBench und verbessert Text-, Formel- und Tabellenerkennung mit strukturierter Ausgabe.