Published signals

PaddleOCR-VL-1.6: Un nuevo SOTA para la comprensión de documentos

Score: 7/10 Topic: PaddleOCR-VL-1.6 release

PaddleOCR-VL-1.6 alcanza 96.3% en OmniDocBench, mejorando el reconocimiento de texto, fórmulas y tablas con salida estructurada.

PaddleOCR-VL-1.6, un modelo compacto de visión-lenguaje de 0.9B parámetros, ha establecido un nuevo estado del arte en el benchmark OmniDocBench v1.6 con una precisión del 96.3%. El modelo demuestra mejoras significativas en el reconocimiento de texto, fórmulas y tablas, mientras mejora las capacidades para escenarios desafiantes como textos antiguos, caracteres raros, sellos y gráficos complejos. Una característica clave es su capacidad para producir resultados estructurados en formatos Markdown y JSON, lo que simplifica la integración en flujos de trabajo de procesamiento de documentos. Para desarrolladores que trabajan en OCR, digitalización de documentos o extracción automatizada de datos, esta versión ofrece una sólida alternativa de código abierto a las soluciones comerciales. El tamaño compacto del modelo lo hace factible para implementación en entornos con recursos limitados, potencialmente reduciendo la barrera para la comprensión de documentos de alta calidad en sistemas de producción.