ABBYY empaqueta su OCR clásico en un contenedor para alimentar a los LLM
FineParser corre en Docker sobre CPU, sin GPU, y conserva la maquetación del documento antes de entregárselo a un modelo generativo.
ABBYY ha empaquetado su motor de OCR FineReader en un contenedor Docker llamado FineParser, pensado para convertir documentos en texto estructurado que después consuma un LLM. Corre sobre CPU, sin GPU, y su argumento es que conserva la maquetación —columnas en orden de lectura, encabezados, tablas, incluso las que no llevan bordes— en lugar de devolver un montón de texto suelto. La empresa lo describe como IA "determinista": extrae lo que hay, no se inventa una versión plausible.
El razonamiento de fondo es sencillo. Antes de que un modelo generativo haga algo útil con un documento, alguien tiene que leerlo bien. ABBYY lleva décadas en eso y ahora coloca esa pieza delante del pipeline en vez de competir con la parte generativa.
API, formatos y despliegue
Los desarrolladores envían los documentos por REST API y reciben la salida en texto plano, JSON o DocLang, un formato compacto pensado para meterlo directamente en un LLM. Según la compañía, FineParser maneja más de 200 idiomas y también texto manuscrito.
El despliegue es autoalojado. Hay un tramo gratuito de 1.000 páginas al mes durante un año. A partir de ahí, los planes de suscripción validan contra un servidor de licencias, así que una instalación completamente offline obliga a irse al plan Enterprise. FineParser no es open source, aunque ABBYY mantiene un repositorio en GitHub con ejemplos y soporte de comunidad.
Aparte del producto, la empresa publica NeoML, su framework de machine learning programable, que sí es FOSS, y un SDK de OCR para quien quiera incrustar el motor FineReader en su propio software. La extracción no es el único uso que le ven: también sirve para meter texto impreso en un CMS moderno, para archivado o como etapa intermedia de una cadena de producción.
El hueco que ocupa FineParser existía desde antes de la fiebre generativa, y ABBYY apuesta a que sigue ahí: leer el documento es un problema distinto de generarlo, y conviene resolverlo con una herramienta que no improvise. Queda por ver cómo encajan el tramo gratuito y la validación de licencia contra servidor en despliegues aislados, que es justo donde este tipo de extracción local tiene más sentido. La compañía no ha publicado cifras de rendimiento ni comparativas con otros motores.

