Cohere lanza Parse 5, modelo multimodal para extraer datos estructurados de PDFs empresariales
Parse 5, con 2,3 mil millones de parámetros y ventana de contexto de 8 000 tokens, convierte PDFs complejos en Markdown con coordenadas de cuadro delimitador.

Cohere ha puesto en producción Parse 5 (parse‑v5.0), un modelo fundacional multimodal pensado para la extracción estructurada de información de documentos empresariales. El modelo, anunciado el 27 de agosto de 2026, combina un encoder visual de 400 M de parámetros, basado en SigLIP 2 SO400M, con un motor de razonamiento de 2 B de parámetros (North Micro LLM) y ofrece una ventana de contexto de 8 K tokens que acepta texto y contenido visual simultáneamente.
La arquitectura emplea embeddings posicionales rotatorios 2D en el encoder y una capa de projector que lleva las características visuales al espacio de embeddings del modelo de lenguaje. Un enfoque de integración llamado DeepStack inserta parches de varias capas del encoder en las capas tempranas del LLM, lo que permite al modelo acceder a representaciones visuales a distintos niveles de abstracción. El resultado es una salida directa en Markdown acompañada de coordenadas de bounding box, lo que simplifica la trazabilidad visual requerida en sectores regulados.
Para validar la precisión, Cohere utilizó ParseBench, un benchmark propio con más de 2 000 páginas empresariales verificadas (seguros, finanzas y gobierno). Parse 5 obtuvo una puntuación media de 79,2 en extracción de tablas, fidelidad del contenido y formato semántico, superando a alternativas como Mistral OCR y Google Gemini 3 Flash (75,05). En la clasificación del benchmark, LlamaParse Agentic Plus lidera con 90,20, pero Parse 5 se posiciona como la opción más competitiva entre los modelos de código cerrado.
El modelo está disponible a través de la API de Cohere, la plataforma Azure AI Foundry y Amazon SageMaker. Cohere también ofrece una prueba gratuita en su panel de API, una demo en Hugging Face Space y la posibilidad de desplegar el modelo de peso abierto North‑Micro‑Vision‑Instruct en Hugging Face para fine‑tuning local. Los usuarios de la comunidad Reddit destacan la mejora en la extracción de tablas y la lectura secuencial, aunque solicitan soporte nativo para archivos PDF sin pre‑renderizado y mayor disponibilidad en OpenRouter.
Importancia: Parse 5 reduce la dependencia de pipelines OCR basados en reglas, ofreciendo una solución más fiable y con menor latencia para equipos que manejan grandes volúmenes de documentos estructurados. Su capacidad de devolver coordenadas visuales facilita auditorías y la integración con sistemas de recuperación aumentada (RAG) o agentes autónomos que requieren referencia al origen visual.


