Las empresas que necesitan incorporar PDFs, presentaciones y documentos escaneados en sus flujos de trabajo de inteligencia artificial se enfrentan a un problema común: los sistemas actuales o bien pierden la estructura del documento —como tablas, gráficos o el diseño— o resultan prohibitivos en coste cuando se quieren aplicar a gran escala.
Este jueves, Cohere presentó Parse 5, un nuevo modelo de lenguaje visual de 2.300 millones de parámetros que procesa PDFs, diapositivas e imágenes y los convierte en Markdown estructurado, optimizado especialmente para el equilibrio entre coste y rendimiento que demanda el entorno empresarial.
Según el propio benchmark publicado por Cohere, Parse 5 queda por debajo en precisión respecto a tres modelos de referencia más grandes y generales: GPT-5.5, Opus 4.8 y Gemini 3.5 Flash. Sin embargo, la compañía no busca liderar en la puntuación absoluta, sino ofrecer la mejor solución en términos de coste por página procesada, posicionándose en unos 1,50 dólares por cada 1.000 páginas mediante su API. Para grandes volúmenes, disponen también del «Model Vault», su plataforma segura para inferencias gestionadas en entornos dedicados.
Nils Reimers, vicepresidente de IA para búsqueda en Cohere, explicó a VentureBeat que «el verdadero desafío no es leer el texto, sino mantener la estructura y el significado originales del documento». En efecto, los documentos empresariales combinan tablas, diagramas, gráficos y formatos variados que modifican la interpretación del contenido. «La mayoría de las herramientas pierden la estructura o añaden información errónea, e incluso los modelos de última generación fallan con páginas densas en diseño», añadió.
Arquitectura de una sola pasada que simplifica el proceso
Parse 5 toma cada página como una imagen y, mediante un único paso en su modelo de lenguaje visual, devuelve un texto Markdown perfectamente estructurado. Así elimina la necesidad, habitual en otras soluciones, de encadenar OCR y modelado en etapas separadas.
En detalle, la arquitectura North-Micro-Vision-Instruct de Cohere sostiene este modelo, con un contexto máximo de 8.192 tokens y un tamaño aproximado de 4,6 GB. El sistema acepta como entrada PDFs, diapositivas o imágenes JPEG codificadas en base64 y entrega el contenido siguiendo el orden de lectura, con tablas codificadas en HTML, descripciones de imágenes y coordenadas para cada elemento.
Parse 5 ofrece cobertura estable para idiomas como árabe, inglés, francés, alemán, italiano, japonés, coreano, portugués y español, además de soporte cero-shot aunque con menor precisión para otros lenguajes.
En cuanto a la salida, puede devolver texto Markdown estándar por página o, en su modo «blocks», desglosar los elementos con tipos específicos donde cada tabla incluye su HTML, descripción y coordenadas, permitiendo una trazabilidad precisa para agentes de inteligencia artificial.
El nuevo modelo ya está disponible para uso general a través de la API de Cohere, su «Model Vault», Microsoft Foundry y AWS SageMaker.
Benchmark y coste: un equilibrio entre precisión y economía
El benchmark ParseBench evalúa herramientas para analizar documentos mediante páginas empresariales verificadas manualmente. Parse 5 consigue una puntuación media de 79,2 en tres dimensiones clave: manejo de tablas, fidelidad del contenido y formato semántico. En este ámbito supera a soluciones como LlamaParse Cost Effective (78,3), Mistral OCR 4 (74,5), Databricks AI Parse (72,4) y Azure Document Intelligence (69,3), aunque queda por detrás de los tres grandes modelos antes mencionados.
Cohere señala que en dos dimensiones excluidas, Diseño y Gráficos, Parse 5 no compite por elección estratégica: devuelve Markdown en orden de lectura en vez de coordenadas campo a campo para texto, y ofrece descripciones generales de gráficos en lugar de extraer sus datos, función que contemplan para futuras versiones.
Reimers justifica esta decisión explicando que «para los gráficos brindamos una descripción genérica acompañada de un indicador que permite a la IA visual inspeccionarlos». «Otras soluciones extraen datos del gráfico pero se omiten detalles importantes —como color o patrón—, lo que genera ‘alucinaciones’ en asistentes de inteligencia artificial», agregó.
El verdadero argumento de venta de Cohere es el ahorro económico. La compañía modeló un flujo de trabajo en una gran entidad financiera que procesa 750 millones de documentos al año, concluyendo que utilizar Parse 5 en lugar de un modelo amplio como GPT-5.5 puede reducir costes en más de un 98%.
Este dato, aclara Cohere, corresponde a su estimación interna para ese caso concreto y no a un despliegue auditable.
Posición en el mercado y perspectivas
El mercado ofrece múltiples opciones para el análisis documental en empresas. Los modelos generales de última generación —GPT-5.5, Opus 4.8 y Gemini 3.5 Flash— lideran en precisión, aunque a un coste significativamente mayor y con latencias más elevadas.
También existen parsers especializados como Mistral OCR 4, LlamaParse o soluciones de código abierto como Chandra OCR 2 y Dots.mocr de RedNote.
Los servicios de inteligencia documental de proveedores en la nube, tales como AWS Textract, Google Document AI, Azure Document Intelligence y Databricks AI Parse, se enfocan más en la integración con ecosistemas y facilidad de uso que en pureza de precisión, situándose en los últimos puestos de la comparación de Cohere.
Kevin Petrie, vicepresidente de investigación de BARC US, destacó la importancia actual del análisis documental: «Estamos finalizando una encuesta que muestra que el análisis de documentos es el caso de uso principal de IA, con un 62% de adopción entre las organizaciones consultadas». Añadió que los documentos y objetos no estructurados contienen el contexto exclusivo que diferencia las iniciativas de inteligencia artificial avanzada.
Si bien solo el tiempo revelará qué lugar ocupará Parse 5 frente a los modelos más avanzados, desde una perspectiva estratégica, Cohere se enfoca correctamente en esta combinación de coste y calidad.
Por su parte, Stephanie Walter, líder de práctica en AI Stack en HyperFRAME Research, valora a Parse 5 como un punto intermedio interesante entre los antiguos OCR y el uso intensivo de modelos costosos por página. Su gran ventaja radica en ofrecer estructura, procedencia espacial y capacidad de despliegue privado a un precio adecuado para ingestiones masivas.
El verdadero reto está en el uso real, no solo en los benchmarks
Walter remarca que «el análisis es la primera barrera de calidad en la pila de IA empresarial». «Si se pierde información esencial como tablas, encabezados, imágenes o el orden de lectura en la etapa inicial, modelos más grandes o mejores representaciones no podrán recuperar esa estructura perdida».
Por ello, señala que la puntuación en un benchmark no es el único factor relevante. «Las empresas deberían probar estos parsers con sus propios documentos más complejos y medir la precisión en las tareas posteriores, en lugar de centrarse solo en la limpieza del texto extraído. La cuestión no es ‘¿Leyó el PDF?’ sino ‘¿Puede el agente usar la información correctamente?’», concluyó.