Cohere ha lanzado Parse 5, un modelo de visión y lenguaje diseñado para convertir PDFs, presentaciones e imágenes en Markdown estructurado a escala empresarial. La compañía no lo posiciona como el sistema más preciso del mercado, sino como una alternativa de coste controlado para flujos donde procesar millones de páginas con modelos frontera sería demasiado caro.
Según VentureBeat, Parse 5 tiene 2.300 millones de parámetros, se basa en la arquitectura North-Micro-Vision-Instruct de Cohere Labs y trabaja con una ventana de contexto de 8.192 tokens. Acepta páginas de PDF, PowerPoint o JPEG como imagen codificada y devuelve Markdown en orden de lectura, tablas en HTML, descripciones de imágenes y coordenadas para tablas e imágenes.
La apuesta de Cohere toca una necesidad muy concreta: antes de que un agente responda bien, alguien tiene que convertir documentos desordenados en contexto utilizable. En muchas empresas, los datos más valiosos no están en una base relacional limpia, sino en contratos, informes, manuales, presentaciones y documentos escaneados. Si se pierde la estructura, el modelo posterior hereda el error.
El precio es el argumento central. Cohere ofrece Parse 5 a 1,50 dólares por cada 1.000 páginas a través de su API, con opción de despliegue en Model Vault para cargas de mayor volumen. También está disponible mediante Microsoft Foundry y AWS SageMaker, lo que facilita adopción en empresas que ya trabajan con esos entornos.
En ParseBench, el benchmark propio citado por la compañía, Parse 5 obtiene 79,2 puntos en tablas, fidelidad de contenido y formato semántico. Queda por detrás de GPT-5.5, Opus 4.8 y Gemini 3.5 Flash, pero por delante de alternativas como LlamaParse en su nivel Cost Effective, Mistral OCR 4, Databricks AI Parse y Azure Document Intelligence en la comparación publicada.
El mensaje comercial es claro: no siempre gana el modelo que más puntúa, sino el que permite procesar más documentos sin romper el presupuesto. Cohere estima que, en un flujo financiero modelado de 750 millones de documentos anuales, elegir Parse 5 frente a un gran modelo generalista reduciría costes en más del 98%. Es una estimación de la empresa, no una auditoría independiente, pero ilustra la presión económica.
La arquitectura de una sola pasada también busca simplificar. Muchas soluciones combinan OCR tradicional, pasos de limpieza y un modelo posterior que intenta reconstruir estructura. Parse 5 intenta resolverlo en una única inferencia, lo que puede reducir latencia y complejidad operativa. Su cobertura estable incluye español, inglés, árabe, francés, alemán, italiano, japonés, coreano y portugués.
La herramienta no lo cubre todo. Cohere reconoce que Parse 5 describe gráficos, pero no extrae todavía sus datos subyacentes. También entrega texto en orden de lectura en lugar de bounding boxes para cada elemento textual. La compañía defiende que esa decisión reduce errores en flujos de agentes, aunque deja margen para futuras versiones en documentos muy visuales.
Para departamentos legales, financieros o industriales, la prueba real será downstream: si el agente usa mejor la información, no si el Markdown parece más limpio. Una tabla mal interpretada puede cambiar una cláusula, una cifra de riesgo o una instrucción técnica. Por eso, las empresas deberán medir recuperación, trazabilidad y precisión de tareas, no solo coste por página.
Parse 5 confirma una tendencia de fondo en IA empresarial. La ventaja empieza a desplazarse desde el chatbot visible hacia piezas menos vistosas: ingestión, parsing, evaluación, privacidad y despliegue. Quien reduzca costes en esas capas puede desbloquear proyectos que hoy se quedan en piloto porque el volumen documental hace inviable usar modelos grandes en cada paso.
