BookinglyTech News
Inteligencia artificial

Cohere lanza Embed 5: indexar con Pro y consultar con Fast sin duplicar el índice

Los dos modelos comparten espacio de vectores, se cambia de uno a otro sin reindexar y la consulta rápida cuesta 0,08 dólares por millón de tokens.

3 min de lecturaThe New Stack0 vistas

Cohere ha publicado Embed 5, una familia de modelos de embeddings que permite indexar el corpus con la variante Pro y atender las consultas con la variante Fast sin construir un segundo índice. Los dos modelos comparten espacio de embeddings, así que los vectores son compatibles y cambiar de uno a otro no obliga a reindexar nada.

Dos modelos, un mismo espacio

Cohere recomienda Pro para la ingesta de documentos y Fast para las consultas. Tiene sentido en sistemas RAG y flujos de agentes, donde la latencia se acumula porque los mismos datos se buscan una y otra vez. La contrapartida está en la calidad de recuperación, aunque en las pruebas de la compañía la pérdida es pequeña.

Sobre 40 conjuntos de datos con texto, imágenes y documentos combinados, consultar con Fast contra un índice construido con Pro dio una puntuación de 98,4 frente a la base Pro-Pro de 100. Si Fast se usa también para indexar, la cifra cae a 96,6. Cohere asegura que ningún conjunto individual mostró una caída reseñable con la combinación Pro-Fast.

Pro cuesta 0,12 dólares por millón de tokens y Fast 0,08, con un rendimiento medio 2,4 veces mayor en documentos según las mediciones de la empresa. Para quien ingiere documentos con menos frecuencia de la que consulta, el reparto es evidente.

Dimensiones y formatos

Ambos modelos soportan seis dimensiones de vector, de 256 a 2.048, en float32, int8 y binario. El ahorro de almacenamiento se nota a escala: un vector de 2.048 dimensiones en float32 ocupa 8 KB, unos 819 GB para 100 millones de fragmentos. Uno de 1.024 dimensiones en int8 baja a unos 102 GB, y uno de 256 dimensiones en binario deja el mismo corpus en unos 3,2 GB. Cohere recomienda 1.024 dimensiones en int8 para la mayoría de despliegues. Los formatos binarios comprimen más a cambio de algo de precisión y encajan mejor en una primera fase de recuperación antes de un reranking más preciso. Todo esto se puede mezclar con truncamiento Matryoshka o cuantización int8.

Embed 5 admite texto, imágenes y entradas mixtas en más de 100 idiomas, con ventana de contexto de 128K tokens, y puede embeber imágenes de página directamente. Los números que da Cohere en las evaluaciones de texto e imagen fusionados, PDF parseado y ViDoRe V3 sitúan a Pro por delante de Gemini Embedding 2, Voyage 4 Large y el anterior Embed 4. En multilingüe la cosa está más igualada: Pro lidera su media europea de cinco idiomas con 77 frente a 76 de Voyage 4 Large, pero pierde ante Gemini Embedding 2 en nueve de las pruebas.

Merece la pena leer la letra pequeña. Es la primera familia de Cohere evaluada con RCP-nDCG@10, que mide reranking sobre un conjunto fijo de candidatos y no recuperación de primera fase; el resto de pruebas usan nDCG@10 estándar, así que las cifras no son comparables entre sí.

Qué mirar

Lo relevante es que indexar y servir pasan a ser dos decisiones de infraestructura separadas. Ese 98,4 es un promedio del propio conjunto de evaluación de Cohere. Quien tenga un sistema RAG o de agentes en producción tendrá que medir Pro-Fast contra Pro-Pro con su propio corpus y su distribución de consultas, sobre todo cuando un error de recuperación se propaga por varios pasos de un flujo de agente.

Ambos modelos están disponibles a través de la API de Cohere y Model Vault, Microsoft Foundry y Amazon SageMaker, con despliegue en VPC privada y on-premises mediante vLLM.