AutoRAG llega a OpenShift AI 3.5 con ajuste automático de pipelines RAG
Red Hat integra AutoRAG en la preview técnica avanzada de OpenShift AI 3.5: evalúa, compara y despliega patrones RAG sobre Kubeflow Pipelines.

Red Hat ha metido AutoRAG en la preview técnica avanzada de OpenShift AI 3.5. Es una capa que automatiza la evaluación y el ajuste de hiperparámetros de pipelines de generación aumentada por recuperación (RAG), montada sobre Kubeflow Pipelines y sobre el motor de optimización ai4rag de IBM, que es open source. La compañía aún no la ha publicado: habla de una preview avanzada que llegará con la versión 3.5 de la plataforma.
El problema que ataca no es montar un RAG, sino afinarlo. Elegir la estrategia de chunking, el modelo de embeddings y los parámetros de generación a ojo es lo que hacen hoy muchos equipos, y de ahí sale un pipeline que funciona sin que nadie sepa muy bien por qué. AutoRAG prueba combinaciones contra tus datos, las puntúa y las ordena en un leaderboard.
De la tabla al endpoint
Al elegir un patrón ganador, la plataforma genera los artefactos de las dos mitades del pipeline. La ingesta se compila en un Kubeflow Pipeline desplegable que arrastra todos los detalles del patrón elegido: parseo de documentos, chunking, configuración del modelo de embeddings y parámetros de indexación en la base de datos vectorial. Se puede relanzar cada vez que entran documentos nuevos.
La parte de recuperación y generación se empaqueta como configuración de la API Responses, consumible a través de Open GenAI Framework (OGF, el que fuera Llama Stack). De ahí salen un pattern.json con la configuración completa, un script de Python preparado para llamar a la API y fragmentos de código en Python, cURL, Go y Node.js, todos en la pestaña View Code del panel. Antes, llevar un patrón optimizado a un entorno real implicaba reconstruir la arquitectura a mano.
También hay un chat inline para conversar con los resultados del pipeline antes de comprometerse a un despliegue completo, y una representación visual de cada patrón probado con detalle a nivel de nodo: cómo fluye el dato desde la ingesta hasta la generación, qué estrategia de chunking alimentó a qué modelo de embeddings y en qué punto falló un experimento. La idea es que comparar dos patrones no obligue a reconstruir la arquitectura mentalmente a partir de una tabla.
Idiomas y coste de cómputo
OpenShift AI 3.5 añade soporte multilingüe nativo, de forma que se pueden ingerir documentos en su idioma original sin capas de traducción por medio. El soporte inicial cubre alemán, español y japonés, con la intención de ampliarlo en versiones posteriores a la mayoría de idiomas empresariales en alfabetos latino, CJK y cirílico.
Para no quemar cómputo en combinaciones que no van a funcionar, AutoRAG incluye una etapa de preselección de modelos que detecta el idioma de los documentos con detección basada en LLM y descarta los modelos con mal rendimiento sobre tus datos de prueba antes de lanzar la matriz completa de optimización.
El anuncio también apunta a organizaciones que ya tienen PostgreSQL con pgvector como almacén vectorial y no quieren moverlo, aunque el texto se corta justo ahí.
Red Hat no publica cifras de rendimiento ni fecha para la disponibilidad general, y todo lo anterior son características de una preview. La parte interesante para quien opera esto es la promesa de que el ajuste automático no acabe en un cuaderno de experimentos: si los artefactos generados aguantan datos reales y el endpoint se despliega sin retoques, el trabajo de afinar un RAG deja de ser un proyecto aparte dentro del equipo.