Ringg enruta sus agentes entre varios modelos de OpenAI y recorta el coste un 90%
La plataforma india de agentes de voz y chat atiende más de siete millones de llamadas al mes y dice haber rebajado un 90% el coste de modelo al migrar cargas a GPT-5.6.

Los agentes de voz y chat de Ringg resuelven hasta el 65% de las llamadas rutinarias de sus clientes y mueven más de siete millones de llamadas conectadas cada mes. Detrás hay una decisión de arquitectura que no es la habitual: en lugar de apoyarse en un solo modelo, la plataforma enruta cada tarea al que mejor encaja por rendimiento, latencia o precio.
El caso lo cuenta OpenAI sobre su propio cliente, así que conviene leerlo como lo que es: material de proveedor. No hay verificación independiente de las cifras ni detalle de precios.
Un modelo para cada tarea
GPT-4.1 sigue llevando la mayor parte del tráfico de voz y chat en tiempo real. GPT-5.6 Luna permanece en producción y se usa cuando su perfil de latencia o su relación precio/prestación encaja mejor. GPT-5.6 Terra se ocupa del análisis posterior a la llamada, es decir, resúmenes y clasificación de sentimiento. GPT-5.6 Sol sostiene los flujos de evaluación, mejora de prompts y model-as-judge.
La capa de orquestación combina la entrada del cliente con las instrucciones del agente, el historial de la conversación, los datos del cliente, el contexto de la base de conocimiento y las herramientas disponibles. El enrutador elige modelo y configuración, y la acción resultante se ejecuta contra CRM, sistemas de tickets, pasarelas de pago, herramientas de agenda y APIs internas. Si hace falta, el caso se escala a una persona con un resumen de la conversación por delante. El trabajo puede repartirse además entre subagentes especializados en cualificación, soporte, verificación, agenda y escalado.
Hay un detalle de operación que interesa más que el marketing: cuando el contexto se acerca a los 80.000 tokens, el sistema genera un resumen estructurado y sigue la conversación sin reenviar todo el historial en cada turno.
Los números y cómo los miden
El dato más repetido es el coste. Migrar determinadas cargas en tiempo real de GPT-4.1 a GPT-5.6 Luna redujo el gasto en modelo alrededor de un 90%, según la compañía. La satisfacción media de sus clientes se sitúa en 4,8.
En pruebas internas con conversaciones históricas y flujos simulados, GPT-5.6 Terra se impuso a Gemini 2.5 Flash en el flujo de análisis posterior a la llamada, con hasta un 97% de precisión en idiomas regionales frecuentes en los mercados donde opera. Los modelos que pasan esa validación offline entran primero con una porción pequeña del tráfico y luego se generalizan. Ya en producción, el enrutador vigila latencia y salud de los endpoints por región y desvía carga cuando uno se cae o cruza un umbral.
Para quien esté montando agentes sobre APIs de modelos, lo trasladable no es el porcentaje sino el patrón: enrutado por tipo de tarea, resúmenes por umbral de tokens, evaluación antes de tocar producción y conmutación automática cuando la latencia se degrada. Lo que no se puede comprobar desde fuera es si esa arquitectura aguanta igual de bien con otra cartera de clientes o si el 65% de resolución se sostiene cuando las llamadas se complican.

