ServiceNow AI libera EVA-Bench Data 2.0, un benchmark para agentes de voz empresariales
El dataset cubre tres dominios (aerolínea, ITSM y salud), 121 herramientas y 213 escenarios, todo validado por GPT-5.4, Gemini 3.1 Pro y Claude Opus 4.6.

El grupo de investigación de ServiceNow AI ha publicado EVA-Bench Data 2.0, un benchmark de código abierto para evaluar agentes de voz en entornos empresariales. La versión original solo cubría un dominio; esta expansión abarca tres escenarios reales: atención al cliente de aerolíneas, gestión de servicios de TI (ITSM) y servicios de recursos humanos en salud (HRSD). En total son 213 escenarios de evaluación y 121 herramientas, aproximadamente cuatro veces más alcance que la versión previa. Por dominio, aerolíneas tiene 50 escenarios, ITSM 80 y HRSD 83. Los datos se generaron a partir de flujos telefónicos reales de atención al cliente, con esquemas de herramientas modelados sobre especificaciones de API de producción. El dominio de salud incluye detalles de políticas estadounidenses como identificadores NPI, regulaciones de baja familiar FMLA y reglas de cobertura de seguros, para que la evaluación refleje lo que los profesionales encuentran cada día. Los 213 escenarios fueron validados por tres modelos de frontera —GPT-5.4 de OpenAI, Gemini 3.1 Pro de Google y Claude Opus 4.6 de Anthropic— para asegurar que sean resolubles, pero también que no favorezcan a un solo proveedor. Todo está disponible en Hugging Face Datasets, y el equipo anuncia una expansión multilingüe para superar la limitación del inglés actual. Los principios de diseño y el proceso de generación están documentados en el blog oficial, por si quieres construir tu propio dataset de evaluación.

