SpaceXAI lanza Grok Voice Transcribe 2.0 con la mitad de errores y el mismo precio
El nuevo modelo de transcripción supera a sus 32 competidores en precisión manteniendo una tarifa de 0,10 dólares por hora de audio.

SpaceXAI ha publicado la versión 2.0 de su modelo de transcripción de voz a texto, Grok Voice Transcribe. El cambio principal no es el precio, que permanece intacto, sino el rendimiento: la compañía afirma que la tasa de error se ha reducido a la mitad respecto a la versión anterior. El modelo se construye sobre la infraestructura de audio base de Grok Voice, que ya está en producción para gestionar decenas de miles de llamadas telefónicas al día, transcribir millones de horas de narración en vídeo y alimentar agentes de voz en hardware físico, incluida la asistente de voz de Tesla.
Mejoras técnicas y posicionamiento
En las listas de clasificación de Artificial Analysis, Grok Voice Transcribe 2.0 ocupa la primera posición en precisión entre los 32 modelos de transcripción en streaming disponibles. SpaceXAI complementa estos datos públicos con pruebas en cuatro conjuntos de datos internos extraídos de su tráfico real: llamadas de atención al cliente, conversaciones cotidianas en inglés, información dictada (teléfonos, correos, direcciones) y comandos de voz multilingües cortos.
Según la empresa, el nuevo modelo supera a la versión 1.0 en todos y cada uno de estos escenarios de evaluación. Para un equipo de TI que evalúa herramientas de transcripción, esto significa una mejora tangible en la fiabilidad del texto generado sin necesidad de reconfigurar pipelines existentes ni asumir costos adicionales por funciones avanzadas.
La estructura de precios es clara y sin sorpresas. La transcripción por lotes cuesta 0,10 dólares por hora de audio, mientras que el procesamiento en tiempo real está en 0,20 dólares por hora. SpaceXAI incluye de forma gratuita funciones que otras plataformas suelen cobrar extra, como la separación de hablantes, las marcas de tiempo precisas y la posibilidad de definir listas de palabras clave personalizadas para mejorar el reconocimiento de términos específicos del sector.
La decisión de mantener las tarifas mientras se duplica la precisión es una jugada competitiva directa. Si los benchmarks y las pruebas internas son fiables, este movimiento pone presión sobre otros proveedores de APIs de speech-to-text que podrían necesitar revisar sus precios para competir en el segmento de alta precisión y bajo coste por hora.


