Fireworks lanza Ember-1, modelo especializado que reduce un 40 % los tokens manteniendo la calidad de Kimi K3
Ember-1, el nuevo modelo de Fireworks Research, entrega la misma precisión que Kimi K3 usando menos tokens, lo que baja considerablemente el coste en entornos de razonamiento intensivo.

Fireworks Research ha puesto en producción Ember-1, una variante especializada de Kimi K3 que consume aproximadamente un 40 % menos de tokens sin perder calidad. La compañía afirma que el modelo mantiene la capacidad de razonamiento necesaria para tareas de programación, agentes multi‑turn y búsqueda, pero elimina el razonamiento redundante que suele inflar el coste.
El proyecto surgió por la demanda de usuarios que necesitaban las capacidades de codificación de K3 a menor precio. Reducir la longitud del razonamiento sin afectar la exactitud no se logró simplemente limitando el esfuerzo del modelo; fue necesario entrenar una nueva versión. Fireworks realizó más de 50 experimentos de entrenamiento y más de 200 evaluaciones, introduciendo algoritmos que acortan el razonamiento interno. Todo el proceso se ejecutó en Fireworks Serverless Training, lo que permitió lanzar experimentos rápidamente y pagar solo por los recursos consumidos.
En pruebas externas, benchmarks públicos y pruebas A/B con clientes, Ember-1 mostró una reducción del 35‑50 % en tokens generados frente a Kimi K3, manteniendo o incluso mejorando la precisión en áreas como matemáticas, codificación, instrucción y uso de herramientas. En el Specialized Intelligence Index (SII), Ember-1 alcanzó la frontera de Pareto en el benchmark Bedside Bench, superando a modelos como GPT‑5.6 Sol, GPT‑6 Astra y Claude Opus 5 en la relación costo/tarea.
Los análisis de coste utilizan la tarifa pública de la API de Kimi K3 (entrada no caché $3 por millón de tokens, entrada caché $0,30 por millón, salida $15 por millón). Ember-1 se sitúa en la frontera de coste‑calidad en todos los benchmarks con más de 50 muestras, igualando la calidad de K3‑max a una fracción del precio y dominando claramente a K3‑low.
El anuncio también marca el inicio de una serie de modelos especializados que Fireworks planea lanzar, todos construidos sobre su plataforma de entrenamiento serverless. Para los equipos de desarrollo y operaciones, Ember‑1 representa una opción para reducir facturación en flujos de trabajo con razonamiento extensivo, como agentes de IA y generación de código a gran escala.
Discusión en Hacker News muestra el interés de la comunidad en la relación coste‑calidad que propone Ember‑1.
En conclusión, Ember‑1 ofrece una vía práctica para disminuir el consumo de tokens sin sacrificar rendimiento, lo que podría traducirse en ahorros significativos para despliegues de IA a gran escala y abre la puerta a más modelos optimizados por costo.

