Cerebras incluye Qwen 3.8 27B en su API pública con 1.500 tokens por segundo
El proveedor de inferencia añade el modelo de Alibaba a su catálogo para accesos compartidos, garantizando que se sirva sin poda de pesos y con cuantización solo en almacenamiento.
Cerebras ha publicado Qwen 3.8 27B en sus puntos de acceso públicos. El modelo se ejecuta en la infraestructura del chip wafer-scale de la compañía y ofrece una velocidad de generación de texto aproximada de 1.500 tokens por segundo. Se encuentra disponible tanto en el plan de pago por uso como en la capa de prueba gratuita, aunque está sujeto a cuotas de tasa. Junto a este lanzamiento, la plataforma también soporta la versión de 120 mil millones de parámetros de OpenAI, GPT-OSS, que alcanza hasta 3.000 tokens por segundo.
Garantías de integridad del modelo
El equipo técnico de Cerebras ha aclarado en su documentación que no se aplican técnicas de poda activa a los modelos alojados en las interfaces compartidas. Cuando la compañía habla de compresión, lo hace exclusivamente en el contexto del almacenamiento de pesos. Utilizan cuantización selectiva de solo pesos, combinando precisiones de 16, 8 y 4 bits según la criticidad de los parámetros. Durante la inferencia, realiza una descombinación en tiempo real para que las capas sensibles operen con precisión completa. El estado de las activaciones, la atención y el caché de llaves y valores permanece en precisión completa. Esta decisión técnica busca mantener la calidad de salida idéntica al archivo original descargado de repositorios comunitarios.
La distinción es relevante para quienes integran LLM en pipelines de producción. Cerebras ha separado claramente los modelos de investigación de los de producción. La empresa investiga activamente técnicas de poda, como el recorte de expertos ponderado por enrutamiento (REAP). Sin embargo, las versiones podadas resultantes de esta investigación se publican en Hugging Face con fines experimentales y no se ofrecen a través de la API principal. La plataforma no altera la arquitectura de los modelos existentes sin previo aviso ni cambia su nombre. Si en el futuro decide ofrecer modelos modificados por poda, los alojará en endpoints distintos con identificadores que lo especifiquen explícitamente para permitir a los consumidores decidir si quieren sacrificar capacidad del modelo a cambio de eficiencia.
Estos puntos de acceso compartidos están diseñados para cargas de trabajo variables y pruebas conceptuales. Para entornos de misión crítica que requieren capacidad reservada, un mayor rendimiento sostenido y acuerdos de nivel de servicio definidos, Cerebras dirige a los clientes hacia sus endpoints dedicados. La diferencia técnica radica en que los modelos públicos priorizan la fidelidad del modelo original sin optimizaciones de inferencia que alteren la estructura de pesos, mientras que los dedicados permiten configurar recursos fijos para garantizar latencia predecible en volúmenes de transacción elevados.


