FuriosaAI detalla su tercer acelerador de inferencia: 32 PFLOPS y 576 GB de HBM4
La startup surcoreana publica las especificaciones del chip que desarrolla junto a Broadcom, con dos dies de 2 nm y 12 pilas de HBM4.

FuriosaAI ha publicado los detalles técnicos de su tercer acelerador de inferencia. La empresa surcoreana lo ha desarrollado junto a Broadcom y las cifras que da multiplican por 32 las de su generación anterior: 32 PFLOPS de cómputo y 48 TB/s de ancho de banda de memoria. El anuncio llega sin demo, sin precio y sin fecha de disponibilidad.
Dos dies de cómputo a 2 nm y 576 GB de HBM4
El chip se apoya en dos dies de cómputo de 2 nm de tamaño máximo de retícula, esto es, hasta el límite que permite el campo de exposición de la litografía, más un die de E/S independiente. Alrededor van 12 pilas de memoria HBM4 (E) de 48 GB cada una, que suman 576 GB de capacidad. El ancho de banda agregado es de 48 TB/s. Dentro del rack los aceleradores se conectan con una topología SUE completamente conectada, y el enlace con el host es PCIe Gen7.
Frente al chip de segunda generación, al que la compañía llama RGND, el salto que anuncia el fabricante es de 8 veces en tamaño físico, 32 en cómputo, 12 en capacidad de memoria y 32 en ancho de banda. Son cifras suyas: no hay mediciones independientes ni cargas de trabajo publicadas que las respalden.
La elección de HBM4 no es casual. La generación anterior de memoria apilada ya va justa para modelos con contextos largos y lotes grandes, y el cuello de botella en inferencia se ha movido del cálculo al movimiento de datos. Triplicar o multiplicar por 32 el ancho de banda es, sobre el papel, la forma más directa de servir más tokens por segundo. Sobre el papel, porque de nada sirve el silicio si no llega a producción.
FuriosaAI compite en un segmento donde Nvidia concentra la mayor parte del mercado de aceleradores y donde los grandes proveedores de nube empujan además sus propios chips. Un tercer producto con especificaciones altas no basta: hace falta que el stack de compiladores y runtimes acompañe, que los clientes puedan portar sus modelos sin reescribirlos y que la cadena de suministro de HBM4 aguante la demanda que ya tienen otros fabricantes. Nada de eso aparece en el anuncio.
Queda por ver también el consumo, que en un chip de este tamaño y con PCIe Gen7 no es un detalle menor para quien tiene que meterlo en un rack y refrigerarlo. La compañía ha contado lo que promete, no cuándo se puede comprar.

