BookinglyTech News
Inteligencia artificial

d-Matrix licencia NVLink Fusion de Nvidia y construye sus racks sobre MGX

La startup integra el interconnect de Nvidia en sus aceleradores Raptor y prevé sistemas de 144 chips con 2,3 TB de memoria y 7,2 PB/s agregados

3 min de lecturaThe Register0 vistas

d-Matrix se ha apuntado a NVLink Fusion. La startup de infraestructura para IA ha cerrado un acuerdo con Nvidia para licenciar su interconnect chip a chip y para levantar sus blades de cómputo sobre los diseños de referencia MGX. Con eso se suma a Qualcomm, Arm, Marvell, Amazon Web Services, Fujitsu y MediaTek, que entraron antes en el mismo paquete.

El movimiento tiene una lectura muy práctica: d-Matrix se ahorra diseñar su propia red de scale-up y su propio rack. Al usar NVLink en lugar de otros interconnects, sus clientes pueden desplegar los chips en los mismos bastidores y los mismos tejidos NVSwitch que ya tienen para Nvidia. Para quien vende a centros de datos, eso quita bastante fricción.

Raptor y los racks NVL144

El plan pasa por los aceleradores Raptor, que la compañía enseñó en Hot Chips el mes pasado. Cada tarjeta lleva 32 GB de DRAM apilada en 3D y mueve 100 TB/s de ancho de banda de memoria, aproximadamente 4,5 veces lo que da la GPU Rubin de Nvidia. Los XPU que irán en los racks NVL144 son la mitad de grandes: unos 16 GB de DRAM 3D y 50 TB/s. Con 144 por rack salen alrededor de 2,3 TB de capacidad —suficiente para modelos de más de cuatro billones de parámetros a 4 bits— y unos 7,2 petabytes por segundo de ancho de banda agregado en pico.

El truco es pegar la lógica de cómputo encima de una pila de DRAM. Queda una plataforma de cómputo en memoria con poca capacidad pero con un ancho de banda más cercano al de la SRAM que lo que permite la HBM. Y el ancho de banda es justo el cuello de botella de la inferencia: cuanto más rápido lee la memoria, más rápido escupe tokens.

De ahí la comparación con Groq. Nvidia pagó 20.000 millones de dólares el año pasado por licenciar su propiedad intelectual y llevarse a su equipo de ingeniería: su arquitectura, cargada de SRAM, llegaba a 150 TB/s por chip, pero solo caben 500 MB en un die. Un modelo de un billón de parámetros exige más de 2.000 LPU 3 de Groq a 8 bits; un sistema d-Matrix necesitaría unos 64, o 32 a 4 bits. Como las LPU, los chips de d-Matrix pueden ir solos o mezclados con GPUs: la GPU hace el prefill, que es intensivo en cómputo, y el acelerador se encarga del decode, atado al ancho de banda.

Lo que gana Nvidia

Además del interconnect, d-Matrix piensa combinar sus aceleradores con las CPU Vera, los appliances NVSwitch, las NIC BlueField y ConnectX y los productos Ethernet SpectrumX. Es decir, Nvidia factura aunque no venda una sola GPU. Y no le está costando poco meter gente en el jardín: invirtió 3.500 millones en Marvell y otros 3.500 en MediaTek para cerrar esos acuerdos.

En este caso no hay confirmación de que haya inversión de por medio. De Raptor tampoco se sabe todo, solo lo que la empresa mostró en Hot Chips, y los sistemas con 144 aceleradores conectados por un único tejido NVLink all-to-all no llegan hasta finales del año que viene. Para entonces se verá si el atajo de comprar el interconnect en lugar de construirlo compensa la dependencia.