DeepSeek publica en abierto sus componentes de infraestructura para Ascend
La compania libera TileLang y las bibliotecas de calculo y comunicacion que ya tenia para CUDA, ahora portadas al silicio de Huawei. Cada pieza tiene su equivalente uno a uno.
DeepSeek ha liberado en abierto el paquete de componentes de infraestructura que hasta ahora solo existia para las GPU de Nvidia, esta vez portado a la plataforma de computo Ascend de Huawei. Lo anuncio la propia compania en su canal oficial: entra el lenguaje de alto nivel TileLang y las bibliotecas de calculo y comunicacion distribuida con las que entrena sus modelos. La correspondencia con la version para CUDA es uno a uno.
El movimiento importa porque toca la capa que casi nadie ensena. No es un modelo nuevo ni un benchmark, sino el utillaje que hay debajo: el compilador, los kernels y el transporte entre tarjetas. Quien entrene o sirva modelos sobre Ascend gana piezas que antes solo estaban resueltas del lado verde.
TileLang, de CUDA a Ascend C
TileLang es la pieza central. Frente a CUDA, DeepSeek sostiene que su programacion es mas sencilla y que reduce el codigo necesario para cada operador. Frente a otros lenguajes de alto nivel del mismo tipo, defiende que su modelo de programacion exprime mejor las caracteristicas del chip y llega al techo de rendimiento del hardware. La ruta ya se valido antes en Nvidia, y segun la compania soporta buena parte de los operadores que se usan en el entrenamiento de la serie DeepSeek V4.
La version para Ascend envuelve las instrucciones de bajo nivel de Ascend C y expone una capa de alto nivel sin perder prestaciones, siempre segun DeepSeek. La afirmacion es suya, no de un tercero independiente. Lo que si es verificable es el catalogo: cada operador TileLang que aparece en su entrenamiento tiene una implementacion equivalente para Ascend en el repositorio.
El resto del paquete cubre lo que suele doler al escalar:
- DeepGEMM para multiplicacion de matrices de proposito general.
- DeepEP para comunicacion entre dispositivos a gran escala.
- TileKernels con operadores vectoriales y de acceso a memoria.
- FlashMLA con atencion dispersa, pensada para contextos largos.
- DeepSelect para filtrado de datos.
DeepSeek asegura que en varios casos de prueba la computacion y la comunicacion se acercan al limite del hardware. Otra vez, dato de la casa.
Huawei dentro
La compania reconoce que el equipo de Huawei apoyo el desarrollo para Ascend sin reservas, y que ambas trabajaron juntas en un esquema de supernodo de 128 tarjetas sobre Ascend 950, ademas de optimizar calculo y comunicacion de forma conjunta. Es la parte menos glamurosa del anuncio y probablemente la que mas dice: portar una pila de entrenamiento a otro silicio no sale solo con ganas, hace falta que el fabricante abra la capa de abajo.
Para quien administra clusters, lo practico es que TileLang y el resto de bibliotecas dejan de ser una via de un solo proveedor. La pregunta que queda es si esas implementaciones para Ascend aguantan el ritmo de actualizacion del lado CUDA, que es donde DeepSeek desarrolla primero. El codigo esta en tilelang y las bibliotecas de comunicacion en DeepEP-Ascend.


