BookinglyTech News
Software

TurboGPT: entrena un transformer de 22 KiB en 13 s con CUDA C++

El proyecto TurboGPT demuestra que un modelo de 22 KiB puede entrenarse en 13 s sobre 1.5 G tokens usando CUDA 13.4 y C++.

1 min de lecturaShow HN1 vista

TurboGPT es un proyecto de MIT que permite entrenar un transformer de 22 KiB a nivel de byte en menos de 15 s. La implementación está en C++ con CUDA 13.4 y se compila fácilmente en Linux/NixOS con nix-build o en Windows usando Visual Studio 2022.

El proceso de entrenamiento se ejecuta con el comando:

.\uild\turbogpt.exe --data hn1g.txt --log -t runs/ctx4

El checkpoint resultante se guarda en runs/ctx4/ctx4.pt, que incluye el modelo, el optimizador, el scheduler y el estado del entrenador. Para reanudar, simplemente use --load CHECKPOINT.pt. Los logs son compatibles con TensorBoard, con un reporte por batch y un límite de 8 MiB.

El entrenamiento de 1.5 G tokens alcanzó 2.5295 BPB (bits por byte). Los tests de verificación están disponibles en python tests\verify.py.

Más información sobre la lista de GPU compatibles con CUDA puede consultarse en NVIDIA's CUDA GPU list. El proyecto fue anunciado en una publicación de Show HN, disponible en Hacker News.

Este trabajo es relevante para administradores de sistemas y desarrolladores que buscan evaluar la viabilidad de entrenar modelos ligeros en infraestructura local con CUDA, sin necesidad de frameworks de alto nivel.