BookinglyTech News
Inteligencia artificial

LinkedIn entrena su buscador de empleo 8 veces más rápido con destilación multitutor

LinkedIn detalla cómo entrena el ranker de su búsqueda de empleo: destilación multitutor para comprimir profesores de miles de millones de parámetros en un modelo de 600 millones.

3 min de lecturaInfoQ0 vistas

LinkedIn ha contado cómo entrena el sistema de ranking que hay detrás de su búsqueda de empleo en lenguaje natural. La pieza central es una pipeline de destilación multitutor que comprime el conocimiento de varios modelos grandes en un ranker de 600 millones de parámetros, y que ya está en producción sirviendo a los usuarios estadounidenses. Lo interesante no es la técnica de destilación en sí, sino el trabajo de sistemas que la hace lo bastante rápida para iterar.

Profesores dentro del bucle de entrenamiento

Entrenar un modelo pequeño para mejorar relevancia y engagement (clics, candidaturas) obliga a consultar uno o varios profesores grandes por cada ejemplo de entrenamiento. Servir esos profesores en el mismo bucle ralentiza todo, y a la escala de LinkedIn eso son cientos de miles de consultas por segundo.

El equipo montó un framework propio sobre SGLang que carga y sirve profesores de distintos tamaños, gestiona despliegues tensor-parallel y data-parallel, y lanza un cliente asíncrono que consulta a los profesores durante el entrenamiento y suma sus salidas a las pérdidas de destilación. Lo llaman destilación multitutor en línea. Repartir réplicas locales de los profesores por varios nodos multiplicó por 3 la velocidad del proceso sin disparar la latencia.

Para no repetir cálculos, añadieron una variante offline: precalculan las salidas de los profesores, las guardan en HDFS o NFS y las leen directamente durante el entrenamiento. El reparto tiene sentido: consultas en línea mientras los profesores aún cambian, caché offline cuando ya están estables y el volumen sube.

Debajo hay más capas de optimización: LiGer para reducir memoria y permitir lotes el doble de grandes, entrenamiento multinodo (hasta 3,5x), FSDP2 (20% más) y clústeres multinodo con H200 (30% adicional). Todo apilado da el factor ocho del título. Un detalle que el equipo menciona: probaron precisión mixta FP8 y no encontraron ventaja por debajo de 8.000 millones de parámetros, porque el coste de las conversiones se come el ahorro.

Resultados y qué sacar de aquí

El estudiante de 600 millones de parámetros se destila de un oráculo de relevancia de 8.000 millones y un profesor de engagement de 1.700 millones. Según los datos que publica LinkedIn, el NDCG@10 en búsquedas de empleo pasa de 0,7583 a 0,9432, un 24,48% mejor. En inferencia, poda estructurada y compresión de contexto llevan el throughput de ranking de unos 290 a más de 2.000 elementos por segundo y GPU. Las cifras son suyas, no de un tercero independiente.

LinkedIn no es el único. Pinterest publicó en junio un trabajo parecido sobre escalado de entrenamiento multinodo para sus modelos fundacionales, con la misma idea de fondo: profesores grandes, estudiantes eficientes. Y el panorama de la destilación multitutor se mueve hacia pools de diez o más profesores especializados, como en Nemotron 3 Ultra, MiMo-V2-Flash o DeepSeek-V4, una complejidad que los sistemas de ranking industrial no necesitan.

Lo aprovechable para quien esté montando algo similar es el patrón en línea/offline para servir profesores y la advertencia sobre FP8: no des por hecho que bajar precisión compensa siempre. Los saltos aquí son acumulativos, ninguno decisivo por separado.