BookinglyTech News
Inteligencia artificial

OpenJev permite comparar logits y generación de tokens en el navegador

Una herramienta web descarga modelos GGUF de Hugging Face y mide en tiempo real la diferencia entre leer probabilidades directamente y decodificarlas.

2 min de lecturaHacker News (top)0 vistas

OpenJev ha lanzado una herramienta experimental que ejecuta modelos de lenguaje locales directamente en el navegador, sin backend ni servidor. El proyecto permite a los desarrolladores medir la diferencia de rendimiento y calidad entre dos métodos de decisión: leer las probabilidades de los logits directamente o pedir al modelo que genere esas mismas probabilidades token a token en formato JSON.

El sistema funciona descargando pesos cuantizados en formato GGUF desde Hugging Face, que permanecen en la caché del navegador. Los datos de entrada no salen de la página, lo que elimina la dependencia de infraestructura externa. El sitio ofrece tres modelos por defecto: Qwen3 0.6B (639 MB) para dispositivos móviles, MiniCPM5 2B (1.56 GB) como opción estándar de escritorio y Qwen3.5 4B (3.01 GB) para equipos con más memoria. La carga inicial puede tardar varios minutos dependiendo de la red y la GPU, ya que implica la descarga, el calentamiento y la compilación de los pasos para ambas metododías.

Medición en tiempo real

La interfaz separa claramente los tiempos de ejecución usando performance.now(). Primero se ejecuta la lectura directa de logits, seguida de la generación de tokens. Los resultados varían según el modelo; por ejemplo, el modelo de 4B muestra una precisión del 84,5% en la métrica TypeSafe, frente al 63,7% del modelo de 2B. La herramienta advierte que la cuantización puede alterar tanto la velocidad como la calidad del modelo, por lo que los tiempos mostrados son específicos de la hardware del usuario y no representativos de un entorno de producción.

No se trata de una solución para despliegues a gran escala, sino de un entorno de pruebas rápido para evaluar el comportamiento de modelos pequeños. La métrica principal es la precisión equilibrada (balanced accuracy) sobre un subconjunto público de 102 filas. Los logits directos no son confianza calibrada, sino una normalización softmax sobre las opciones proporcionadas.

Para quien trabaja con IA local, este experimento es útil para entender las limitaciones de la inferencia en el navegador y la diferencia entre decodificación directa y generación. No sustituye a una inferencia optimizada en servidor, pero ofrece una forma transparente de medir el overhead de cada enfoque sin configurar un entorno de desarrollo completo.