Fulloch replica GPT Live en una RTX 3060 con Qwen‑3.5 9B
El asistente local Fulloch ejecuta el mismo caso de uso que GPT Live, usando Qwen‑3.5 9B y una tarjeta RTX 3060, con resultados competitivos en tiempo y precisión.

El proyecto Fulloch, mantenido por liampetti, ha puesto a prueba su asistente de voz local contra la demo pública de GPT Live que muestra una conversación de "Inteligencia Mejorada". En la demo, el modelo evalúa la viabilidad de una ruta aérea mientras responde preguntas sobre gastronomía en cada destino. Fulloch reprodujo exactamente la misma secuencia de consultas usando el modelo Qwen‑3.5 9B, que ocupa menos de 10 GB de VRAM y cabe sin problemas en una RTX 3060.
El experimento se documentó en un video y en un artículo en fulloch.com. El modelo no logró determinar una ruta de vuelo viable, pero ofreció recomendaciones de comida y restaurantes que resultaron útiles y lo hizo en pocos segundos. El autor destaca que, a pesar del pequeño tamaño del modelo, la respuesta fue rápida y la calidad de las sugerencias gastronómicas estuvo a la altura de la demo de OpenAI.
Para los que quieran replicar la prueba, el código fuente y las imágenes Docker precompiladas están disponibles en el repositorio. La demo de GPT Live que sirvió de referencia se puede ver en el video de OpenAI "Improved Intelligence". La comparativa muestra que una solución totalmente on‑premise, con un hardware modesto, puede aproximarse al comportamiento de un servicio cloud de gran escala, lo que abre la puerta a despliegues más controlados y sin dependencia de APIs externas.
Queda por ver cómo evoluciona la integración de Qwen‑3.5 9B en flujos más complejos y si futuros modelos de mayor capacidad seguirán manteniendo este equilibrio entre rendimiento y coste de hardware.


