AnythingLLM dobla en velocidad a Hermes Agent con el mismo modelo local
Un usuario compara dos asistentes autoalojados contra el mismo Ollama y el mismo modelo: la diferencia de rendimiento está en la ventana de contexto, no en la red.
Un usuario de r/selfhosted ha puesto números a algo que muchos sospechan: dos asistentes de IA autoalojados, el mismo modelo y el mismo servidor de inferencia pueden rendir de forma muy distinta según cómo gestionen el contexto. AnythingLLM le da entre 30 y 40 tokens por segundo. Hermes Agent, entre 8 y 12. Mismo modelo en ambos casos: Qwen3.6 35B A3B en cuantización Q4 vía Unsloth, servido desde el mismo Ollama.
El montaje es el siguiente. AnythingLLM corre nativo en un escritorio con Windows 11 y un Ollama local; es su configuración principal y la que más usa. Hermes Agent vive en un portátil con Fedora 44 y llega a esa misma instancia de Ollama a través de Tailscale. El escritorio lleva un Ryzen 5 7600X, 64 GB de DDR5 y una RTX 4060 con 8 GB de VRAM. El portátil es un Asus Zenbook 14 con 16 GB de RAM y un Ryzen AI 7 445.
La ventana de contexto se come la velocidad
El autor descarta la red como causa: Tailscale mantiene la conexión estable entre portátil y escritorio. El cuello de botella está en la gestión de contexto. Hermes trabaja con una ventana de 128k porque sus herramientas y skills hacen un seguimiento muy agresivo del estado, y necesita ese espacio para no comprimir el historial cada dos por tres. Eso añade una sobrecarga considerable en cada turno. AnythingLLM va configurado con 32k y no le hace falta más para su flujo de trabajo.
El uso declarado no tiene nada que ver con programar: investigación, correo, calendario, búsqueda web y tareas de asistente general. Con esas tareas, el autor se queda con AnythingLLM. Dice que está más afinado para productividad y que la instalación autoalojada fue directa.
Lo que Hermes hace y AnythingLLM no
Hermes no sale mal parado en capacidades. Puede interactuar con el equipo, ejecutar comandos del sistema y tirar de su ecosistema de skills, cosas que el otro no hace. El autor también le reconoce un mérito indirecto: obliga a trastear con la configuración, así que se aprende bastante sobre montar IA local. Lo que le echa para atrás es la velocidad, y con 8 a 12 tokens por segundo en un portátil, el argumento pesa.
Conviene poner los números en su sitio. Son de una sola persona, con un equipo concreto y sin metodología publicada: no son un benchmark reproducible, y el resultado depende de la ventana de contexto, la cuantización y el hardware tanto como del asistente. Aun así, el dato útil es el de siempre en inferencia local: subir la ventana de contexto no es gratis, y en máquinas modestas se paga en tokens por segundo. Si estás montando un asistente para el día a día, dimensionar el contexto antes que el modelo suele dar más alegrías que cambiar de herramienta.


