Ollaya lleva los modelos de decisión de TypeSafe a un servidor local
El proyecto open source sirve los endpoints de TypeSafe con modelos abiertos que responden en una sola pasada, con latencias de milisegundos en local

Ollaya es un servidor local, con licencia Apache-2.0 y código en GitHub, que sirve modelos de decisión open source con la misma API que TypeSafe. Los endpoints /v1/systemone y /v1/models replican las formas de petición y respuesta del servicio, y el SDK oficial de Python en su versión 0.7.1 funciona sin cambios apuntando al puerto local 11435. La diferencia con el servicio hospedado: aquí los modelos corren en local y responden en una sola pasada hacia adelante, sin generación token a token.
Qué modelos son y cuánto tardan
El catálogo es variado. laya, de Convai Innovations, es el más rápido y responde preguntas tipadas de elección, puntuación y sí/no en más de cien idiomas. decider, de Mapika sobre Qwen3.5, lee la respuesta de los logits de las letras de opción y es el más preciso de los modelos abiertos que distribuye Ollaya. nli usa clasificadores zero-shot de Moritz Laurer. gliclass, de Knowledgator, puntúa todas las opciones en una sola pasada, así que el coste apenas crece con el número de alternativas. qwen3guard, del equipo Qwen, filtra seguridad en 119 idiomas. kev, de Jared Palmer, monta una LoRA sobre Qwen3.5 con una cabeza que puntúa cada opción en su propio tramo. Y von, de Victor Hugo Panisa, va sobre ModernBERT-large con 8.192 tokens de contexto.
Las latencias medidas en una RTX 4090 son contundentes. Una petición de cinco preguntas a laya ronda los 10 ms de punta a punta por la API HTTP. El desglose por modelo: laya:multilingual 8,1 ms, laya:en 9,6 ms, gliclass 14,7 ms, nli 20,4 ms, decider:0.8b 155 ms, decider:2b 190 ms. La API hospedada de TypeSafe queda en 236-276 ms en mediciones de terceros que incluyen la red. La propia web avisa de que las configuraciones no son idénticas y pide leerlo como una comparación de orden de magnitud. Un ejemplo que enseñan: decider:2b respondió en 178 ms en una RTX 4090.
Dónde corre
Hay app de escritorio y línea de comandos para macOS con Apple silicon, Windows 10 y 11 x64, Linux x86-64 y Linux ARM64, además de imagen Docker para amd64 y arm64. Los modelos funcionan siempre en CPU; con una GPU NVIDIA en Linux, WSL 2 o Docker las latencias bajan a milisegundos. En Apple, AMD e Intel la ejecución es por CPU. Los instaladores exigen driver R580 o superior y descargan las librerías CUDA solo si encuentran una GPU. El arranque es un binario y un comando: ollaya run laya. El proyecto promete más modelos en el horizonte, incluidos GGUF vía llama.cpp.
Para quien tenga que clasificar tickets, correos o mensajes de usuario, la propuesta tiene sentido: son datos sensibles y aquí se puntúan donde ya viven. Si el SDK de TypeSafe ya está integrado, cambiar TYPESAFE_BASE_URL es casi todo el trabajo.


