Perplexity publica Lily, motor de inferencia local optimizado para Qwen3.6-35B-A3B en Apple silicon
Lily, el nuevo motor de inferencia híbrida de Perplexity Computer, está disponible como código abierto y promete mayor velocidad en Mac con Apple silicon.

Perplexity ha puesto a disposición de la comunidad el código fuente de Lily, un motor de inferencia local pensado para ejecutar modelos híbridos en la arquitectura de Apple silicon. El proyecto está orientado a Qwen3.6-35B-A3B y se integra con la plataforma Perplexity Computer.
A diferencia de MLX‑LM, que trata todo el proceso como una única carga de trabajo, Lily separa la fase de prefill y la de decodificación token a token, asignando cada una a los recursos más adecuados del chip. Esa división permite mapear las operaciones de Qwen directamente a la arquitectura de cómputo y memoria de los procesadores Apple.
En pruebas realizadas en un MacBook Pro M5 Max, Perplexity informó que Lily alcanzó un rendimiento medio 1,23 veces superior al de MLX‑LM en la fase de prefill y 1,35 veces en la decodificación, sin percibir variaciones notables en la calidad de la salida. Los benchmarks se basan en métricas de throughput y no incluyen pruebas de latencia extrema.
El repositorio incluye scripts de compilación, ejemplos de uso y documentación para integrar Lily en pipelines de inferencia locales. Al ser open‑source, los usuarios pueden inspeccionar el código, aportar mejoras o adaptar el motor a otros modelos compatibles con la arquitectura de Apple.
Esta publicación abre la puerta a despliegues locales más eficientes de grandes modelos de lenguaje en entornos macOS, reduciendo la dependencia de servidores en la nube y los costos asociados. Queda pendiente observar cómo evoluciona el soporte para otros chips y modelos, y si la comunidad adopta Lily como alternativa estándar frente a MLX‑LM.


