Software pratico, benchmark onesti, per hardware che esiste già. Codice pubblico, risultati misurati — inclusi quelli negativi.
Server di inferenza LLM CPU-first costruito su llama.cpp, con una tesi sola: mai calcolare due volte la stessa cosa. Cache KV persistente su disco, decoding speculativo autoregolante, archivio delle generazioni e il Conclave. Serve un MoE da 7B a 17.8 token/s su una macchina ARM gratuita.
Trasforma un vecchio iMac in un display esterno per Mac Apple Silicon via Thunderbolt Bridge, con relay di tastiera e mouse, clipboard sync, luminosità remota e audio.