Qwen3-30B a 50 tok/s su una RTX 5060 Ti: il motore CUDA che riscrive l’inference locale
Un esperimento con codice C++ e CUDA su misura porta un modello MoE da 30 miliardi di parametri a superare 50 token al secondo su una GPU consumer con 16 GB di VRAM. Il motore garlic-inference supera llama.cpp del 50%, mostrando margini di ottimizzaz...