Inference CPU, l'indice vettoriale riduce il peso dell'output embedding
Sostituire la proiezione densa sul vocabolario con una ricerca approssimata su indice HNSW accelera la decodifica autoregressiva su CPU. Nei test con Gemma 3, Llama 3.2 e Qwen 3, il throughput batch-one di Gemma 3 270M migliora fino all'82%, senza pe...