Topic / Trend Rising

Efficienza di inference e ottimizzazione dei modelli

Tecniche come decodifica speculativa con vocabolari eterogenei, approssimazione della KV cache, token merging e quantization dinamica puntano a ridurre costi, latenza e uso di VRAM. Modelli piccoli ad alte prestazioni e addestramento efficiente stanno ridisegnando l'economia del deployment.

Detected: 2026-09-15 · Updated: 2026-09-15

Articoli Correlati

2026-09-15 ArXiv cs.LG

Il budget di token diventa la variabile chiave per gli agenti LLM locali

BudgetBench propone un protocollo e un harness per confrontare strategie di memoria negli agenti LLM locali, trattando il budget di token per chiamata come variabile indipendente. I test pilota su qwen2.5:1.5b, Qwen3 30B-A3B e LongMemEval mostrano vi...

#Hardware #LLM On-Premise #DevOps
2026-09-14 LocalLLaMA

K2 Horizon 7B: il 7B si piazza tra Qwen 3.6 27B e 35BA3b

Il modello IFM K2 Horizon 7B ottiene un punteggio sull'Artificial Analysis Intelligence Index compreso tra Qwen 3.6 27B e Qwen 3.6 35BA3b. Nei primi test locali compila l'ultimo llama.cpp per CUDA senza problemi. Se il risultato regge, un 7B con pres...

#Hardware #LLM On-Premise #DevOps
2026-09-12 LocalLLaMA

Qwen3.8-27B GGUF: layout per-tensore, quantization più leggibile

La scheda modello di bartowski/Qwen3.8-27B-GGUF introduce mappe di layout per-tensore per la compressione GGUF. L'intervento rende esplicito, tensore per tensore, lo schema di quantization usato, aiutando chi gestisce deployment self-hosted a stimare...

#Hardware #LLM On-Premise #DevOps
2026-09-11 LocalLLaMA

Una demo avvicina Qwen al prefill rapido con KV cache approssimata

Un thread su Reddit segnala una demo web che applica a Qwen una tecnica di approssimazione della KV cache simile a quella attribuita a 'V4.1 flash' per accelerare il prefill. Nessun benchmark pubblico, ma il prototipo riapre la discussione su come ri...

#Hardware #LLM On-Premise #DevOps
2026-09-11 ArXiv cs.CL

BabyLM 2026: il metodo che impara da 10 milioni di parole e cambia i vincoli

Qiushi Engine ha condotto un programma di ricerca autonomo su BabyLM 2026 Strict-Small, con 10 milioni di parole e 100 milioni di presentazioni cumulative. Tre fasi hanno unito avanzamento, scoperta di principi e miglioramento guidato. L'Overall sale...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic