Topic / Trend Rising

Inference efficiente, agenti e modelli compatti

Nuovi framework, kernel e varianti di modelli riducono il consumo di token, la comunicazione oppure estendono il contesto per abbattere i costi di inference. Modelli aperti compatti e risultati di efficienza dati rafforzano l'attenzione a TCO e distribuzione pratica.

Detected: 2026-09-12 · Updated: 2026-09-12

Articoli Correlati

2026-09-11 LocalLLaMA

Una demo avvicina Qwen al prefill rapido con KV cache approssimata

Un thread su Reddit segnala una demo web che applica a Qwen una tecnica di approssimazione della KV cache simile a quella attribuita a 'V4.1 flash' per accelerare il prefill. Nessun benchmark pubblico, ma il prototipo riapre la discussione su come ri...

#Hardware #LLM On-Premise #DevOps
2026-09-11 ArXiv cs.CL

BabyLM 2026: il metodo che impara da 10 milioni di parole e cambia i vincoli

Qiushi Engine ha condotto un programma di ricerca autonomo su BabyLM 2026 Strict-Small, con 10 milioni di parole e 100 milioni di presentazioni cumulative. Tre fasi hanno unito avanzamento, scoperta di principi e miglioramento guidato. L'Overall sale...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-10 DigiTimes

Token in calo: per d-Matrix l’economia delle GPU è sotto pressione

d-Matrix ha presentato al SEMICON Taiwan 2026 un modello di costo per l’inference. Il punto: se i prezzi dei token scendono mentre i costi di ammortamento, energia e banda di memoria delle GPU restano rigidi, i margini per chi vende capacità di calco...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-10 LocalLLaMA

Nvidia rilascia SoL-Pi: agenti Pi più efficienti senza patch al framework

Nvidia ha rilasciato SoL-Pi, estensione standalone per il framework Pi. Introduce quattro meccanismi opt-in, disabilitati per default, nati da cicli di auto-research: riducono turni ripetuti, replay del contesto, osservazioni sovradimensionate e lett...

#Hardware #LLM On-Premise
2026-09-07 LocalLLaMA

MiniCPM5-2B: OpenBMB guida i modelli open weights sotto i 4B

OpenBMB ha pubblicato MiniCPM5-2B, un modello open weights da 2 miliardi di parametri che ottiene 15 sull'Artificial Analysis Intelligence Index v4.2, il punteggio più alto tra i modelli aperti fino a 4B. Il risultato interessa chi valuta deployment ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-06 LocalLLaMA

Spark-X2.5 in GGUF: llama.cpp apre la strada ai modelli compatti da 1M token

Una pull request su llama.cpp introduce il supporto per Spark-X2.5, due LLM compatti da 4B e 1.7B parametri, con contesto nativo fino a 1M token e architettura ibrida a finestra scorrevole. La mossa abbassa la soglia per l'inference locale e self-hos...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-06 LocalLLaMA

TrueForge usa il 63% di token in meno dei managed agent a parità di task

Un benchmark su 14 task cross-system e tre server MCP mostra che TrueForge con Opus 4.8 risolve 11/14 task come Claude Managed Agents, ma consuma il 63% di token in meno e costa il 30% in meno per run. Con GLM-5.2 il costo scende a 3 dollari. Restano...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic