Topic / Trend Rising

Ottimizzazione efficiente di training e inference dei LLM

Nuove architetture, percorsi di quantization, routing MoE e strumenti di training locale stanno riducendo costi e requisiti hardware per eseguire LLM. I progetti mostrano che modelli piccoli o ottimizzati possono eguagliare modelli più grandi su hardware accessibile.

Detected: 2026-08-16 · Updated: 2026-08-16

Articoli Correlati

2026-08-15 Phoronix

Lemonade 11.6: il segnale è nel runtime, non nel modello

AMD aggiorna Lemonade SDK con Muse-Glimmer 30B e modulo sperimentale ROCm per generazione immagini. Più che una novità di benchmark, è un segnale per chi valuta LLM locali: il valore si sposta su ottimizzazione di CPU, GPU e NPU, prevedibilità dei co...

2026-08-11 LocalLLaMA

Unsloth Desktop porta il training in locale: 2× più veloce, 70% VRAM in meno

Unsloth Desktop è la prima applicazione open source per eseguire e addestrare LLM in locale. Supporta Windows, macOS e Linux, con accelerazione su NVIDIA, AMD, Intel e Mac. Promette training 2× più veloce e riduce la VRAM del 70%. Integra ricerca pri...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 Phoronix

FastFlowLM 1.0: AMD unifica l’AI su NPU sotto l’ombrello ROCm

FastFlowLM 1.0, il software open-source per eseguire modelli linguistici e multimodali sulle NPU dei processori Ryzen AI, entra ufficialmente nell’ecosistema ROCm. La mossa segnala l’intenzione di AMD di offrire uno stack unificato per l’inference lo...

#Hardware #LLM On-Premise #DevOps
2026-08-11 LocalLLaMA

Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile

Un progetto personale mostra come addestrare da zero un modello linguistico da 1,1 miliardi di parametri su 20 miliardi di token con una spesa totale di circa 200 dollari. Il modello, poi ottimizzato con LoRA e quantizzato, gira su CPU e persino su u...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 ArXiv cs.CL

TEXAS usa il routing nativo dei MoE per un fine-tuning più chirurgico

Un nuovo approccio chiamato TEXAS sfrutta il modo in cui i modelli a mistura di esperti attivano i sotto-modelli per guidare l'addestramento, concentrando la supervisione solo sui token rilevanti. Per chi gestisce LLM in locale, questo significa adat...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-09 LocalLLaMA

BDH: scalabilità GPT-2 su GPU normali, la sfida post-transformer di Pathway

Pathway presenta BDH, un'architettura post-transformer che eguaglia le prestazioni di GPT-2 da 10 milioni a 1 miliardo di parametri, addestrandosi su hardware comune. Un promettente segnale per chi punta a self-hosted LLM senza vincoli hardware estre...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-09 LocalLLaMA

DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare `--enforce-eager` per abilitare i cudagraph e attivare la decodifica speculativa MTP con un token — fanno balz...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic