Topic / Trend Rising

L'ascesa dei modelli linguistici piccoli e l'efficienza on-premise

Uno spostamento guidato dalla comunità verso modelli linguistici più piccoli e tecniche di quantization sta abilitando l'inference locale, riducendo i costi e preservando la sovranità dei dati. Strumenti come llama.cpp, la quantization statisticamente senza perdita e architetture compatte sono in primo piano.

Detected: 2026-07-29 · Updated: 2026-07-29

Articoli Correlati

2026-07-27 Tech.eu

Multiverse Computing cerca 570M per portare gli LLM sui dispositivi edge

La scaleup spagnola alza 570 milioni con una valutazione di 1,7 miliardi, puntando sulla tecnicia CompactifAI che riduce le dimensioni degli LLM fino al 95% senza perdita di accuratezza. La posta in gioco: spostare l'inference dai data center ai disp...

#Hardware #LLM On-Premise #DevOps
2026-07-26 LocalLLaMA

Cosa ci fate davvero con i piccoli LLM? Il segnale per l’on-premise

La domanda comparsa su Reddit – «Cosa ci fate con i modelli piccoli?» – svela un riassetto dell’infrastruttura AI lontano dai data center. AI-Radar analizza i quattro scenari d’uso reali, il ruolo decisivo della VRAM, del TCO e dei framework locali, ...

2026-07-22 LocalLLaMA

Solar-Open2: l'LLM MoE a 15B attivi che punta ai carichi agentivi on-premise

Upstage rilascia Solar-Open2-250B, un modello open-weight pensato per flussi agentivi con architettura MoE ibrida: 250 miliardi di parametri totali, ma solo 15 miliardi attivi per token. Attenzione lineare e rimozione del positional encoding permetto...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic