Topic / Trend Rising

Architetture LLM efficienti: più piccole, intelligenti e capaci

Innovazioni come Inkling-Small con una drastica riduzione dei parametri attivi, le strategie di risparmio dei token di CORVUS e la compressione orientata all'edge stanno rendendo l'AI potente più accessibile. Questi progressi architetturali riducono i costi computazionali e l'occupazione di memoria, ampliando le possibilità di deployment dai data center ai dispositivi periferici.

Detected: 2026-08-02 · Updated: 2026-08-02

Articoli Correlati

2026-07-30 LocalLLaMA

Inkling-Small: 1M token locali con 276B parametri, solo 12B attivi

Thinkingmachines ha rilasciato Inkling-Small, un LLM con 276 miliardi di parametri totali ma appena 12 miliardi attivi e una finestra di contesto di 1 milione di token. Grazie alla quantization NVFP4 e ai file GGUF di Unsloth, il modello si presta al...

#Hardware #LLM On-Premise #DevOps
2026-07-30 Microsoft Research

EvoLib: quando l'esperienza diventa conoscenza evolutiva per gli LLM

Microsoft Research presenta EvoLib, un framework che trasforma l'esperienza durante l'inference in conoscenza riutilizzabile, senza aggiornare il modello. L'analisi: implicazioni per il deployment on-premise e la sovranità dei dati.

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-30 LocalLLaMA

GLM 5.2 ora vede: Baseten aggiunge la visione con quantization NVFP4

Il provider di inference Baseten ha rilasciato pubblicamente GLM-5.2-Vision, una versione del modello GLM 5.2 arricchita con un encoder visivo tratto da Kimi k2.6 e quantizzata in formato NVFP4. La mossa colma una lacuna segnalata dalla community e a...

#Hardware #LLM On-Premise #DevOps
2026-07-29 ArXiv cs.AI

La memoria degli LLM: un pattern wiki per non dimenticare i vicoli ciechi

Un template riutilizzabile, chiamato llm-wiki-memory-template, permette agli agenti LLM di accumulare conoscenza in modo persistente, conservando deliberatamente anche i tentativi falliti. Tre casi di studio mostrano come questa architettura possa ri...

#Hardware #LLM On-Premise #DevOps
2026-07-28 ArXiv cs.LG

CORVUS: fino al 50% di token in meno per i coding agent LLM

CORVUS è una nuova architettura per le traiettorie degli agenti di coding basati su LLM che separa le azioni di lettura dei file dai loro snapshot, mantenendo un registro sincronizzato. In questo modo elimina copie ridondanti e dati obsoleti, riducen...

#Hardware #LLM On-Premise #DevOps
2026-07-27 Tech.eu

Multiverse Computing cerca 570M per portare gli LLM sui dispositivi edge

La scaleup spagnola alza 570 milioni con una valutazione di 1,7 miliardi, puntando sulla tecnicia CompactifAI che riduce le dimensioni degli LLM fino al 95% senza perdita di accuratezza. La posta in gioco: spostare l'inference dai data center ai disp...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic