📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

La scaleup spagnola alza 570 milioni con una valutazione di 1,7 miliardi, puntando sulla tecnicia CompactifAI che riduce le dimensioni degli LLM fino al 95% senza perdita di accuratezza. La posta in gioco: spostare l'inference dai data center ai dispositivi periferici, con implicazioni per costi, consumi e sovranità dei dati.

2026-07-27 Fonte

Ricercatori scoprono che i modelli linguistici multimodali comprendono contenuti indipendentemente dallo stile visivo, ma le loro difese crollano se esposti a specifiche soluzioni grafiche. Il nuovo approccio ASO automatizza la creazione di immagini avversarie ottimizzando lo stile, facendo impennare il tasso di successo degli attacchi. Il dato è un campanello d’allarme per chi gestisce deployment on-premise.

2026-07-27 Fonte

Il diciassettenne Owen Song rilascia Inflect v2: due modelli TTS completi da 4 e 9 milioni di parametri, sotto 38 MB, che operano su CPU senza API cloud. Micro e Nano offrono voce maschile fissa in inglese, niente clonazione. La vera notizia è la corsa all'ultra-efficienza che abilita l'inference locale anche su hardware modesto, ridisegnando il perimetro della sovranità dei dati nella sintesi vocale.

2026-07-25 Fonte

Swiss-AI rilascia Apertus 1.5, una famiglia di LLM da 8B e 70B parametri completamente aperta: pesi, dati di training e procedure sono pubblici. Multimodale (immagini, audio, testo), contesto fino a 262.144 token e una modalità di ragionamento migliorata. L’approccio massimamente trasparente e il rispetto del consenso dei dati lo rendono un punto di svolta per il deployment on-premise in contesti regolamentati.

2026-07-24 Fonte

Una nuova tecnica sfrutta l'architettura Mixture of Experts per identificare e correggere le allucinazioni nei LLM durante l'inference, senza dover alterare il modello. Lo studio rivela che negli strati più alti dei MoE, diversi gruppi di esperti si attivano in modo opposto su risposte fattuali e inventate, aprendo la strada a una decodifica contrastiva che calibra l'output con un overhead computazionale gestibile.

2026-07-24 Fonte

Uno studio su DeepSeek e Qwen QwQ estrae la teoria implicita di qualità letteraria dei modelli: contano struttura e voce, non il lessico. Accuratezza del 79,3% nella classificazione, con potenziali distorsioni da riconoscimento della fonte. Per i carichi di valutazione testuale in locale, la sensibilità strutturale e i trade-off di quantization diventano nodi centrali.

2026-07-24 Fonte

Uno studio rivela che i watermark su LLM usati in medicina causano allucinazioni, corruzione lessicale ed errori diagnostici. I benchmark standard non rilevano questi guasti, creando un falso senso di sicurezza. Il problema è centrale per chi gestisce modelli on-premise in sanità, dove la sovranità dei dati e l'affidabilità clinica non sono negoziabili.

2026-07-24 Fonte

Un post su Reddit riassume con ironia la distillazione dei modelli linguistici per i decisori politici. Dietro la battuta, c'è una tecnicia chiave per comprimere i modelli, ridurre i costi hardware e abilitare l'uso on-premise. Capirla è fondamentale per regolamentare senza soffocare chi punta a mantenere il controllo dei propri dati.

2026-07-23 Fonte

Funzionari statunitensi invocano presunte prestazioni superiori dei modelli distillati per giustificare norme anticonsumo. Ma la tecnica non può produrre un modello migliore dell'insegnante. Analizziamo perché questa narrazione distorce il dibattito e penalizza chi investe in AI on-premise.

2026-07-23 Fonte

Uno studio formale dimostra che i Transformer puri, limitati alla classe TC⁰, non possono apprendere la generalizzazione strutturale, completa per NC¹. I sistemi neuro-simbolici aggirano l’ostacolo incorporando il componente semantico, ma i benchmark non distinguono capacità appresa da innata. Per chi sviluppa LLM on-premise, il messaggio è netto: certi ragionamenti richiedono architetture ibride.

2026-07-23 Fonte

I guardrail attuali valutano ogni scambio in isolamento, ma i rischi emergono nell’arco di conversazioni multi-turno. Un nuovo framework traccia la deriva semantica e l’accumulo di informazioni sensibili, con implicazioni dirette per il deployment on-premise e la sovranità dei dati.

2026-07-23 Fonte

Un esperimento con involuzioni e cicli mostra che i transformer possono selezionare la classe di ipotesi corretta con precisione quasi ottimale. Ma il ragionamento aritmetico crolla quando i simboli perdono identità stabile, rivelando un confine netto tra pattern matching e vera comprensione algoritmica. Le sonde sui modelli più grandi confermano un divario di calibrazione di circa 55 volte.

2026-07-23 Fonte

Microsoft Research rilascia Fara1.5-27B, un agente multimodale che vede il browser solo via screenshot e agisce con click, scroll e digitazione. Addestrato su dati sintetici da un pipeline multi-agente, solleva questioni su sicurezza, on-premise e TCO.

2026-07-22 Fonte

Upstage rilascia Solar-Open2-250B, un modello open-weight pensato per flussi agentivi con architettura MoE ibrida: 250 miliardi di parametri totali, ma solo 15 miliardi attivi per token. Attenzione lineare e rimozione del positional encoding permettono una finestra di contesto di 1 milione di token, mantenendo bassi i requisiti di memoria KV. La novità tecnica più rilevante per chi cerca deployment on-premise efficiente.

2026-07-22 Fonte

Il team Unsloth annuncia su Reddit la disponibilità di varie quantization per Laguna S 2.1. Il processo di compressione riduce il fabbisogno di VRAM e facilita l’esecuzione in locale, accelerando l’adozione di LLM self-hosted per esigenze di sovranità dei dati e controllo dei costi.

2026-07-22 Fonte