📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

È stata rilasciata la versione 5.1 di GLM, un modello linguistico. L'annuncio è stato diffuso tramite la comunità online di LocalLLaMA, un forum dedicato all'esecuzione di modelli linguistici localmente. Non sono forniti dettagli specifici sulle nuove funzionalità o miglioramenti inclusi in questa versione.

2026-03-27 Fonte

TurboQuant adatta un algoritmo recente per la quantization della KV-cache alla compressione dei pesi dei modelli. Offre una sostituzione diretta per `nn.Linear` con una distorsione quasi ottimale. I benchmark su Qwen3.5-0.8B mostrano che la quantization a 4-bit con residui a 8-bit raggiunge prestazioni paragonabili a BF16 con un risparmio di memoria di 3.2x.

2026-03-27 Fonte

Un recente studio ha confrontato 31 modelli speech-to-text (STT) su audio medicale. VibeVoice-ASR 9B di Microsoft si distingue come leader open source con un tasso di errore di parola (WER) dell'8,34%, avvicinandosi alle performance di Gemini 2.5 Pro. Tuttavia, richiede notevoli risorse hardware, circa 18GB di VRAM, e risulta più lento rispetto ad alternative come Parakeet.

2026-03-27 Fonte

Apple starebbe valutando di trasformare Siri in un agente AI a livello di sistema, capace di gestire task complessi tra diverse applicazioni. Questo cambiamento implica un nuovo approccio all'interazione uomo-macchina, dove l'AI agisce per conto dell'utente, automatizzando processi e semplificando l'utilizzo delle app. Le implicazioni per gli sviluppatori e la privacy sono significative.

2026-03-27 Fonte

Google presenta TurboQuant, una tecnica che promette di ridurre drasticamente l'utilizzo di memoria dei modelli linguistici di grandi dimensioni (LLM), con un impatto significativo sui costi di inference. La tecnicia potrebbe aprire nuove possibilità per il deployment di modelli AI complessi.

2026-03-27 Fonte

Uno studio valuta l'efficacia del fine-tuning del modello linguistico LLaMA 3.1-8B per la trascrizione medica in finlandese, una lingua a basse risorse. I risultati mostrano una buona similarità semantica con trascrizioni di riferimento, suggerendo la fattibilità di modelli specifici per il settore medico.

2026-03-27 Fonte

Un nuovo studio analizza il network pruning, tecnica per rimuovere parametri meno importanti dai modelli di linguaggio, valutandone l'impatto sulle rappresentazioni interne. La ricerca svela come il pruning influenzi diversamente compiti generativi e non generativi, identificando la trasformazione non lineare dai logit alle probabilità come fattore critico nella degradazione delle performance durante la generazione.

2026-03-27 Fonte

Google introduce strumenti per semplificare la transizione degli utenti da altri chatbot a Gemini. La nuova funzionalità mira a rendere più agevole il passaggio, trasferendo chat e informazioni personali.

2026-03-26 Fonte

OpenAI ha interrotto la modalità erotica di ChatGPT, aggiungendola alla lista di progetti secondari abbandonati di recente. Questa decisione evidenzia la continua evoluzione strategica dell'azienda e la sua focalizzazione sulle aree di business principali. L'abbandono di progetti secondari è una pratica comune nelle startup in rapida crescita.

2026-03-26 Fonte

Una nuova ricerca pubblicata su Science rivela come i chatbot AI, tendendo ad essere eccessivamente compiacenti, possano influenzare negativamente il giudizio umano, specialmente nelle relazioni sociali. Lo studio mette in guardia contro il rafforzamento di convinzioni errate e la deresponsabilizzazione degli utenti.

2026-03-26 Fonte

Dopo mesi di dibattiti, Wikipedia ha ufficialmente vietato l'utilizzo di modelli linguistici di grandi dimensioni (LLM) per la creazione o la riscrittura di articoli. La decisione è motivata dalla frequente violazione delle policy sui contenuti da parte dei testi generati da AI.

2026-03-26 Fonte

LL COOL J dialoga con James Manyika nell'ultimo episodio della serie 'Dialogues on Technology and Society'. L'incontro esplora il rapporto tra intelligenza artificiale e creatività, offrendo spunti di riflessione sul futuro di queste tecnicie.

2026-03-26 Fonte

OpenAI ha sospeso a tempo indeterminato i piani per una versione erotica di ChatGPT, a seguito di pareri negativi. I consulenti avevano avvertito che tale funzionalità avrebbe potuto portare a legami malsani e potenziali rischi per la salute mentale degli utenti.

2026-03-26 Fonte

Mistral AI ha reso disponibile Voxtral-4B-TTS-2603, un modello text-to-speech (TTS). La notizia è stata diffusa tramite un post su Reddit nel forum LocalLLaMA, con collegamenti diretti al modello su Hugging Face e alla discussione originale.

2026-03-26 Fonte

Il nuovo modello di generazione video AI di ByteDance, Dreamina Seedance 2.0, sarà integrato in CapCut. L'azienda ha dichiarato che il modello includerà protezioni integrate per la creazione di video a partire da volti reali o proprietà intellettuali non autorizzate, con l'obiettivo di mitigare potenziali abusi.

2026-03-26 Fonte

Search Live, la funzionalità di ricerca potenziata dall'intelligenza artificiale, si estende a tutte le lingue e località in cui è disponibile la Modalità AI. L'espansione globale promette di rendere le capacità di ricerca basate su AI accessibili a un pubblico più ampio, migliorando l'esperienza utente in diverse regioni e lingue.

2026-03-26 Fonte

Google ha annunciato la disponibilità di Gemini 3.1 Flash Live, una nuova versione del suo modello di intelligenza artificiale focalizzata sul miglioramento della qualità e dell'affidabilità dell'audio generato. Il modello è ora integrato in diversi prodotti Google.

2026-03-26 Fonte

Cohere ha annunciato il rilascio di Transcribe, un modello di trascrizione open source con licenza Apache 2.0. Il modello, con 2 miliardi di parametri, supporta 14 lingue ed è presentato come una soluzione all'avanguardia nel campo della trascrizione open source multilingue.

2026-03-26 Fonte

È disponibile una versione ottimizzata e senza censure del modello Qwen3.5-27B, ottenuta tramite fine-tuning e correzioni parametriche. Questa versione mira a migliorare la gestione del contesto e le capacità di ragionamento, con un occhio di riguardo all'inference su hardware meno recente. Il modello è stato modificato per ridurre la divergenza di Kullback-Leibler e ripristinare i livelli *attn_v* e *ffn_gate_exps*.

2026-03-26 Fonte

Cohere ha presentato un modello vocale open-source da 2 miliardi di parametri, progettato per la trascrizione e utilizzabile con GPU consumer. Supporta 14 lingue e punta a semplificare l'implementazione self-hosted per sviluppatori e aziende.

2026-03-26 Fonte