📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

Mistral AI ha rilasciato Voxtral TTS, un modello text-to-speech da 3 miliardi di parametri con pesi aperti. L'azienda afferma che supera ElevenLabs Flash v2.5 nei test di preferenza umana. Il modello richiede circa 3 GB di RAM, raggiunge un time-to-first-audio di 90 millisecondi e supporta nove lingue.

2026-03-26 Fonte

Mistral AI ha rilasciato un nuovo modello open-source per la generazione di sintesi vocale. La particolarità di questo modello è la sua capacità di operare su dispositivi con risorse limitate, come smartwatch e smartphone, aprendo nuove prospettive per applicazioni vocali a basso consumo.

2026-03-26 Fonte

NVIDIA ha rilasciato gpt-oss-puzzle-88B, un modello linguistico di grandi dimensioni (LLM) derivato da gpt-oss-120b di OpenAI. Ottimizzato tramite Puzzle, un framework di ricerca di architetture neurali post-training (NAS), il modello promette un'efficienza di inference significativamente migliorata, specialmente su hardware NVIDIA H100, mantenendo o migliorando l'accuratezza.

2026-03-26 Fonte

Un utente del forum LocalLLaMA esprime entusiasmo per TurboQuant e chiede aggiornamenti sulla sua disponibilità. TurboQuant promette di migliorare l'efficienza dei modelli linguistici di grandi dimensioni (LLM) eseguiti in locale, aprendo nuove possibilità per l'inference su hardware consumer.

2026-03-26 Fonte

MediaTek sta lavorando per migliorare le capacità dell'intelligenza artificiale nel riconoscimento e nella generazione della lingua taiwanese, affrontando al contempo le complessità linguistiche e le problematiche legate alla sicurezza dei dati. L'iniziativa mira a preservare e promuovere la lingua locale attraverso l'innovazione tecnicica.

2026-03-26 Fonte

I modelli di linguaggio a diffusione mascherata (MDLM) mostrano delle limitazioni in termini di efficienza computazionale e flessibilità. I modelli DID (Deletion-Insertion Diffusion) superano queste limitazioni formulando l'eliminazione e l'inserimento di token come processi di diffusione discreti, migliorando l'efficienza e la flessibilità, supportando nativamente sequenze di lunghezza variabile e meccanismi di auto-correzione.

2026-03-26 Fonte

Un nuovo studio propone un framework di test adattivo computerizzato (CAT) per valutare in modo efficiente le capacità di modelli linguistici di grandi dimensioni (LLM) in ambito medico. Il metodo, basato sulla teoria della risposta agli item (IRT), riduce drasticamente i costi e i tempi di valutazione, mantenendo un'elevata accuratezza.

2026-03-26 Fonte

Un nuovo studio su arXiv introduce i PLDR-LLM, modelli linguistici pre-addestrati in condizioni di criticità auto-organizzata. La ricerca suggerisce che questi modelli esibiscono capacità di ragionamento durante l'inference, con un comportamento simile alle transizioni di fase del secondo ordine. La capacità di ragionamento sembra quantificabile dai parametri globali del modello, senza necessità di benchmark esterni.

2026-03-26 Fonte

ARC-AGI-3 è un nuovo benchmark per confrontare l'efficienza con cui gli esseri umani e i sistemi di intelligenza artificiale acquisiscono nuove competenze. L'obiettivo è valutare quanto i modelli AI si avvicinino alla capacità umana di costruire modelli mentali, testare ipotesi e migliorare rapidamente, un'abilità in cui attualmente l'AI mostra ancora significative lacune.

2026-03-25 Fonte

Un recente post di Google afferma una compressione della cache KV di 6x senza perdita di accuratezza e un aumento della velocità di attenzione fino a 8x sulle GPU H100, presentato all'ICLR 2026. La comunità si interroga sull'implementazione pratica e sui guadagni reali al di fuori dei benchmark di laboratorio.

2026-03-25 Fonte

Google ha annunciato Lyria 3 Pro, un modello AI evoluto per la creazione di musica. Questo strumento genera brani più lunghi e personalizzabili, integrandosi con Gemini e altre piattaforme aziendali. L'iniziativa espande le capacità musicali basate sull'intelligenza artificiale in diversi servizi Google.

2026-03-25 Fonte

Google introduce Lyria 3, l'ultima versione del suo modello di intelligenza artificiale per la generazione di musica. Il modello è disponibile in anteprima a pagamento tramite la Gemini API e per test in Google AI Studio, aprendo nuove possibilità per la creazione musicale assistita dall'AI.

2026-03-25 Fonte

Google porta Lyria 3, il suo modello di generazione musicale, direttamente negli strumenti di lavoro dei professionisti. L'obiettivo è semplificare e velocizzare il processo creativo, offrendo nuove possibilità per la composizione musicale all'interno dell'ecosistema Google.

2026-03-25 Fonte

Lo scorso settembre, OpenAI ha rilasciato una demo di Sora 2, generando un ampio dibattito sulle sue capacità di generazione video. Nonostante la demo non sia più disponibile, il lavoro di sviluppo sul modello continua internamente.

2026-03-25 Fonte

Google presenta TurboQuant, una tecnica per comprimere le cache KV dei modelli linguistici di grandi dimensioni (LLM) fino a 3 bit, ottenendo un incremento di performance fino a 8 volte su GPU Nvidia H100 senza perdita di accuratezza. Riduce i requisiti di memoria di almeno sei volte.

2026-03-25 Fonte

Un dipendente di DeepSeek ha anticipato l'arrivo di un nuovo modello linguistico di grandi dimensioni (LLM) che supererebbe le prestazioni dell'attuale DeepSeek V3.2. L'annuncio, poi rimosso, ha generato grande interesse nella comunità open source focalizzata su LLM.

2026-03-25 Fonte

Google Research presenta TurboQuant, un nuovo algoritmo di compressione per LLM che promette una riduzione di almeno 6 volte della memoria della cache chiave-valore e un aumento di velocità fino a 8 volte, senza sacrificare l'accuratezza. L'innovazione punta a ridefinire l'efficienza nell'ambito dell'intelligenza artificiale.

2026-03-25 Fonte

RWS ha presentato Language Weaver Pro, un nuovo modello di traduzione linguistica. Secondo l'azienda, il modello supera DeepL e Gemini in 31 delle 32 lingue testate internamente. Language Weaver Pro è integrato nel portafoglio Trados.

2026-03-25 Fonte