Mistral AI ha rilasciato Voxtral TTS, un modello text-to-speech da 3 miliardi di parametri con pesi aperti. L'azienda afferma che supera ElevenLabs Flash v2.5 nei test di preferenza umana. Il modello richiede circa 3 GB di RAM, raggiunge un time-to-first-audio di 90 millisecondi e supporta nove lingue.
Mistral AI ha rilasciato un nuovo modello open-source per la generazione di sintesi vocale. La particolarità di questo modello è la sua capacità di operare su dispositivi con risorse limitate, come smartwatch e smartphone, aprendo nuove prospettive per applicazioni vocali a basso consumo.
NVIDIA ha rilasciato gpt-oss-puzzle-88B, un modello linguistico di grandi dimensioni (LLM) derivato da gpt-oss-120b di OpenAI. Ottimizzato tramite Puzzle, un framework di ricerca di architetture neurali post-training (NAS), il modello promette un'efficienza di inference significativamente migliorata, specialmente su hardware NVIDIA H100, mantenendo o migliorando l'accuratezza.
Un utente del forum LocalLLaMA esprime entusiasmo per TurboQuant e chiede aggiornamenti sulla sua disponibilità. TurboQuant promette di migliorare l'efficienza dei modelli linguistici di grandi dimensioni (LLM) eseguiti in locale, aprendo nuove possibilità per l'inference su hardware consumer.
MediaTek sta lavorando per migliorare le capacità dell'intelligenza artificiale nel riconoscimento e nella generazione della lingua taiwanese, affrontando al contempo le complessità linguistiche e le problematiche legate alla sicurezza dei dati. L'iniziativa mira a preservare e promuovere la lingua locale attraverso l'innovazione tecnicica.
I modelli di linguaggio a diffusione mascherata (MDLM) mostrano delle limitazioni in termini di efficienza computazionale e flessibilità. I modelli DID (Deletion-Insertion Diffusion) superano queste limitazioni formulando l'eliminazione e l'inserimento di token come processi di diffusione discreti, migliorando l'efficienza e la flessibilità, supportando nativamente sequenze di lunghezza variabile e meccanismi di auto-correzione.
Un nuovo studio propone un framework di test adattivo computerizzato (CAT) per valutare in modo efficiente le capacità di modelli linguistici di grandi dimensioni (LLM) in ambito medico. Il metodo, basato sulla teoria della risposta agli item (IRT), riduce drasticamente i costi e i tempi di valutazione, mantenendo un'elevata accuratezza.
Un nuovo studio propone un metodo di valutazione per LLM che va oltre la semplice accuratezza. L'approccio combina regole simboliche con l'interpretabilità meccanicistica per identificare se un modello generalizza veramente o sfrutta scorciatoie, rivelando debolezze nascoste nei modelli.
Un nuovo studio su arXiv introduce i PLDR-LLM, modelli linguistici pre-addestrati in condizioni di criticità auto-organizzata. La ricerca suggerisce che questi modelli esibiscono capacità di ragionamento durante l'inference, con un comportamento simile alle transizioni di fase del secondo ordine. La capacità di ragionamento sembra quantificabile dai parametri globali del modello, senza necessità di benchmark esterni.
ARC-AGI-3 è un nuovo benchmark per confrontare l'efficienza con cui gli esseri umani e i sistemi di intelligenza artificiale acquisiscono nuove competenze. L'obiettivo è valutare quanto i modelli AI si avvicinino alla capacità umana di costruire modelli mentali, testare ipotesi e migliorare rapidamente, un'abilità in cui attualmente l'AI mostra ancora significative lacune.
I video generati dall'AI che mostrano frutta antropomorfa sono diventati virali, ma dietro l'apparente innocenza si nascondono spesso contenuti misogini e inquietanti. Un'analisi rivela un lato oscuro in queste micro-produzioni.
Un recente post di Google afferma una compressione della cache KV di 6x senza perdita di accuratezza e un aumento della velocità di attenzione fino a 8x sulle GPU H100, presentato all'ICLR 2026. La comunità si interroga sull'implementazione pratica e sui guadagni reali al di fuori dei benchmark di laboratorio.
Google ha annunciato Lyria 3 Pro, un modello AI evoluto per la creazione di musica. Questo strumento genera brani più lunghi e personalizzabili, integrandosi con Gemini e altre piattaforme aziendali. L'iniziativa espande le capacità musicali basate sull'intelligenza artificiale in diversi servizi Google.
Google introduce Lyria 3, l'ultima versione del suo modello di intelligenza artificiale per la generazione di musica. Il modello è disponibile in anteprima a pagamento tramite la Gemini API e per test in Google AI Studio, aprendo nuove possibilità per la creazione musicale assistita dall'AI.
Google porta Lyria 3, il suo modello di generazione musicale, direttamente negli strumenti di lavoro dei professionisti. L'obiettivo è semplificare e velocizzare il processo creativo, offrendo nuove possibilità per la composizione musicale all'interno dell'ecosistema Google.
Lo scorso settembre, OpenAI ha rilasciato una demo di Sora 2, generando un ampio dibattito sulle sue capacità di generazione video. Nonostante la demo non sia più disponibile, il lavoro di sviluppo sul modello continua internamente.
Google presenta TurboQuant, una tecnica per comprimere le cache KV dei modelli linguistici di grandi dimensioni (LLM) fino a 3 bit, ottenendo un incremento di performance fino a 8 volte su GPU Nvidia H100 senza perdita di accuratezza. Riduce i requisiti di memoria di almeno sei volte.
Un dipendente di DeepSeek ha anticipato l'arrivo di un nuovo modello linguistico di grandi dimensioni (LLM) che supererebbe le prestazioni dell'attuale DeepSeek V3.2. L'annuncio, poi rimosso, ha generato grande interesse nella comunità open source focalizzata su LLM.
Google Research presenta TurboQuant, un nuovo algoritmo di compressione per LLM che promette una riduzione di almeno 6 volte della memoria della cache chiave-valore e un aumento di velocità fino a 8 volte, senza sacrificare l'accuratezza. L'innovazione punta a ridefinire l'efficienza nell'ambito dell'intelligenza artificiale.
RWS ha presentato Language Weaver Pro, un nuovo modello di traduzione linguistica. Secondo l'azienda, il modello supera DeepL e Gemini in 31 delle 32 lingue testate internamente. Language Weaver Pro è integrato nel portafoglio Trados.