📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

CohereLabs ha reso disponibile su Hugging Face il modello Command-A-Plus-05-2026-bf16. Questo Large Language Model, ottimizzato in formato bf16, presenta considerazioni importanti per le aziende che valutano strategie di deployment on-premise. L'analisi si concentra sui requisiti hardware, la gestione dei costi operativi e le implicazioni per la sovranità dei dati, aspetti cruciali per i decision-maker tecnici.

2026-05-20 Fonte

La community tech attende con interesse i prossimi Large Language Models di Qwen, in particolare le versioni da 27B e 122B parametri. Questa anticipazione evidenzia la crescente domanda di soluzioni LLM self-hosted, ponendo l'accento sulle sfide infrastrutturali e sui vantaggi in termini di sovranità dei dati e TCO per le aziende che valutano il deployment on-premise.

2026-05-20 Fonte

ByteShape ha analizzato le quantizzazioni NTP e MTP del modello Qwen 3.6 35B GGUF su diverse configurazioni hardware, evidenziando trade-off cruciali per i deployment on-premise. I risultati suggeriscono che la quantization più grande che si adatta alla memoria è spesso la scelta migliore per NTP, mentre MTP offre un boost di velocità sulle GPU, ma con un maggiore consumo di VRAM, rendendolo meno adatto per sistemi con risorse limitate.

2026-05-20 Fonte

Figma lancia il proprio assistente AI integrato direttamente nella tela di progettazione collaborativa. Questo agente permette agli utenti di generare, modificare e iterare sui design tramite prompt in linguaggio naturale, consolidando l'impegno dell'azienda nell'intelligenza artificiale dopo acquisizioni e partnership strategiche con attori come Anthropic e OpenAI. La mossa evidenzia la crescente integrazione degli LLM nei workflow creativi.

2026-05-20 Fonte

Una recente ricerca evidenzia come LLM di punta come ChatGPT, Claude, Gemini e Grok non siano ancora in grado di fornire risposte affidabili su questioni elettorali cruciali, dalla procedura di voto alla verifica delle informazioni. Questo solleva interrogativi significativi sull'impiego di tali tecnicie in contesti sensibili e sull'importanza di strategie di deployment che garantiscano accuratezza e integrità dei dati.

2026-05-20 Fonte

HuggingFace ha implementato una nuova funzionalità nei suoi dataset di benchmark, consentendo agli utenti di filtrare i Large Language Models (LLM) in base alla loro dimensione. Questa aggiunta è particolarmente utile per identificare i modelli più performanti che rientrano in specifici vincoli di parametri, come quelli inferiori a 32 miliardi, facilitando la scelta per deployment on-premise con risorse hardware limitate e ottimizzando il Total Cost of Ownership (TCO).

2026-05-20 Fonte

Figma ha annunciato l'introduzione di un assistente basato sull'intelligenza artificiale per potenziare la sua tela collaborativa. La nuova funzionalità sarà inizialmente disponibile all'interno di Figma Design, promettendo di ottimizzare i flussi di lavoro e l'interazione degli utenti con gli strumenti di progettazione. Questa mossa riflette la crescente tendenza all'integrazione dell'AI nelle piattaforme professionali, mirando a migliorare l'efficienza e la creatività nel processo di sviluppo.

2026-05-20 Fonte

Un nuovo pull request su `llama.cpp` introduce il supporto sperimentale per Gemma 4 MTP, segnando un passo avanti per il deployment locale di Large Language Models. Sebbene il progetto sia ancora in fase di sviluppo e richieda la compilazione manuale, evidenzia l'impegno della community open source nell'ottimizzare gli LLM per l'esecuzione su infrastrutture self-hosted, offrendo maggiore controllo e sovranità dei dati agli utenti enterprise.

2026-05-20 Fonte

Google DeepMind ha presentato Gemini Omni Flash alla conferenza I/O 2026, il primo modello della nuova famiglia Omni. Questa soluzione multimodale è in grado di generare e modificare video partendo da una combinazione di input come immagini, audio, video e testo. Una funzionalità di editing vocale è stata momentaneamente sospesa, mentre la filigrana digitale SynthID è attiva per impostazione predefinita, garantendo la tracciabilità dei contenuti generati.

2026-05-20 Fonte

Artificial Analysis ha pubblicato le sue valutazioni per Qwen 3.7 Max, posizionandolo al quinto posto complessivo. Il modello si allinea con le performance di GPT 5.4 (xhigh) e supera Gemini 3.5 Flash. L'analisi evidenzia un divario di 6 punti rispetto a Qwen3.6 27B e genera aspettative per le future versioni 27B e 35B di Qwen3.7, cruciali per chi valuta deployment on-premise.

2026-05-20 Fonte

Un nuovo studio ha esaminato le prestazioni dei sistemi ASR commerciali in contesti di code-switching, dove gli utenti alternano lingue diverse nella stessa frase. La ricerca ha valutato cinque provider su quattro coppie linguistiche (arabo-inglese, persiano-inglese, tedesco-inglese) utilizzando un innovativo pipeline di preparazione dati basato su LLM, che ha ridotto i costi di scoring del 91%. ElevenLabs Scribe v2 ha mostrato le migliori performance complessive, evidenziando l'importanza di metriche specifiche per scenari multilingue complessi.

2026-05-20 Fonte

Una nuova ricerca introduce un framework di decoupling basato su B-spline per la compressione dei modelli Transformer. Questa metodologia, denominata R-CMTF-BSD, promette una riduzione significativa dei parametri mantenendo un'elevata accuratezza. Supera i limiti delle tecniche esistenti offrendo maggiore stabilità numerica ed espressività, un fattore cruciale per l'ottimizzazione dei carichi di lavoro AI, specialmente in contesti on-premise con risorse limitate.

2026-05-20 Fonte

Un nuovo studio propone lo sviluppo di "data probes," sequenze sintetiche generate sistematicamente, per comprendere a fondo come le caratteristiche dei dati influenzino le performance degli LLM. L'obiettivo è superare gli attuali approcci empirici, intensivi in termini di calcolo, offrendo un metodo più rigoroso per ottimizzare l'addestramento, il fine-tuning e l'inference dei modelli, con implicazioni dirette per la gestione dei costi e delle risorse nei deployment on-premise.

2026-05-20 Fonte

Andrej Karpathy, co-fondatore di OpenAI e figura di spicco nella ricerca AI, è entrato a far parte di Anthropic. Il suo ruolo sarà strategico nel team di pre-training, con l'obiettivo di accelerare lo sviluppo di Claude e mantenere l'azienda all'avanguardia nel settore dei Large Language Models. Questa mossa sottolinea l'intensa competizione per i talenti e le risorse necessarie per innovare nel campo degli LLM, un fattore cruciale per chi valuta le opzioni di deployment.

2026-05-19 Fonte

Tre dei cinque vincitori regionali del prestigioso Commonwealth Short Story Prize sono sotto accusa per aver presumibilmente utilizzato chatbot. Questo episodio evidenzia una crescente sfida: distinguere la creatività umana dalla generazione di contenuti tramite Large Language Models (LLM), sollevando interrogativi cruciali sulla governance e l'autenticità nell'era dell'intelligenza artificiale.

2026-05-19 Fonte

H2O.ai ha svelato tabH2O, un foundation model per dati tabulari che promette previsioni ad alta precisione tramite una singola chiamata API, eliminando la necessità di training. Annunciato al Dell Technologies World 2026, il modello mira a trasformare l'approccio aziendale all'AI predittiva, riducendo drasticamente i tempi di sviluppo e deployment.

2026-05-19 Fonte

Google ha annunciato importanti aggiornamenti per l'app Gemini durante la keynote di I/O 2026. La novità principale è "Daily Brief", una funzionalità che crea un riepilogo mattutino personalizzato. Integrando dati da email, calendario e liste di attività dell'utente, Daily Brief offre una panoramica prioritaria della giornata e suggerisce azioni concrete, andando oltre la semplice sintesi delle informazioni.

2026-05-19 Fonte

Google ha presentato Gemini Spark a I/O 2026, un assistente AI agentico sempre attivo basato su Gemini 3.5 e l'architettura Antigravity. Progettato per operare su macchine virtuali dedicate nel cloud e integrarsi nativamente con Gmail e Workspace, sarà disponibile per gli abbonati AI Ultra, offrendo un supporto proattivo e autonomo.

2026-05-19 Fonte

Un'analisi indipendente sui benchmark di quantization della KV cache per Large Language Models (LLM) rivela risultati cruciali per i deployment on-premise. I test, condotti su una singola RTX 3090 con 24 GB di VRAM, mettono in discussione l'efficacia di alcune tecniche come TurboQuant a 4 bit, evidenziando invece il potenziale di schemi come q5 e l'importanza della TCQ per compressioni aggressive. Si sottolinea la necessità di bilanciare la precisione del modello e della cache per ottimizzare l'utilizzo della VRAM.

2026-05-19 Fonte

Google ha annunciato un'espansione significativa per Gmail, integrando la ricerca vocale conversazionale direttamente nella posta in arrivo. Presentata a Google I/O 2026, questa funzionalità permette agli utenti di interagire con Gemini per recuperare rapidamente dettagli specifici e informazioni nascoste all'interno delle proprie email. L'innovazione mira a semplificare la gestione della corrispondenza, offrendo un'interfaccia più intuitiva e basata sul linguaggio naturale per l'accesso ai dati.

2026-05-19 Fonte