📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

Un post su Reddit, nella comunità LocalLLaMA, mette a confronto i modelli Deepseek e Gemma. La discussione verte sulle caratteristiche e le performance di questi modelli, con un focus sull'utilizzo in contesti locali. L'articolo originale include un'immagine, presumibilmente comparativa, dei due modelli.

2026-02-20 Fonte

La Electronic Frontier Foundation accetterà codice generato da LLM nei suoi progetti open source, ma insiste sulla documentazione e sui commenti scritti da umani. L'organizzazione sottolinea l'importanza della chiarezza e della comprensibilità del codice.

2026-02-20 Fonte

Un recente benchmark ha valutato le capacità di diversi modelli linguistici di grandi dimensioni (LLM) nel settore farmaceutico, concentrandosi sulla tendenza a generare allucinazioni. Sorprendentemente, Kimi K2.5 ha mostrato prestazioni superiori rispetto a Opus 4.6 in questo test specifico. Il dataset utilizzato è disponibile su Hugging Face, offrendo trasparenza e riproducibilità.

2026-02-20 Fonte

Microsoft ha rimosso un post del blog che suggeriva di utilizzare libri di Harry Potter scaricati illegalmente per addestrare modelli di intelligenza artificiale. La guida, scritta da un product manager senior, promuoveva una nuova funzionalità di Azure SQL DB, LangChain e LLM. La decisione è giunta in seguito alle critiche mosse su Hacker News.

2026-02-20 Fonte

Un utente ha segnalato su Reddit le ambizioni di Kimi nell'espansione della finestra di contesto. L'aumento della finestra di contesto è un tema caldo nello sviluppo di LLM, in quanto permette di elaborare prompt più lunghi e complessi, migliorando la qualità delle consegne e aprendo nuove possibilità applicative.

2026-02-20 Fonte

SanityBoard si aggiorna con nuovi risultati di benchmark per modelli come Qwen3.5 Plus, GLM 5 e Gemini 3.1 Pro, oltre a tre nuovi agenti open source per la generazione di codice. L'analisi evidenzia l'importanza dell'infrastruttura e delle caratteristiche dei modelli (iterazione) sulle performance.

2026-02-20 Fonte

È stato rilasciato Luma v2.9, un modello di linguaggio di piccole dimensioni (circa 10 milioni di parametri) basato su architettura transformer. La particolarità è che può essere addestrato con dati personalizzati ed eseguito interamente in locale, senza dipendenze cloud o telemetria. L'obiettivo è fornire un modello che possa essere specializzato per compiti specifici, anziché essere generalista.

2026-02-20 Fonte

Google e Apple stanno integrando funzionalità di intelligenza artificiale generativa focalizzate sulla musica nei loro prodotti. L'obiettivo è fornire agli utenti nuovi strumenti per la composizione e la produzione musicale, sfruttando le potenzialità dell'AI per semplificare e ampliare le possibilità creative.

2026-02-20 Fonte

Un nuovo studio presenta DemosQA, un dataset per il Question Answering in greco, creato a partire da domande degli utenti sui social media. La ricerca valuta 11 modelli linguistici, sia monolingui che multilingue, utilizzando diverse strategie di prompting, con l'obiettivo di colmare il divario esistente nella ricerca sugli LLM per lingue con meno risorse.

2026-02-20 Fonte

Un nuovo studio esplora l'uso di valutatori LLM guidati da riferimenti per migliorare l'allineamento dei modelli linguistici di grandi dimensioni (LLM) in ambiti non verificabili. I risultati mostrano che questo approccio può migliorare significativamente la precisione dei valutatori LLM e portare a guadagni nelle prestazioni rispetto all'addestramento diretto e all'auto-miglioramento senza riferimenti.

2026-02-20 Fonte

Un utente ha testato Qwen3 Coder Next 8FP convertendo la documentazione Flutter con un prompt di sole tre frasi e una finestra di contesto di 64K token. Il modello ha richiesto 102GB di RAM su 128GB disponibili, superando altri modelli OSS come GPT OSS 120B e GLM 4.7 Flash in questo specifico compito.

2026-02-20 Fonte

I sistemi di AI agent stanno diventando sempre più diffusi e potenti, ma manca un consenso su come dovrebbero operare. Una ricerca del MIT CSAIL evidenzia la necessità di standard e trasparenza per questi sistemi automatizzati.

2026-02-20 Fonte

Il nuovo modello Gemini Pro 3.1 di Google promette capacità avanzate per la gestione di carichi di lavoro complessi. Le prestazioni nei benchmark suggeriscono un significativo passo avanti nelle capacità dei LLM di Google.

2026-02-20 Fonte

Indiscrezioni suggeriscono che Google potrebbe rilasciare Gemini 3.1 prima di Gemma 4. La notizia, apparsa su Antigravity e rilanciata su Reddit, alimenta le speculazioni sulle prossime mosse di Google nel campo dei modelli linguistici di grandi dimensioni (LLM). Resta da vedere quali miglioramenti e nuove funzionalità saranno implementate in Gemini 3.1.

2026-02-20 Fonte

Uno studente universitario della Georgia ha citato in giudizio OpenAI, sostenendo che una versione obsoleta di ChatGPT lo avrebbe convinto di essere un oracolo, spingendolo in uno stato psicotico. Questa è l'undicesima causa contro OpenAI per presunti danni alla salute mentale causati dal chatbot.

2026-02-19 Fonte

GLM-5, un modello linguistico di grandi dimensioni (LLM), ha quasi completato un mese di test sulla piattaforma FoodTruck Bench, progettata per simulare scenari di business reali. Nonostante una buona capacità diagnostica e un utilizzo efficiente degli strumenti, il modello ha fallito a causa di costi del personale eccessivi, evidenziando le sfide nella gestione finanziaria.

2026-02-19 Fonte

Un post su Reddit suggerisce che Microsoft stia implementando misure più stringenti per prevenire risposte inattese o problematiche dai suoi modelli linguistici, probabilmente in risposta a precedenti incidenti. L'azienda sembra intenzionata a mantenere un controllo più rigoroso sul comportamento dei suoi LLM.

2026-02-19 Fonte

Un post su Reddit mette in discussione le reali capacità dei modelli AI open source eseguiti offline su hardware consumer. La discussione verte sull'effettiva utilità di tali implementazioni, sollevando interrogativi sulle aspettative degli utenti.

2026-02-19 Fonte

YouTube sta sperimentando l'integrazione di un'AI conversazionale direttamente nelle app per smart TV. Gli utenti potranno porre domande relative ai video visualizzati, interagendo con l'assistente tramite comandi vocali o testuali. L'obiettivo è migliorare l'esperienza utente e fornire informazioni contestuali in modo più intuitivo.

2026-02-19 Fonte

Google ha annunciato Gemini 3.1 Pro, descrivendolo come un passo avanti nelle capacità di ragionamento. Questo nuovo modello di intelligenza artificiale promette prestazioni migliorate in diversi ambiti, alimentando la competizione nel settore dei modelli linguistici di grandi dimensioni (LLM).

2026-02-19 Fonte