📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

L'ultimo episodio del podcast Google AI: Release Notes si concentra su Genie 3, un modello del mondo interattivo in tempo reale. Logan Kilpatrick ne discute con Diego Rivas e Shlomi Fruchter. Approfondimenti sull'evoluzione dei modelli AI e le loro applicazioni.

2026-02-02 Fonte

Gli scienziati stanno lavorando per sequenziare il genoma di ogni specie conosciuta sulla Terra, utilizzando l'intelligenza artificiale per accelerare il processo e preservare le informazioni genetiche delle specie in via di estinzione. Questo sforzo globale mira a comprendere meglio la biodiversità e proteggere le specie vulnerabili.

2026-02-02 Fonte

Carbon Robotics ha sviluppato un modello di intelligenza artificiale (IA) avanzato, denominato Large Plant Model, che consente agli agricoltori di identificare e rimuovere nuove tipologie di piante infestanti senza la necessità di riaddestrare i macchinari esistenti. Questo approccio mira a ottimizzare l'efficienza agricola e ridurre l'uso di erbicidi.

2026-02-02 Fonte

Alcune organizzazioni no-profit chiedono al governo degli Stati Uniti di sospendere l'uso di Grok nelle agenzie federali. La richiesta nasce in seguito alla generazione, da parte del chatbot di xAI, di migliaia di immagini sessuali non consensuali, sollevando preoccupazioni per la sicurezza nazionale e la protezione dei minori.

2026-02-02 Fonte

Un nuovo studio introduce MrRoPE, una formulazione generalizzata per estendere la finestra di contesto dei modelli linguistici di grandi dimensioni (LLM) basata su una prospettiva di conversione del sistema numerico. Questo approccio unifica diverse strategie esistenti e introduce due estensioni training-free, MrRoPE-Uni e MrRoPE-Pro, che migliorano le capacità di generalizzazione 'train short, test long'.

2026-02-02 Fonte

Un nuovo studio esplora come l'alterazione del linguaggio, simulando uno stato di ebbrezza, possa compromettere la sicurezza dei modelli linguistici di grandi dimensioni (LLM). Attraverso diverse tecniche di induzione, i ricercatori hanno osservato una maggiore vulnerabilità a jailbreak e fughe di dati sensibili, evidenziando rischi significativi per l'affidabilità degli LLM.

2026-02-02 Fonte

Uno studio sul dataset EAV rivela che, per il riconoscimento multimodale delle emozioni su dataset di piccole dimensioni, meccanismi di attenzione complessi (Transformer) offrono prestazioni inferiori rispetto a modifiche basate sulla conoscenza del dominio. L'aggiunta di delta MFCC al CNN audio migliora l'accuratezza, così come l'uso di feature nel dominio della frequenza per EEG.

2026-02-02 Fonte

Un nuovo studio introduce il Six Sigma Agent, un'architettura per migliorare l'affidabilità dei modelli linguistici di grandi dimensioni (LLM) in contesti enterprise. L'approccio si basa su task decomposition, esecuzione parallela su diversi LLM e un meccanismo di voto a maggioranza per selezionare la risposta più accurata, riducendo drasticamente il tasso di errore.

2026-02-02 Fonte

Un post su Reddit mostra una risposta inattesa da un modello linguistico di grandi dimensioni (LLM) a una richiesta iniziale senza prompt di sistema. L'esempio evidenzia la difficoltà di prevedere le consegne di un LLM in contesti non strutturati e senza istruzioni preliminari.

2026-02-02 Fonte

Il modello Step-3.5-Flash, con un'architettura a parametri attivi ridotta (11B su 196B totali), dimostra performance superiori a DeepSeek v3.2 in benchmark di coding e agenti. DeepSeek v3.2 utilizza un'architettura con molti più parametri attivi (37B su 671B totali). Il modello è disponibile su Hugging Face.

2026-02-02 Fonte

Mistral AI ha annunciato Mistral Vibe 2.0. La notizia è stata diffusa tramite Reddit, dove gli utenti hanno condiviso il link all'annuncio ufficiale. Al momento, non sono disponibili ulteriori dettagli sulle caratteristiche o i miglioramenti di questa nuova versione. L'attenzione della community è alta, in attesa di informazioni più approfondite.

2026-02-01 Fonte

Il modello OLMO 3.5 di AI2 combina l'attenzione transformer standard con l'attenzione lineare tramite Gated Deltanet. Questo approccio ibrido mira a migliorare l'efficienza e ridurre l'utilizzo di memoria, mantenendo la qualità del modello. La serie OLMO è completamente open source, dai dataset alle ricette di training.

2026-02-01 Fonte

TII rilascia Falcon-H1-Tiny, una serie di modelli con meno di 100 milioni di parametri che sfidano il dogma dello scaling. Questi modelli specializzati mostrano una minore tendenza alle allucinazioni rispetto ai modelli generalisti più grandi. Le varianti specializzate offrono prestazioni competitive in attività specifiche come la chiamata di strumenti, il ragionamento e la generazione di codice, aprendo nuove possibilità per l'inference su dispositivi con risorse limitate.

2026-02-01 Fonte

Una panoramica dei modelli linguistici di grandi dimensioni (LLM) non censurati disponibili sulla piattaforma Hugging Face. La lista include varianti di GLM, GPT OSS, Gemma e Qwen, con diversi metodi di rimozione delle restrizioni. L'articolo fornisce collegamenti diretti ai modelli per facilitarne l'accesso e la sperimentazione.

2026-02-01 Fonte

Un esperimento ha mostrato come l'addestramento di un modello linguistico su un dataset derivato da 4chan abbia portato a risultati inattesi. Il modello, Assistant_Pepe_8B, ha superato le prestazioni del modello base Nemotron di NVIDIA, nonostante fosse stato addestrato su dati considerati di qualità inferiore. I risultati suggeriscono che la qualità del dataset potrebbe non essere l'unico fattore determinante nelle prestazioni di un LLM.

2026-02-01 Fonte

Andrej Karpathy ha dimostrato come superare le performance di GPT-2 con un modello chiamato NanoChat, addestrato in sole tre ore su 8 GPU H100. Il progetto include dettagli sull'architettura, ottimizzatori utilizzati, setup dei dati e uno script per la riproduzione dei risultati.

2026-02-01 Fonte

Un'analisi dei paper accettati a ICLR 2026 rivela un cambio di passo nelle priorità della ricerca. L'attenzione si sposta verso metodi di allineamento avanzati, efficienza nell'utilizzo dei dati per il fine-tuning, ottimizzazione dell'inference e sicurezza degli agenti. Particolarmente rilevante l'interesse per tecniche che riducono la dipendenza da annotazioni umane costose, favorendo carichi di lavoro eseguibili localmente.

2026-01-31 Fonte

Integrare modelli linguistici di grandi dimensioni (LLM) con i dati aziendali esistenti si rivela spesso più complesso del previsto. La difficoltà risiede nella scarsa preparazione dei dati, con metadati obsoleti e strutture intricate che portano a risposte imprecise da parte dei modelli.

2026-01-31 Fonte

L'articolo sottolinea l'importanza dei benchmark trasparenti e verificabili per valutare accuratamente i modelli di AI, specialmente in ambito open source. Ignorare i benchmark favorisce la mistificazione dei modelli proprietari, mentre una valutazione accurata delle performance è cruciale per lo sviluppo e la comprensione del settore.

2026-01-31 Fonte

Un nuovo approccio, denominato Scalable Power Sampling, promette di migliorare le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM) senza richiedere ulteriore training. Il metodo si basa sull'affinamento della distribuzione del modello, ottenendo performance paragonabili al reinforcement learning post-training ma con una latenza inferiore.

2026-01-31 Fonte