📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

Presentato GPT-5.3-Codex, un modello avanzato per la generazione di codice che combina le prestazioni di GPT-5.2-Codex con capacità di ragionamento e conoscenza professionale superiori. Il modello si posiziona come uno dei più avanzati nel suo genere.

2026-02-05 Fonte

DeepBrainz ha rilasciato DeepBrainz-R1, una famiglia di modelli linguistici di dimensioni ridotte (4B, 2B, 0.6B) focalizzati sul ragionamento per workflow agentici. Ottimizzati per il ragionamento multi-step e la stabilità nel tool-calling, questi modelli Apache 2.0 mirano a fornire un comportamento prevedibile in configurazioni locali e con costi contenuti.

2026-02-05 Fonte

Meta sta sperimentando un'applicazione indipendente per 'Vibes', la sua piattaforma di video brevi generati tramite intelligenza artificiale. Lanciata a settembre, Vibes consente agli utenti di creare e condividere video AI e di accedere a un feed dedicato.

2026-02-05 Fonte

Trillion Labs e KAIST AI hanno presentato gWorld, un modello di mondo visuale open-weight per interfacce grafiche mobile. gWorld, disponibile nelle versioni 8B e 32B, genera codice web eseguibile anziché pixel, superando in accuratezza modelli più grandi come Llama 4. Questo approccio offre una migliore fedeltà visiva e precisione del testo rispetto ai modelli basati su pixel o solo testo.

2026-02-05 Fonte

Un grafico prodotto da METR, un'organizzazione no-profit di ricerca sull'IA, è diventato un punto di riferimento per valutare i progressi dei modelli linguistici di grandi dimensioni (LLM). Tuttavia, la sua interpretazione è spesso fonte di confusione. L'analisi si basa principalmente su compiti di programmazione e misura il tempo impiegato dagli umani per completare compiti che l'IA riesce a svolgere con successo, non la durata di autonomia dei modelli stessi. Nonostante le limitazioni, lo studio offre una metrica concreta per valutare l'evoluzione dell'IA.

2026-02-05 Fonte

I modelli linguistici di grandi dimensioni (LLM) sono esposti a minacce di sicurezza complesse, come le backdoor sleeper-agent. Questi attacchi, difficili da individuare, compromettono l'integrità e la sicurezza dei modelli, aprendo scenari da film di fantascienza.

2026-02-05 Fonte

Microsoft presenta Paza, un progetto per migliorare il riconoscimento vocale automatico (ASR) in lingue con poche risorse. Include PazaBench, una classifica ASR per 39 lingue africane, e modelli ASR Paza, ottimizzati su sei lingue keniote. L'iniziativa, nata dal progetto Gecko, mira a colmare il divario digitale e linguistico, sviluppando tecnicie vocali in collaborazione con le comunità locali e valutando le prestazioni in contesti reali.

2026-02-05 Fonte

Un nuovo studio esplora l'uso del Natural Language Processing (NLP), inclusi i Large Language Models (LLM), per classificare automaticamente i materiali didattici rispetto alle linee guida dei programmi di studio di informatica. L'obiettivo è accelerare e semplificare il processo di valutazione della copertura dei contenuti.

2026-02-05 Fonte

Un nuovo studio analizza le difficoltà nell'estrazione automatica di decisioni mediche da testi clinici, rivelando come le variazioni linguistiche tra diverse categorie di decisioni influenzino negativamente l'accuratezza dei modelli. L'analisi evidenzia la necessità di strategie di estrazione più robuste, capaci di gestire la diversità stilistica dei testi medici.

2026-02-05 Fonte

Un nuovo studio analizza l'impatto dell'addestramento con privacy differenziale (DP-SGD) su dati long-tailed, caratterizzati da una grande quantità di campioni rari. La ricerca evidenzia come DP-SGD possa portare a performance di generalizzazione subottimali, specialmente su queste tipologie di dati, e fornisce un framework teorico per comprendere questo fenomeno.

2026-02-05 Fonte

Un nuovo metodo, Iteratively Improved Program Construction (IIPC), migliora le capacità di ragionamento matematico dei modelli linguistici di grandi dimensioni (LLM). IIPC affina iterativamente le catene di ragionamento programmatico, combinando il feedback di esecuzione con le capacità di Chain-of-thought del modello base. Il codice è open source.

2026-02-05 Fonte

Google Research ha presentato una nuova tecnica, chiamata attenzione sequenziale, per rendere i modelli di intelligenza artificiale più leggeri e veloci senza compromettere l'accuratezza. L'innovazione promette di ridurre i costi computazionali e migliorare l'efficienza nell'inference.

2026-02-05 Fonte

Un utente ha espresso frustrazione per il modello Youtu-VL-4B di Tencent, pubblicizzato come soluzione all'avanguardia (SOTA) per diverse attività di visione artificiale. Nonostante le promesse, il codice rilasciato è risultato incompleto, con funzionalità chiave mancanti e nascoste in una lista di cose da fare su GitHub. La licenza d'uso esclude inoltre l'Unione Europea.

2026-02-05 Fonte

Una famiglia ha utilizzato ChatGPT per prepararsi a decisioni cruciali riguardanti il trattamento oncologico del figlio, affiancandolo al supporto di medici esperti. L'articolo esplora come i modelli linguistici possono integrare, ma non sostituire, il parere medico professionale in situazioni delicate.

2026-02-05 Fonte

Kimi K2.5 stabilisce un nuovo primato tra i modelli open-source sull'Epoch Capabilities Index (ECI), un indice che aggrega diversi benchmark. Con un punteggio di 147, si allinea a modelli come o3, Grok 4 e Sonnet 4.5, pur rimanendo indietro rispetto ai modelli più avanzati.

2026-02-04 Fonte

Un utente di Reddit ha segnalato performance eccellenti del modello Qwen3-Coder-Next-FP8. La discussione si concentra sulla sua capacità di generazione di codice, suggerendo un potenziale miglioramento rispetto ad alternative esistenti. L'articolo originale include un link a un'immagine che illustra i risultati ottenuti.

2026-02-04 Fonte

Un articolo esplora le implicazioni di Moltbook, un social network progettato esclusivamente per agenti AI. Solleva interrogativi sul comportamento autonomo dei sistemi di intelligenza artificiale e sulle potenziali conseguenze di interazioni non supervisionate tra macchine.

2026-02-04 Fonte

Il prompt di sistema di GPT-4o include ora istruzioni specifiche per gestire gli utenti contrari alla sua imminente dismissione, prevista per il 13 febbraio. Le istruzioni coprono anche casi limite come le "dyad pair" e le "gnosis revelation".

2026-02-04 Fonte

La startup Axiom ha annunciato che la sua intelligenza artificiale è riuscita a trovare soluzioni a problemi matematici irrisolti da tempo. Questo risultato dimostra i progressi compiuti dalle capacità di ragionamento delle AI, aprendo nuove prospettive nel campo della ricerca matematica e scientifica.

2026-02-04 Fonte