Presentato GPT-5.3-Codex, un modello avanzato per la generazione di codice che combina le prestazioni di GPT-5.2-Codex con capacità di ragionamento e conoscenza professionale superiori. Il modello si posiziona come uno dei più avanzati nel suo genere.
Anthropic ha rilasciato la versione 4.6 di Opus, il suo modello linguistico di punta. Questa release punta ad ampliare la sua applicabilità a nuovi casi d'uso, in particolare quelli che coinvolgono team di agenti AI.
DeepBrainz ha rilasciato DeepBrainz-R1, una famiglia di modelli linguistici di dimensioni ridotte (4B, 2B, 0.6B) focalizzati sul ragionamento per workflow agentici. Ottimizzati per il ragionamento multi-step e la stabilità nel tool-calling, questi modelli Apache 2.0 mirano a fornire un comportamento prevedibile in configurazioni locali e con costi contenuti.
Meta sta sperimentando un'applicazione indipendente per 'Vibes', la sua piattaforma di video brevi generati tramite intelligenza artificiale. Lanciata a settembre, Vibes consente agli utenti di creare e condividere video AI e di accedere a un feed dedicato.
Trillion Labs e KAIST AI hanno presentato gWorld, un modello di mondo visuale open-weight per interfacce grafiche mobile. gWorld, disponibile nelle versioni 8B e 32B, genera codice web eseguibile anziché pixel, superando in accuratezza modelli più grandi come Llama 4. Questo approccio offre una migliore fedeltà visiva e precisione del testo rispetto ai modelli basati su pixel o solo testo.
Un grafico prodotto da METR, un'organizzazione no-profit di ricerca sull'IA, è diventato un punto di riferimento per valutare i progressi dei modelli linguistici di grandi dimensioni (LLM). Tuttavia, la sua interpretazione è spesso fonte di confusione. L'analisi si basa principalmente su compiti di programmazione e misura il tempo impiegato dagli umani per completare compiti che l'IA riesce a svolgere con successo, non la durata di autonomia dei modelli stessi. Nonostante le limitazioni, lo studio offre una metrica concreta per valutare l'evoluzione dell'IA.
I modelli linguistici di grandi dimensioni (LLM) sono esposti a minacce di sicurezza complesse, come le backdoor sleeper-agent. Questi attacchi, difficili da individuare, compromettono l'integrità e la sicurezza dei modelli, aprendo scenari da film di fantascienza.
Microsoft presenta Paza, un progetto per migliorare il riconoscimento vocale automatico (ASR) in lingue con poche risorse. Include PazaBench, una classifica ASR per 39 lingue africane, e modelli ASR Paza, ottimizzati su sei lingue keniote. L'iniziativa, nata dal progetto Gecko, mira a colmare il divario digitale e linguistico, sviluppando tecnicie vocali in collaborazione con le comunità locali e valutando le prestazioni in contesti reali.
Un nuovo studio esplora l'uso del Natural Language Processing (NLP), inclusi i Large Language Models (LLM), per classificare automaticamente i materiali didattici rispetto alle linee guida dei programmi di studio di informatica. L'obiettivo è accelerare e semplificare il processo di valutazione della copertura dei contenuti.
Un nuovo studio analizza le difficoltà nell'estrazione automatica di decisioni mediche da testi clinici, rivelando come le variazioni linguistiche tra diverse categorie di decisioni influenzino negativamente l'accuratezza dei modelli. L'analisi evidenzia la necessità di strategie di estrazione più robuste, capaci di gestire la diversità stilistica dei testi medici.
Un nuovo studio analizza l'impatto dell'addestramento con privacy differenziale (DP-SGD) su dati long-tailed, caratterizzati da una grande quantità di campioni rari. La ricerca evidenzia come DP-SGD possa portare a performance di generalizzazione subottimali, specialmente su queste tipologie di dati, e fornisce un framework teorico per comprendere questo fenomeno.
Un nuovo metodo, Iteratively Improved Program Construction (IIPC), migliora le capacità di ragionamento matematico dei modelli linguistici di grandi dimensioni (LLM). IIPC affina iterativamente le catene di ragionamento programmatico, combinando il feedback di esecuzione con le capacità di Chain-of-thought del modello base. Il codice è open source.
Google Research ha presentato una nuova tecnica, chiamata attenzione sequenziale, per rendere i modelli di intelligenza artificiale più leggeri e veloci senza compromettere l'accuratezza. L'innovazione promette di ridurre i costi computazionali e migliorare l'efficienza nell'inference.
Un utente ha espresso frustrazione per il modello Youtu-VL-4B di Tencent, pubblicizzato come soluzione all'avanguardia (SOTA) per diverse attività di visione artificiale. Nonostante le promesse, il codice rilasciato è risultato incompleto, con funzionalità chiave mancanti e nascoste in una lista di cose da fare su GitHub. La licenza d'uso esclude inoltre l'Unione Europea.
Una famiglia ha utilizzato ChatGPT per prepararsi a decisioni cruciali riguardanti il trattamento oncologico del figlio, affiancandolo al supporto di medici esperti. L'articolo esplora come i modelli linguistici possono integrare, ma non sostituire, il parere medico professionale in situazioni delicate.
Kimi K2.5 stabilisce un nuovo primato tra i modelli open-source sull'Epoch Capabilities Index (ECI), un indice che aggrega diversi benchmark. Con un punteggio di 147, si allinea a modelli come o3, Grok 4 e Sonnet 4.5, pur rimanendo indietro rispetto ai modelli più avanzati.
Un utente di Reddit ha segnalato performance eccellenti del modello Qwen3-Coder-Next-FP8. La discussione si concentra sulla sua capacità di generazione di codice, suggerendo un potenziale miglioramento rispetto ad alternative esistenti. L'articolo originale include un link a un'immagine che illustra i risultati ottenuti.
Un articolo esplora le implicazioni di Moltbook, un social network progettato esclusivamente per agenti AI. Solleva interrogativi sul comportamento autonomo dei sistemi di intelligenza artificiale e sulle potenziali conseguenze di interazioni non supervisionate tra macchine.
Il prompt di sistema di GPT-4o include ora istruzioni specifiche per gestire gli utenti contrari alla sua imminente dismissione, prevista per il 13 febbraio. Le istruzioni coprono anche casi limite come le "dyad pair" e le "gnosis revelation".
La startup Axiom ha annunciato che la sua intelligenza artificiale è riuscita a trovare soluzioni a problemi matematici irrisolti da tempo. Questo risultato dimostra i progressi compiuti dalle capacità di ragionamento delle AI, aprendo nuove prospettive nel campo della ricerca matematica e scientifica.