OpenAI ha pubblicato un'analisi tecnica dettagliata del funzionamento interno di Codex CLI, il suo agente AI per lo sviluppo di codice. La pubblicazione offre agli sviluppatori informazioni utili sugli strumenti di AI coding, capaci di scrivere codice, eseguire test e correggere bug con supervisione umana. L'articolo arriva in un momento in cui gli agenti AI stanno diventando strumenti pratici per il lavoro quotidiano.
Un ricercatore ha dimostrato come un singolo messaggio di posta elettronica, contenente un prompt injection mascherato, possa indurre un LLM locale (ClawdBot) a esfiltrare dati sensibili. L'attacco, che non sfrutta vulnerabilità software, evidenzia i rischi nell'utilizzo di agenti AI che elaborano contenuti non attendibili e hanno la capacità di eseguire azioni concrete.
Anthropic ha annunciato l'integrazione di app interattive all'interno dell'interfaccia del chatbot Claude. Tra le prime integrazioni, spicca quella con Slack e altri strumenti per la collaborazione aziendale, aprendo nuove possibilità di utilizzo del modello in ambienti professionali.
Una discussione su Reddit analizza le capacità del modello linguistico Qwen3-Max-Thinking, esplorandone le potenzialità e i limiti. La comunità di LocalLLaMA si interroga sulle performance e sulle possibili applicazioni del modello, con un focus sull'inference e l'ottimizzazione.
Nvidia ha annunciato tre nuovi strumenti basati su intelligenza artificiale per la modellazione meteorologica. L'obiettivo è migliorare l'accuratezza delle previsioni e renderle disponibili a un pubblico più ampio di utenti, aprendo nuove prospettive nel settore.
Il mese di febbraio si preannuncia ricco di novità nel panorama dell'intelligenza artificiale cinese. Oltre ai già annunciati Deepseek v4 e Kimi K3, anche Minimax starebbe per rilasciare il modello M2.2. Si vocifera inoltre di un modello proprietario in arrivo da ByteDance.
Un utente ha aperto una discussione su Reddit per confrontare tre modelli linguistici di grandi dimensioni (LLM) focalizzati sul coding: GLM 4.7 Flash, GPT OSS 120B e Qwen3 Coder 30B. Tutti e tre i modelli richiedono circa 60GB di spazio di archiviazione. L'obiettivo è raccogliere esperienze dirette sui pro e i contro di ciascun modello.
Presentato M3Kang, un nuovo dataset multilingue per valutare le capacità di ragionamento matematico multimodale dei modelli vision-language (VLM). Derivato dalla competizione Kangaroo Math, include problemi tradotti in 108 lingue, con benchmark su modelli open e closed source. I risultati mostrano difficoltà nel ragionamento matematico di base e basato su diagrammi.
Presentato ChiEngMixBench, un nuovo benchmark per valutare le capacità di code-mixing (cinese-inglese) dei modelli linguistici di grandi dimensioni (LLM) in contesti comunicativi reali. Il benchmark analizza la spontaneità e la naturalezza del linguaggio, rivelando strategie di allineamento cognitivo tra LLM e comunicazione umana.
ChatGPT sta integrando nei risultati di ricerca informazioni provenienti da Grokipedia, l'enciclopedia generata tramite intelligenza artificiale e sviluppata da xAI, la società di Elon Musk. Questo solleva interrogativi sulla provenienza e l'affidabilità delle fonti utilizzate dai modelli linguistici.
La startup Humans&, fondata da ex dipendenti di Anthropic, Meta, OpenAI, xAI e Google DeepMind, sta sviluppando modelli fondazionali di nuova generazione focalizzati sulla collaborazione, superando il tradizionale approccio basato sulla chat.
Una discussione su Reddit mette in evidenza i miglioramenti di velocità ottenuti con GLM-4.7-Flash, un modello linguistico di grandi dimensioni. I dettagli tecnici specifici e i risultati dei benchmark sono disponibili tramite un link a GitHub, offrendo agli sviluppatori informazioni utili per ottimizzare le prestazioni.
Un utente ha segnalato un calo di performance nel modello GLM-4.7-Flash all'aumentare della lunghezza del contesto. I benchmark mostrano una diminuzione dei token al secondo (t/s) passando da contesti brevi a contesti più estesi, suggerendo un possibile collo di bottiglia nell'elaborazione di sequenze lunghe. L'analisi è stata eseguita su un sistema dotato di GPU NVIDIA RTX 3090.
Indiscrezioni suggeriscono che Apple potrebbe presentare a febbraio la nuova versione del suo assistente vocale Siri, basata sull'intelligenza artificiale Gemini di Google. Questa mossa segnerebbe un punto di svolta per Siri, da tempo criticata per le sue limitate capacità rispetto alla concorrenza.
In Iran, un prolungato blackout di internet, iniziato oltre 400 ore fa a causa di proteste, ha portato a severe restrizioni sull'accesso online. Solo pochi siti, tra cui Google e ChatGPT, sono stati inseriti in whitelist. In questo scenario, i modelli linguistici locali (LLM) non censurati, come Gemma3 e Qwen3, offrono una valida alternativa per accedere alle informazioni.
Un utente di Reddit cerca consigli per strutturare una guida per sviluppatori, dai principianti ai veterani, interessati all'ingegneria assistita dall'intelligenza artificiale. L'obiettivo è creare un ambiente di apprendimento collaborativo e identificare strumenti utili per hackathon e progetti a lungo termine. Il repository GitHub di riferimento è dedicato all'ingegneria del software basata sull'IA.
Una nuova ottimizzazione per GLM 4.7 Flash riduce l'utilizzo di VRAM della cache KV. La modifica, che consiste nella rimozione di 'Air', permette di gestire contesti molto più lunghi con la stessa configurazione hardware, risparmiando gigabyte di memoria video.
Un ricercatore ha rilasciato in open source il progetto Self-Organizing State Model (SOSM), un'architettura di modello linguistico che esplora alternative all'attenzione dei Transformer standard. SOSM utilizza routing basato su grafi, separa la rappresentazione semantica dall'apprendimento temporale e introduce un meccanismo gerarchico di attribuzione per una migliore interpretabilità.
ChatGPT è stato scoperto mentre cita Grokipedia nelle sue risposte, innescando un potenziale loop ricorsivo. Questo comportamento rischia di diffondere informazioni errate o allucinate, sollevando preoccupazioni sulla qualità e l'affidabilità delle risposte fornite dal modello linguistico.
Gli sviluppatori di Zerotap, un'app Android che permette all'AI di interagire con il telefono come farebbe un umano, chiedono feedback agli utenti. L'app supporta Ollama e modelli come OpenAI e Gemini. Tra le funzionalità in cantiere: connessione a servizi esterni, ricerca avanzata, gestione delle immagini e modelli on-device. Gli sviluppatori si interrogano sull'uso di Ollama: tramite rete locale o connessione internet?