📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

OpenAI ha pubblicato un'analisi tecnica dettagliata del funzionamento interno di Codex CLI, il suo agente AI per lo sviluppo di codice. La pubblicazione offre agli sviluppatori informazioni utili sugli strumenti di AI coding, capaci di scrivere codice, eseguire test e correggere bug con supervisione umana. L'articolo arriva in un momento in cui gli agenti AI stanno diventando strumenti pratici per il lavoro quotidiano.

2026-01-26 Fonte

Un ricercatore ha dimostrato come un singolo messaggio di posta elettronica, contenente un prompt injection mascherato, possa indurre un LLM locale (ClawdBot) a esfiltrare dati sensibili. L'attacco, che non sfrutta vulnerabilità software, evidenzia i rischi nell'utilizzo di agenti AI che elaborano contenuti non attendibili e hanno la capacità di eseguire azioni concrete.

2026-01-26 Fonte

Anthropic ha annunciato l'integrazione di app interattive all'interno dell'interfaccia del chatbot Claude. Tra le prime integrazioni, spicca quella con Slack e altri strumenti per la collaborazione aziendale, aprendo nuove possibilità di utilizzo del modello in ambienti professionali.

2026-01-26 Fonte

Una discussione su Reddit analizza le capacità del modello linguistico Qwen3-Max-Thinking, esplorandone le potenzialità e i limiti. La comunità di LocalLLaMA si interroga sulle performance e sulle possibili applicazioni del modello, con un focus sull'inference e l'ottimizzazione.

2026-01-26 Fonte

Il mese di febbraio si preannuncia ricco di novità nel panorama dell'intelligenza artificiale cinese. Oltre ai già annunciati Deepseek v4 e Kimi K3, anche Minimax starebbe per rilasciare il modello M2.2. Si vocifera inoltre di un modello proprietario in arrivo da ByteDance.

2026-01-26 Fonte

Un utente ha aperto una discussione su Reddit per confrontare tre modelli linguistici di grandi dimensioni (LLM) focalizzati sul coding: GLM 4.7 Flash, GPT OSS 120B e Qwen3 Coder 30B. Tutti e tre i modelli richiedono circa 60GB di spazio di archiviazione. L'obiettivo è raccogliere esperienze dirette sui pro e i contro di ciascun modello.

2026-01-26 Fonte

Presentato M3Kang, un nuovo dataset multilingue per valutare le capacità di ragionamento matematico multimodale dei modelli vision-language (VLM). Derivato dalla competizione Kangaroo Math, include problemi tradotti in 108 lingue, con benchmark su modelli open e closed source. I risultati mostrano difficoltà nel ragionamento matematico di base e basato su diagrammi.

2026-01-26 Fonte

Presentato ChiEngMixBench, un nuovo benchmark per valutare le capacità di code-mixing (cinese-inglese) dei modelli linguistici di grandi dimensioni (LLM) in contesti comunicativi reali. Il benchmark analizza la spontaneità e la naturalezza del linguaggio, rivelando strategie di allineamento cognitivo tra LLM e comunicazione umana.

2026-01-26 Fonte

ChatGPT sta integrando nei risultati di ricerca informazioni provenienti da Grokipedia, l'enciclopedia generata tramite intelligenza artificiale e sviluppata da xAI, la società di Elon Musk. Questo solleva interrogativi sulla provenienza e l'affidabilità delle fonti utilizzate dai modelli linguistici.

2026-01-25 Fonte

La startup Humans&, fondata da ex dipendenti di Anthropic, Meta, OpenAI, xAI e Google DeepMind, sta sviluppando modelli fondazionali di nuova generazione focalizzati sulla collaborazione, superando il tradizionale approccio basato sulla chat.

2026-01-25 Fonte

Una discussione su Reddit mette in evidenza i miglioramenti di velocità ottenuti con GLM-4.7-Flash, un modello linguistico di grandi dimensioni. I dettagli tecnici specifici e i risultati dei benchmark sono disponibili tramite un link a GitHub, offrendo agli sviluppatori informazioni utili per ottimizzare le prestazioni.

2026-01-25 Fonte

Un utente ha segnalato un calo di performance nel modello GLM-4.7-Flash all'aumentare della lunghezza del contesto. I benchmark mostrano una diminuzione dei token al secondo (t/s) passando da contesti brevi a contesti più estesi, suggerendo un possibile collo di bottiglia nell'elaborazione di sequenze lunghe. L'analisi è stata eseguita su un sistema dotato di GPU NVIDIA RTX 3090.

2026-01-25 Fonte

Indiscrezioni suggeriscono che Apple potrebbe presentare a febbraio la nuova versione del suo assistente vocale Siri, basata sull'intelligenza artificiale Gemini di Google. Questa mossa segnerebbe un punto di svolta per Siri, da tempo criticata per le sue limitate capacità rispetto alla concorrenza.

2026-01-25 Fonte

In Iran, un prolungato blackout di internet, iniziato oltre 400 ore fa a causa di proteste, ha portato a severe restrizioni sull'accesso online. Solo pochi siti, tra cui Google e ChatGPT, sono stati inseriti in whitelist. In questo scenario, i modelli linguistici locali (LLM) non censurati, come Gemma3 e Qwen3, offrono una valida alternativa per accedere alle informazioni.

2026-01-25 Fonte

Un utente di Reddit cerca consigli per strutturare una guida per sviluppatori, dai principianti ai veterani, interessati all'ingegneria assistita dall'intelligenza artificiale. L'obiettivo è creare un ambiente di apprendimento collaborativo e identificare strumenti utili per hackathon e progetti a lungo termine. Il repository GitHub di riferimento è dedicato all'ingegneria del software basata sull'IA.

2026-01-25 Fonte

Una nuova ottimizzazione per GLM 4.7 Flash riduce l'utilizzo di VRAM della cache KV. La modifica, che consiste nella rimozione di 'Air', permette di gestire contesti molto più lunghi con la stessa configurazione hardware, risparmiando gigabyte di memoria video.

2026-01-25 Fonte

Un ricercatore ha rilasciato in open source il progetto Self-Organizing State Model (SOSM), un'architettura di modello linguistico che esplora alternative all'attenzione dei Transformer standard. SOSM utilizza routing basato su grafi, separa la rappresentazione semantica dall'apprendimento temporale e introduce un meccanismo gerarchico di attribuzione per una migliore interpretabilità.

2026-01-25 Fonte

ChatGPT è stato scoperto mentre cita Grokipedia nelle sue risposte, innescando un potenziale loop ricorsivo. Questo comportamento rischia di diffondere informazioni errate o allucinate, sollevando preoccupazioni sulla qualità e l'affidabilità delle risposte fornite dal modello linguistico.

2026-01-25 Fonte

Gli sviluppatori di Zerotap, un'app Android che permette all'AI di interagire con il telefono come farebbe un umano, chiedono feedback agli utenti. L'app supporta Ollama e modelli come OpenAI e Gemini. Tra le funzionalità in cantiere: connessione a servizi esterni, ricerca avanzata, gestione delle immagini e modelli on-device. Gli sviluppatori si interrogano sull'uso di Ollama: tramite rete locale o connessione internet?

2026-01-25 Fonte