📁 Frameworks

La sezione Frameworks osserva il livello software che trasforma i modelli in sistemi operativi: orchestrazione, pipeline RAG, osservabilita, serving ed evaluation. Trovi aggiornamenti su LangChain, tooling vettoriale, runtime di inferenza e pattern di deployment realmente utili per iterare velocemente senza perdere stabilita. Gli articoli sono selezionati per aiutare scelte architetturali concrete, con collegamenti alla pillar frameworks, alla pillar LLM e ai trend.

Dopo sei mesi di sviluppo, EAGLE3 è stato integrato nel progetto llama.cpp, introducendo un'evoluzione nel campo dell'inference per Large Language Models. Questa implementazione migliora l'efficienza rispetto a metodi precedenti come MTP, consentendo al modello ausiliario di ricevere una guida più precisa dal modello principale. L'integrazione promette ottimizzazioni significative per i deployment on-premise, riducendo la latenza e aumentando il throughput su hardware consumer e server locali, rafforzando il controllo e la sovranità dei dati.

2026-06-12 Fonte

Un nuovo studio introduce MINARD, una pipeline innovativa per la generazione di video narrati e basati su regioni specifiche, partendo da figure scientifiche e dai relativi articoli. MINARD affronta la sfida di rendere più accessibili le complesse visualizzazioni scientifiche, producendo narrazioni fedeli al testo e allineate con gli elementi visivi. Il progetto include anche FigTalk, un nuovo benchmark per valutare l'efficacia di questi sistemi, dove MINARD ha dimostrato prestazioni superiori rispetto agli approcci esistenti.

2026-06-12 Fonte

Arbor è un framework multi-agente che rivoluziona l'ottimizzazione dell'Inference per i Large Language Models. Utilizzando una ricerca ad albero strutturata come strato cognitivo, il sistema coordina agenti specializzati per migliorare le performance. I test dimostrano un incremento fino al 193% nel throughput-latency rispetto a baseline ottimizzate dai vendor, offrendo una soluzione robusta e riproducibile per ambienti complessi, inclusi i deployment on-premise.

2026-06-12 Fonte

ToolSense è un nuovo framework diagnostico open source che valuta la reale comprensione degli LLM quando operano come agenti con cataloghi di strumenti. Contrariamente ai benchmark tradizionali, ToolSense genera test realistici, rivelando una "dissociazione conoscenza-recupero": modelli performanti nel recupero possono mancare di comprensione fattuale, con cali di performance fino al 64% su query ambigue. Questo evidenzia l'importanza di metriche di valutazione più accurate per i deployment di LLM in contesti enterprise.

2026-06-12 Fonte

Isomorphic Labs, spin-off di Google DeepMind, sta ridefinendo la scoperta di farmaci grazie al suo Isomorphic Drug Design Engine (IsoDDE). Il sistema, che ha già attratto 2,1 miliardi di dollari e partnership con Novartis ed Eli Lilly, va oltre la predizione della struttura proteica, identificando tasche di legame inedite e prevedendo interazioni molecolari complesse, aprendo nuove vie per lo sviluppo di terapie.

2026-06-11 Fonte

La GNOME Foundation ha lanciato a marzo un programma di fellowship per garantire la sostenibilità a lungo termine del suo ambiente desktop. L'iniziativa mira a supportare contributori indipendenti e membri della comunità per un periodo di dodici mesi. I primi beneficiari di questo programma sono stati ufficialmente annunciati, segnando un passo significativo per il futuro del progetto open source.

2026-06-11 Fonte

SemantiClean è un framework modulare che estrae segnali semantici strutturati dai dati di sessione e-commerce, focalizzandosi su auditabilità e riproducibilità. A differenza dei predittori end-to-end, privilegia la trasparenza a livello di elemento e percorsi decisionali difendibili, anche a costo di marginali guadagni predittivi. Integra un motore di inference basato su LLM per migliorare la comprensione del comportamento utente.

2026-06-11 Fonte

Un nuovo framework, PoQ-Judge, offre una metodologia leggera e senza riferimenti per valutare la qualità dell'inference nei Large Language Models (LLM) decentralizzati. Progettato per reti distribuite e sensibili ai costi, il sistema utilizza modelli “judge” dedicati per analizzare le risposte, raggiungendo un'elevata correlazione con i riferimenti ground-truth e riducendo i costi operativi. È particolarmente rilevante per deployment on-premise e ibridi, dove l'efficienza e la sovranità dei dati sono prioritarie.

2026-06-11 Fonte

Un recente studio ha esplorato l'integrazione dei kernel Helion in vLLM per l'inference FP8 dei modelli Qwen3, valutandone le performance su GPU NVIDIA H100 e B200. I risultati evidenziano miglioramenti significativi nel throughput per diverse operazioni non-GEMM e un flusso di lavoro PyTorch-native più produttivo per lo sviluppo di kernel GPU. L'analisi sottolinea il potenziale di Helion nell'ottimizzare i carichi di lavoro LLM, cruciale per i deployment on-premise.

2026-06-10 Fonte

AMD ha rilasciato una nuova versione del suo SDK Lemonade, una soluzione server per l'AI locale progettata per operare su CPU, GPU e NPU dell'azienda. La novità più significativa è l'introduzione del supporto per NVIDIA CUDA, estendendo la compatibilità del framework. Questo aggiornamento mira a offrire maggiore flessibilità agli sviluppatori e alle aziende che implementano carichi di lavoro AI on-premise, permettendo di sfruttare un ecosistema hardware più ampio e ottimizzare le risorse esistenti.

2026-06-10 Fonte

La Linux Foundation ha annunciato l'OpenSharing Project, una nuova iniziativa volta a standardizzare lo scambio di asset e dati nel campo dell'intelligenza artificiale. L'obiettivo è affrontare la frammentazione attuale, facilitando l'interoperabilità e la collaborazione tra le diverse piattaforme e soluzioni AI. Questo progetto mira a semplificare la gestione e il Deployment di modelli e dataset, con implicazioni significative per le aziende che adottano strategie self-hosted o ibride per i propri carichi di lavoro AI.

2026-06-10 Fonte

Decart ha presentato Oasis 3, un "world model" in tempo reale progettato per generare ambienti di guida fotorealistici. Questa soluzione, disponibile tramite API, mira a supportare lo sviluppo e il testing di veicoli autonomi, offrendo la capacità di simulare ore di scenari complessi, seppur con alcune avvertenze non specificate.

2026-06-10 Fonte

La ricerca introduce SynIB, un nuovo obiettivo di training per l'apprendimento multimodale. Mira a catturare la sinergia, ovvero le informazioni che emergono solo dall'uso congiunto di più modalità, non da singole fonti. A differenza degli approcci architetturali, SynIB modifica l'obiettivo di training, penalizzando la confidenza del modello quando una modalità viene mascherata. Questo forza il modello a basarsi su interazioni cross-modali. I test su benchmark reali mostrano miglioramenti fino al 7,8% nell'accuratezza per esempi dipendenti dalla sinergia.

2026-06-10 Fonte

Il concetto di Business World Model (BWM) emerge come un'architettura innovativa per sistemi aziendali autonomi. Ispirato ai "world models" dell'intelligenza artificiale, il BWM mira a codificare stati, dinamiche e obiettivi di business, consentendo agli agenti AI di simulare scenari, valutare trade-off e supportare decisioni strategiche. Questo approccio promette di trasformare la gestione aziendale, passando da un'esecuzione basata su istruzioni a una pianificazione guidata dagli obiettivi, con implicazioni significative per l'ottimizzazione dei processi e la sovranità dei dati.

2026-06-10 Fonte

SCAIL-2 è un modello open source che rivoluziona l'animazione di personaggi, consentendo un controllo end-to-end senza dipendere da rappresentazioni intermedie come mappe scheletriche. Basato su un training estensivo e un'interfaccia unificata, il modello offre capacità emergenti come la sostituzione di personaggi tra identità diverse e scenari di animazione animale, rappresentando un'alternativa flessibile per i professionisti che cercano soluzioni on-premise per carichi di lavoro AI.

2026-06-10 Fonte

Un nuovo benchmark, RL4F, è stato introdotto per standardizzare lo sviluppo di controller di plasma basati su Offline Reinforcement Learning (RL) per la fusione nucleare. Affrontando i costi e i rischi delle sperimentazioni online, RL4F sfrutta dati storici del Tokamak DIII-D. Le valutazioni hanno mostrato che i metodi di RL offline basati su modelli offrono le migliori performance medie, sebbene nessun approccio prevalga su tutti i compiti. Il progetto è open source per stimolare la ricerca.

2026-06-09 Fonte

PathoSage introduce un framework a tre stadi per la patologia computazionale, mirato a migliorare il ragionamento multimodale a livello di patch. Affronta le allucinazioni degli MLLM e i conflitti di evidenza nei sistemi agentici, separando recupero della conoscenza, raccolta e giudizio dell'evidenza. Il suo componente chiave, Structured Evidence Deliberation, valuta in modo indipendente le informazioni e analizza i conflitti, riducendo i bias. Il sistema include anche un meccanismo per modellare l'affidabilità degli strumenti.

2026-06-09 Fonte

Un recente aggiornamento per `ggml-webgpu` introduce significativi miglioramenti nelle velocità di prefill per i Large Language Models (LLM) quantizzati, in particolare i formati "k-quants". I test su Apple M2 Pro mostrano accelerazioni fino a 3.78x, rendendo l'inference locale più efficiente. Questi progressi sono cruciali per i deployment on-premise e edge, dove l'ottimizzazione delle risorse hardware e la sovranità dei dati sono prioritarie, riducendo il TCO e la dipendenza dal cloud.

2026-06-09 Fonte

Apple ha presentato CoreAI, un nuovo framework per l'inference di Large Language Models direttamente sui dispositivi con Apple Silicon. Progettato per superare le limitazioni di CoreML, CoreAI mira a ottimizzare le operazioni on-device, supportando modelli fino a 20 miliardi di parametri e rafforzando la capacità di elaborazione locale su iPhone e iPad. Questa mossa sottolinea l'impegno di Apple verso l'AI distribuita e il controllo dei dati.

2026-06-09 Fonte

OpenEnv, uno strumento per creare ambienti di esecuzione per agenti AI, annuncia una transizione verso un modello più aperto. Il progetto sarà ora coordinato da un comitato che include nomi di spicco come Meta-PyTorch, Nvidia e Hugging Face. Questa mossa mira a promuovere lo sviluppo open source di agenti intelligenti, con il supporto di numerose organizzazioni leader nell'ecosistema AI, sottolineando l'importanza di ambienti controllati per il training di sistemi autonomi.

2026-06-08 Fonte