📁 Frameworks

La sezione Frameworks osserva il livello software che trasforma i modelli in sistemi operativi: orchestrazione, pipeline RAG, osservabilita, serving ed evaluation. Trovi aggiornamenti su LangChain, tooling vettoriale, runtime di inferenza e pattern di deployment realmente utili per iterare velocemente senza perdere stabilita. Gli articoli sono selezionati per aiutare scelte architetturali concrete, con collegamenti alla pillar frameworks, alla pillar LLM e ai trend.

Il driver open-source ANV per le GPU Intel su Linux abilita per impostazione predefinita l’estensione VK_EXT_descriptor_heap, dopo quasi due mesi di test. Migliora l’efficienza di binding dei descrittori e riduce il carico sulla CPU, con benefici trasversali anche per i carichi computazionali. Un tassello importante per chi spinge inference on-premise su Intel Arc o grafica integrata, dove ogni guadagno di efficienza pesa sul costo totale di possesso.

2026-06-26 Fonte

Un team di ricerca ha sviluppato una rete convoluzionale guidata dalla fisica che prevede l'evoluzione della separazione di fase in miscele binarie. Il modello surrogato resta stabile su lunghi orizzonti temporali e rispetta le leggi di crescita dei domini. Una dimostrazione di come il deep learning possa sostituire costosi solutori numerici, aprendo scenari di deployment on-premise che preservano la riservatezza dei dati e riducono la dipendenza dal cloud.

2026-06-26 Fonte

Il progetto audio.cpp porta l’inference di modelli audio su un runtime C++ nativo basato su ggml, unificando TTS, voice cloning, ASR e conversion in un unico stack. I benchmark su CUDA mostrano PocketTTS generare quasi 6 minuti di audio in soli 7,3 secondi, con un’accelerazione fino a 5 volte rispetto a Python. Un passo verso deployment self-hosted più efficienti e prevedibili.

2026-06-26 Fonte

Un documento interno rivela un balzo nell’adozione degli agenti di coding dal 40% al 98%. L’azienda descrive un cambio radicale nel modo di lavorare, ma mancano dati indipendenti e dettagli tecnici su infrastruttura e costi. Per chi valuta strumenti simili on-premise, la trasparenza è ancora lontana.

2026-06-25 Fonte

Un nuovo sottosistema open source separa il runtime dai kernel hardware-specifici, consentendo a modelli come GPT-OSS 120B di girare su AMD e NVIDIA con la stessa API pubblica. Le prestazioni su MI355X mostrano guadagni fino a 3.6x rispetto a Triton, senza sacrificare la portabilità. Per chi ospita modelli on-premise, l'architettura a plugin disaccoppia l’ottimizzazione hardware dalla logica di serving: un tassello per la sovranità multi-fornitore.

2026-06-25 Fonte

AMD ha contribuito un backend ONNX Runtime per il filtro DNN di FFmpeg, consentendo di eseguire modelli AI direttamente su GPU e NPU per compiti come upscaling e object detection. L’integrazione rafforza le opzioni di inference locale, riducendo la dipendenza dal cloud e migliorando la sovranità dei dati per le pipeline video.

2026-06-25 Fonte

Pubblicato su arXiv e con codice su GitHub, Gefen è un ottimizzatore drop-in per AdamW che promette un footprint di memoria ridotto fino a 8 volte. Se confermato, cambierebbe le carte in tavola per il training on-premise di LLM, dove ogni gigabyte di VRAM è prezioso e la riduzione dell'occupazione degli stati dell'ottimizzatore può allargare l'accesso a modelli complessi senza investimenti hardware aggiuntivi.

2026-06-24 Fonte

Il runtime Deno introduce comandi per compilare applicazioni desktop con tecnicia web, usando il WebView nativo per ridurre le dimensioni dei binari fino a circa 68 MB. L’alternativa Chromium Embedded Framework supera i 300 MB. La scelta incide su costi e controllo, ma deve affrontare problemi di coerenza di rendering e il rischio di disperdere risorse rispetto al consolidamento del core runtime.

2026-06-24 Fonte

La startup deep tech tedesca Wakeline ha raccolto 2,1 milioni di euro in un round pre-seed per sviluppare sistemi di intelligenza artificiale capaci di apprendere in modo continuo durante l’uso reale. L’architettura, indipendente dai modelli proprietari e dai cloud iperscalabili, punta alla sovranità tecnicica e apre interrogativi interessanti per chi considera deployment on-premise.

2026-06-24 Fonte

Un Flatpak dell’editor GIMP 0.54, pubblicato per la prima volta nel 1996, consente di eseguirlo su distribuzioni Linux x86-64 e Wayland senza installare dipendenze trentennali. Un’operazione di archeologia software che mette in luce il potere dei container per domare l’entropia delle librerie legacy, rilevante per chi gestisce applicazioni aziendali vetuste in ambienti self-hosted.

2026-06-23 Fonte

A pochi giorni dal debutto della versione 6.7, il team KDE rilascia un primo aggiornamento correttivo. Una prassi consolidata che conferma l'attenzione per la stabilità del desktop, cruciale anche per chi lavora su infrastrutture locali e ambienti di sviluppo.

2026-06-23 Fonte