Il framework open-source Chainlit presenta due vulnerabilità che potrebbero compromettere seriamente gli ambienti cloud aziendali. Secondo Zafran, le falle sono facilmente sfruttabili e potrebbero portare alla perdita di dati o al controllo completo dei sistemi. Si raccomanda di aggiornare Chainlit all'ultima versione il prima possibile per mitigare i rischi.
Il supporto ufficiale per GLM 4.7 Flash è stato integrato in llama.cpp. Questa integrazione, segnalata su Reddit, permette agli sviluppatori di sfruttare al meglio le capacità di GLM 4.7 Flash all'interno dell'ambiente llama.cpp, aprendo nuove possibilità per l'inferenza e altre applicazioni di modelli linguistici.
La libreria llama.cpp ha integrato la Messages API di Anthropic, aprendo nuove possibilità per l'interazione con i modelli linguistici. Questa integrazione, annunciata su Reddit e Hugging Face, permette agli sviluppatori di sfruttare al meglio le capacità di llama.cpp per applicazioni avanzate di intelligenza artificiale generativa.
Intel ha rilasciato un aggiornamento per LLM Scaler Omni, focalizzato sulla generazione di immagini, audio e video tramite Omni Studio e Omni Serving. Questa release segue l'aggiornamento della scorsa settimana di Intel LLM-Scaler-vLLM, progettato per migliorare l'utilizzo di vLLM sulle schede grafiche Intel Arc, offrendo nuove opportunità per gli sviluppatori nel campo dell'intelligenza artificiale generativa.
Una serie di patch proposte per il kernel Linux introduce un tool di generazione SPDX SBOM. L'obiettivo è aumentare la trasparenza dei componenti software, migliorare la gestione delle vulnerabilità, garantire la conformità delle licenze e proteggere la supply chain del software.
Un nuovo studio introduce UOWQ, un framework teorico per il transfer learning multi-source. UOWQ ottimizza congiuntamente i pesi delle sorgenti e le quantità di trasferimento, affrontando il problema del trasferimento negativo. L'analisi dimostra che l'uso di tutti i campioni sorgente è ottimale con pesi adeguati e fornisce soluzioni per determinare i pesi ottimali. Gli esperimenti su benchmark reali confermano l'efficacia del framework.
È stato presentato cuda-nn, un motore di inferenza MoE (Mixture of Experts) sviluppato in Rust, Go e CUDA. Questo progetto open source si distingue per la sua capacità di gestire modelli con 6,9 miliardi di parametri senza l'ausilio di PyTorch, grazie a kernel CUDA ottimizzati e sviluppati manualmente. Supporta architetture MoE e MQA, offrendo binding Python per una maggiore flessibilità.
Un utente segnala un problema di consumo eccessivo di memoria con Chatterbox-TTS-Server durante la conversione di un PDF in audiolibro. Il processo, basato su una fast API wrapper, incrementa l'utilizzo della memoria da 3GB a oltre 8GB elaborando piccoli segmenti del libro.
Rilasciata la versione beta 26.01 di Shotcut, l'editor video cross-platform basato su Qt6. L'aggiornamento introduce nuove opzioni di decodifica hardware accelerate via GPU, con l'obiettivo di migliorare le prestazioni di questo software di video editing gratuito. I tecnici puntano a una maggiore velocità nell'elaborazione video.
Intel ha aggiornato LLM-Scaler-vLLM, un'iniziativa open source nata dal Project Battlematrix. Questo strumento, basato su Docker, facilita la distribuzione di carichi di lavoro di intelligenza artificiale generativa (GenAI) su schede grafiche Intel Battlemage. I miglioramenti continui ampliano il supporto a un numero sempre maggiore di modelli linguistici di grandi dimensioni (LLM).
È disponibile la versione 0.3.31 di OpenBLAS, una libreria open-source ottimizzata per Basic Linear Algebra Subprograms (BLAS). Questa release introduce nuove estensioni e miglioramenti significativi per architetture RISC-V e ARM64, offrendo prestazioni superiori per applicazioni che richiedono calcoli matematici intensivi. OpenBLAS continua a essere una scelta popolare per chi cerca una libreria BLAS ad alte prestazioni.
Un nuovo studio introduce un framework differenziabile che incorpora la struttura assiomatica dei modelli di utilità casuale (RUM) direttamente nelle reti neurali profonde. Il sistema utilizza un solutore Tree-Preconditioned Conjugate Gradient per una convergenza superlineare, superando i limiti dei metodi basati su penalità e consentendo modelli addestrabili, razionali e generalizzabili.
Anthropic ha presentato Cowork, una nuova funzionalità integrata nell'app desktop di Claude. Cowork permette agli utenti di designare cartelle specifiche dove Claude può leggere o modificare file, ricevendo istruzioni tramite la consueta interfaccia di chat. L'obiettivo è semplificare lo sviluppo di codice, rendendolo accessibile anche a chi non ha competenze di programmazione.
Un nuovo framework, chiamato MoEBlaze, promette di ottimizzare il training dei modelli Mixture-of-Experts (MoE) su GPU. Affrontando i problemi legati all'eccessivo consumo di memoria e ai colli di bottiglia, MoEBlaze offre un approccio di co-design che include un metodo di dispatch dei token end-to-end e kernel ottimizzati. I risultati preliminari mostrano un incremento di velocità di 4x e un risparmio di memoria del 50% rispetto alle soluzioni esistenti.
Un nuovo framework basato su grafi di conoscenza matematica e modelli linguistici di grandi dimensioni (LLM) promette di migliorare l'affidabilità delle previsioni nella manifattura additiva. Il sistema integra ontologie formali per estrarre conoscenza da fonti non strutturate, generando equazioni fisicamente plausibili e valutando l'affidabilità delle estrapolazioni. Questo approccio mira a superare i limiti degli attuali metodi data-driven.
Meta ha rilasciato TorchForge, una libreria PyTorch-native per semplificare il reinforcement learning (RL) su larga scala nei modelli linguistici di grandi dimensioni (LLM). In collaborazione con Stanford e CoreWeave, TorchForge è stato testato su un cluster di 512 GPU, utilizzando Weaver per la verifica. I risultati mostrano una configurazione semplificata, un training stabile e un percorso chiaro dall'idea all'esperimento, con miglioramenti significativi nelle prestazioni su compiti di ragionamento complessi.
Un nuovo studio introduce un approccio bio-ispirato per ottimizzare l'efficienza energetica nell'inferenza di modelli di intelligenza artificiale. Il framework, basato su NVIDIA Triton e FastAPI, regola l'esecuzione in base al rapporto tra utilità attesa e consumo energetico, riducendo i tempi di elaborazione con una minima perdita di accuratezza. I risultati offrono una base pratica per un'inferenza energy-aware in produzione.
Il compilatore Triton mira a generare codice e runtime portabili tra diversi hardware per i kernel di intelligenza artificiale. La specializzazione warp è una tecnica chiave per migliorare le prestazioni dei kernel sulle GPU, creando percorsi di codice specializzati per ogni warp. Meta sta sviluppando attivamente questa funzionalità in Triton, con l'obiettivo di consentire agli sviluppatori di concentrarsi sulle ottimizzazioni algoritmiche senza doversi preoccupare dei dettagli di basso livello.
La sicurezza delle immagini container è cruciale per le moderne applicazioni. Echo, Google Distroless e Ubuntu Containers offrono approcci diversi per ridurre le vulnerabilità e migliorare l'affidabilità. La scelta dipende dalle esigenze specifiche dell'organizzazione, considerando fattori come la gestione delle vulnerabilità, la completezza e la compatibilità dell'ecosistema.
Un nuovo framework di deep learning geometrico, chiamato IM-PINN, promette di risolvere equazioni differenziali parziali su varietà riemanniane complesse senza l'uso di mesh. Il sistema si basa su reti neurali e mira a superare le limitazioni dei metodi tradizionali, offrendo maggiore accuratezza e efficienza nel calcolo.