Risultati per: "DevOps"

Trovati 100 articoli

✕ Reset
📁 LLM AI generated

Agenti AI: riscoperta DevOps e limiti delle API

Un utente di LocalLLaMA descrive con ironia l'entusiasmo di alcuni sviluppatori per i cosiddetti "agenti AI", spesso implementazioni rudimentali di concetti DevOps di base. Viene evidenziato l'uso eccessivo di crediti API e la tendenza a reinventare soluzioni già consolidate.

2026-03-20 Fonte
📁 Frameworks AI generated

llama.cpp si evolve: gestione completa dei modelli via API

Un recente aggiornamento di llama.cpp introduce la gestione completa dei modelli tramite API, consentendo il caricamento, lo scaricamento e la gestione del ciclo di vita degli LLM direttamente da un'interfaccia programmatica. Questa novità semplifica il deployment on-premise, offrendo maggiore controllo e automazione per gli specialisti DevOps e gli architetti di infrastruttura che privilegiano la sovranità dei dati.

2026-06-18 Fonte
📁 LLM AI generated

Unsloth introduce MiniMax M3 in formato GGUF per deployment efficienti

Unsloth ha reso disponibile su Hugging Face il modello MiniMax M3 nel formato GGUF. Questa mossa sottolinea l'importanza crescente delle soluzioni ottimizzate per l'inference locale di Large Language Models, fornendo agli architetti di infrastrutture e ai responsabili DevOps uno strumento per deployment on-premise che privilegiano il controllo sui dati e l'efficienza delle risorse hardware.

2026-06-12 Fonte
📁 Altro AI generated

Qwen on-premise: le insidie del deployment locale per i Large Language Models

Il deployment di Large Language Models (LLM) come Qwen in ambienti on-premise presenta sfide significative. Dalla gestione della VRAM alle complessità di configurazione, gli architetti e i team DevOps devono bilanciare performance, costi e sovranità dei dati. Un'analisi approfondita è cruciale per evitare frustrazioni e ottimizzare il Total Cost of Ownership (TCO) delle infrastrutture AI.

2026-05-31 Fonte
📁 Altro AI generated

Dalla Crisi di Hormuz alla Sovranità AI: Lezioni per i Deployment On-Premise

La chiusura dello Stretto di Hormuz e il conseguente impatto sui prezzi energetici hanno evidenziato la vulnerabilità delle catene di approvvigionamento globali. Questo evento sottolinea l'importanza della sovranità strategica e della resilienza, principi fondamentali anche per le infrastrutture AI. Per i CTO e i responsabili DevOps, la lezione è chiara: il controllo sui dati e sui sistemi di Large Language Models (LLM) on-premise è cruciale per mitigare i rischi geopolitici e garantire la continuità operativa.

2026-05-01 Fonte
📁 Altro AI generated

Opera GX estende la disponibilità su Linux con Flatpak e Snap

Opera ha ampliato le opzioni di deployment per il suo browser Opera GX su Linux, rendendolo disponibile anche tramite i formati di applicazione containerizzata Flatpak e Snap. Questa mossa, successiva al lancio iniziale con pacchetti RPM e Debian, offre maggiore flessibilità agli utenti e introduce vantaggi in termini di sicurezza e gestione delle dipendenze, aspetti cruciali per gli architetti di infrastruttura e i team DevOps.

2026-04-23 Fonte
📁 Market AI generated

OpenAI e Infosys: una partnership per l'adozione dell'AI in azienda

OpenAI e Infosys hanno annunciato una collaborazione strategica per accelerare l'adozione di strumenti di intelligenza artificiale nelle imprese. L'integrazione mira a supportare i clienti di Infosys nella modernizzazione dello sviluppo software, nell'automazione dei flussi di lavoro e nel deployment di sistemi AI, con un focus iniziale su ingegneria del software, modernizzazione di sistemi legacy e pratiche DevOps.

2026-04-22 Fonte
📁 Frameworks AI generated

A Bengaluru la sfida è passare da utenti a costruttori di sistemi ML

Oltre 170 tra studenti, ingegneri e ricercatori hanno partecipato all'evento Red Hat-Hugging Face a Bengaluru. Al centro profiling, inference, ambienti RL, training distribuito e comunicazione GPU. Il messaggio: l'India non deve restare solo un mercato di consumo AI, ma entrare nel core stack open source.

2026-09-07 Fonte
📁 Altro AI generated

Rustls 0.23.44 attiva i certificati post-quantum ML-DSA di default

La versione 0.23.44 di Rustls abilita di default i certificati ML-DSA, portando l'autenticazione post-quantum da opzione a impostazione standard. Per chi gestisce endpoint TLS self-hosted davanti a servizi LLM, il cambiamento riduce la necessità di configurazioni manuali, ma sposta la pressione su tooling per CA private, HSM e client legacy. Un segnale strutturale: la migrazione post-quantum entra nel ciclo di vita ordinario delle librerie.

2026-09-07 Fonte
📁 LLM AI generated

Open source LLM e Astra: il divario che la community osserva

Una domanda comparsa su Reddit riapre il confronto tra assistenti proprietari multimodali e LLM open source. Senza benchmark, resta la percezione di un ritmo AI difficile da seguire. Per chi valuta stack locali, il nodo non è solo il modello, ma integrazione, latenza e infrastruttura on-premise.

2026-09-07 Fonte
📁 Frameworks AI generated

llama.cpp, una fork testa l'expert expansion sui modelli MoE su Apple Metal

Una branch custom di llama.cpp porta l'expert expansion ai modelli MoE e la testa su Apple Metal. Il risultato supera la versione DS4 dell'autore, ma manca validazione su altre piattaforme. Il caso mostra quanto l'inference locale sui modelli sparse dipenda ancora da fork individuali e pochi test multipiattaforma.

2026-09-06 Fonte
📁 LLM AI generated

DeepSeek-V4-Flash-Vision vs Qwen3.8-Flash-Next: token lenti, task più rapidi

Una comparativa locale con quantization Q8_K_XL su due StrixHalo 128GB mostra che DeepSeek-V4-Flash-Vision genera token più lentamente di Qwen3.8-Flash-Next, ma chiude i compiti in circa metà tempo. L'autore osserva meno allucinazioni e una minore tendenza a sovrainterpretare le consegne, mentre Qwen incontra blocchi nelle modalità più aggressive. Un invito a valutare i modelli on-premise oltre la velocità di generazione grezza.

2026-09-06 Fonte
📁 LLM AI generated

Spark-X2.5 in GGUF: llama.cpp apre la strada ai modelli compatti da 1M token

Una pull request su llama.cpp introduce il supporto per Spark-X2.5, due LLM compatti da 4B e 1.7B parametri, con contesto nativo fino a 1M token e architettura ibrida a finestra scorrevole. La mossa abbassa la soglia per l'inference locale e self-hosted, mentre l'addestramento su Huawei Ascend segnala una filiera hardware alternativa. I modelli puntano su coding, agenti e flussi di lavoro locali, con implicazioni per sovranità dei dati e TCO.

2026-09-06 Fonte
📁 LLM AI generated

Qwen 3.8 27B senza censura: i tagli mirati battono le modifiche pesanti

Undici giorni e circa 167 ore di GPU per confrontare otto varianti abliterated di Qwen 3.8 27B con il modello base. I dati mostrano che le modifiche chirurgiche superano quelle aggressive: i modelli più editati entrano in loop di pensiero e perdono usabilità. Il copyright resta il muro più resistente, chimica e biologia diventano facili da sbloccare. La forensica sui chat template rivela leve comportamentali nascoste.

2026-09-06 Fonte
📁 Hardware AI generated

Qwen3.8-Flash-Next: 45 tok/s su M4 Max, 25 su M2 Ultra in locale

La variante Qwen3.8-Flash-Next-oQ4e-mtp mostra velocità di inference locale su Apple Silicon: 45 token al secondo su M4 Max e 25 su M2 Ultra. Il dato arriva da llm-bench.io e mette a confronto una variante ottimizzata con Qwen3.8 27B, con prestazioni simili. Una lettura utile per chi valuta self-hosted su hardware Apple.

2026-09-06 Fonte
📁 Frameworks AI generated

TrueForge usa il 63% di token in meno dei managed agent a parità di task

Un benchmark su 14 task cross-system e tre server MCP mostra che TrueForge con Opus 4.8 risolve 11/14 task come Claude Managed Agents, ma consuma il 63% di token in meno e costa il 30% in meno per run. Con GLM-5.2 il costo scende a 3 dollari. Restano però assenti tracing nativo, sandbox e una gestione del contesto non lossy.

2026-09-06 Fonte
📁 Market AI generated

Open source e laboratori di frontiera: un divario ormai marginale

Un professionista che costruisce una rete di cybersecurity racconta di non vedere più differenze sostanziali tra modelli aperti e modelli dei laboratori di frontiera. Il divario tecnico si restringe, mentre il marketing prova a sostenere prezzi dei token in vista di possibili quotazioni. E i modelli locali come DeepSeek V4 Flash entrano nella partita.

2026-09-05 Fonte
📁 Altro AI generated

AMD forma un team 'elite' per portare Rust nello stack GPU

AMD sta costruendo un team di sviluppatori di alto livello per introdurre Rust nel cuore dello stack GPU: firmware, driver, compilatori shader e altri componenti. L'obiettivo è ridurre le classi di vulnerabilità legate alla memoria e migliorare l'affidabilità del software che governa le GPU, con effetti che vanno oltre la singola azienda.

2026-09-05 Fonte
📁 Hardware AI generated

Qwen3.8 27b su una 3090: coding agentico locale e il gap con i modelli grandi

Un post tecnico mostra come Qwen3.8 27b in quantization Q4_K_XL giri su una RTX 3090 con 24GB di VRAM e contesto da 100k token. L'autore sostiene che i piccoli LLM self-hosted, capaci di svolgere l'80-90% del lavoro ripetitivo, minano i ricavi dei vendor cloud più dei modelli frontier. Resta però un vuoto nel salto verso modelli più grandi: servono server multi-GPU o cluster DGX e i costi hardware aprono un nuovo calcolo di convenienza.

2026-09-05 Fonte
📁 LLM AI generated

Qwen3.8 27B su RTX 5080: 21 quantizzazioni alla prova dei 16 GB

Un benchmark su 21 varianti quantizzate di Qwen3.8 27B con una RTX 5080 da 16 GB mostra quanto conti la scelta del formato GGUF. La variante IQ4_XS di bartowski ottiene la divergenza media più bassa e il miglior accordo sul token più probabile, mentre alcune quantizzazioni più aggressive risultano deludenti. I dati aiutano chi vuole inference locale senza sacrificare del tutto la qualità.

2026-09-04 Fonte
📁 Altro AI generated

ASCII smuggling: dagli attacchi AI agli spammer, la minaccia invisibile cambia bersaglio

La tecnica dei tag Unicode invisibili, nata per nascondere prompt injection agli LLM, è ora usata dagli spammer per eludere i filtri email. Il passaggio segnala una divergenza strutturale: i modelli leggono ciò che gli umani non vedono. Per i deployment self-hosted, la sfida si sposta sulla normalizzazione del testo prima dell'inference.

2026-09-04 Fonte
📁 Hardware AI generated

Un LLM da 90 milioni di parametri gira su PSP: il local al limite del 2004

Un esperimento porta un modello conversazionale da 90M su una console Sony del 2004. L'inference viaggia a circa 0,5-0,6 token al secondo, con risposte in 1-3 minuti. Più una provocazione tecnica che uno strumento utile, ma dice molto sui vincoli reali del deployment locale.

2026-09-04 Fonte
📁 Altro AI generated

Un FPS multiplayer nato da un LLM locale: Qwen 3.8 Flash Next in azione

Un utente ha costruito un FPS multiplayer con Qwen 3.8 Flash Next in locale, usando opencode e GPU NVIDIA (RTX 5090 e RTX 4000 PRO). Demo giocabile in due ore, tre giorni di rifiniture, 20 token/s medi con MTP, contesto 256k e quantization Q4_K_XL. L'esperienza segnala la maturità crescente dei flussi di coding self-hosted, ma anche i requisiti hardware per chi vuole autonomia creativa senza cloud.

2026-09-04 Fonte
📁 Hardware AI generated

Mesa 26.3 introduce il supporto alla modalità GPU a 64 bit di Intel Nova Lake P

Le modifiche al compilatore grafico Intel integrate in Mesa 26.3 rivelano che Nova Lake P adotterà una modalità di indirizzamento degli shader a 64 bit. È un cambio architetturale profondo, non un semplice aggiornamento: espande lo spazio di memoria indirizzabile e prepara il driver open source a supportare la prossima generazione di GPU Intel. Per chi valuta stack locali, il supporto anticipato riduce i rischi di disallineamento tra hardware e software.

2026-09-04 Fonte
📁 Hardware AI generated

ASIC oltre le GPU: il segnale dal test per il 2027

Chunghwa Precision Test prevede che il fatturato degli ASIC superi quello delle GPU entro il 2027. La proiezione segnala un riequilibrio dell'hardware AI verso chip specializzati, con implicazioni per TCO, flessibilità e deployment on-premise. Il vero tema è il trade-off tra efficienza per token e opzionalità dei carichi di lavoro.

2026-09-04 Fonte
📁 Hardware AI generated

Acer punta su RTX e GoogleBook mentre cresce la domanda di AI on-site

La scelta di Acer di puntare su RTX e GoogleBook segnala un riposizionamento dell'hardware verso l'inference locale. La domanda di AI in sede cresce per ragioni di sovranità, latenza e controllo dei costi, spingendo i vendor a investire su GPU e dispositivi per carichi self-hosted.

2026-09-04 Fonte
📁 Market AI generated

Nvidia e Hugging Face: pagamenti ai rivali e un miliardo per i talenti

I termini negoziati da Nvidia con Hugging Face prevedono pagamenti a favore dei concorrenti nel settore dei chip e un fondo da un miliardo di dollari per trattenere il personale. Un segnale di come si stiano ridisegnando gli equilibri nell'infrastruttura AI, tra hardware, modelli e competenze.

2026-09-04 Fonte
📁 Market AI generated

Nvidia acquisisce Hugging Face: ora controlla la distribuzione dei modelli

Con un'operazione da 12,93 miliardi di dollari, Nvidia mette le mani su Hugging Face, il punto di riferimento per la distribuzione di modelli e dataset. L'operazione unisce il principale fornitore di GPU al canale che alimenta fine-tuning e inference self-hosted. Per chi gestisce LLM on-premise cambiano gli incentivi: la neutralità della piattaforma diventa un nodo critico per sovranità, TCO e dipendenza dal fornitore.

2026-09-03 Fonte
📁 Market AI generated

NVIDIA acquisisce Hugging Face per 12,93 miliardi: neutralità sotto esame

NVIDIA ha raggiunto un accordo da 12,93 miliardi di dollari per acquisire Hugging Face. L'operazione promette di mantenere la piattaforma aperta, multi-cloud e indipendente dall'hardware NVIDIA. Ma il controllo del principale punto di accesso agli LLM open-weight solleva interrogativi su ottimizzazione, sovranità dei dati e incentivi di lungo periodo.

2026-09-03 Fonte
📁 LLM AI generated

IFM rilascia K2-Horizon-MoVA-36B-A4B in GGUF: frontiera a 4B attivi

IFM ha pubblicato il checkpoint finale del modello sparse Mixture-of-Experts K2-Horizon-MoVA-36B-A4B, con 36 miliardi di parametri totali e 4 miliardi attivi per token. Distribuito in GGUF, compete su task agentici e di reasoning con modelli chiusi di frontiera. Previsti anche checkpoint intermedi, dati e codice di training.

2026-09-03 Fonte
📁 Altro AI generated

Equinix spinge sull'AI distribuita con NVIDIA, Together AI, AWS e Google Cloud

Equinix ha presentato Inference Exchange, una piattaforma di inference distribuita sviluppata con NVIDIA e Together AI, e Fabric One, connettività gestita basata su specifiche aperte di AWS e Google Cloud. Inference Exchange consente di collocare i carichi AI vicino a dati e utenti, con opzioni multitenant e ambienti dedicati con GPU riservata. Fabric One automatizza il provisioning di rete tramite portali, API, agenti e prompt in linguaggio naturale. Beta nel 2026, disponibilità nel 2027.

2026-09-03 Fonte
📁 Market AI generated

NVIDIA acquisisce Hugging Face per 12,93 miliardi di dollari

NVIDIA ha annunciato l'acquisizione di Hugging Face per 12,93 miliardi di dollari. L'operazione unisce il principale fornitore di GPU per LLM e la piattaforma che ospita modelli, dataset e strumenti. Per i team che valutano deployment self-hosted o on-premise, il nodo è la governance di un ecosistema integrato hardware-software: vantaggi di pipeline e rischi di dipendenza.

2026-09-03 Fonte
📁 Market AI generated

Nvidia-Hugging Face: la voce da 12,9 miliardi che scuote il self-hosted

Un post su Reddit rilancia una presunta acquisizione di Hugging Face da parte di Nvidia per 12,9 miliardi di dollari. La notizia non ha conferme ufficiali, ma se fosse vera ridisegnerebbe il punto neutro tra hardware GPU e distribuzione di LLM open-weight. Per chi valuta deployment on-premise e self-hosted, il nodo sarebbe la dipendenza da un unico attore lungo tutta la filiera.

2026-09-03 Fonte
📁 Frameworks AI generated

Qwen-3.8-Next-Flash: iniezione di conoscenza a caldo in llama.cpp

Una modifica sperimentale a llama.cpp aggiorna in-memory la tabella Ngram PLE dei modelli Qwen, inserendo conoscenza senza ricaricare il modello. Il progetto, testato soltanto con quantization q8, richiede memory mapping e soffre di scarso controllo sull'output. È un percorso verso memoria hot-swap per LLM self-hosted, ma con vincoli di memoria e prevedibilità ancora rilevanti.

2026-09-03 Fonte
📁 Altro AI generated

Arcon spinge Qwen3-4B: quanto conta l'architettura, non solo i parametri

Il progetto Arcon usa Qwen3-4B con LoRA per costruire un assistente locale con memoria persistente, stato interno e strumenti. Più che un chatbot, è un banco di prova per capire fino a che punto un modello compatto possa reggere un'interazione da assistente. La risposta ha implicazioni per chi valuta deployment on-premise e sovranità dei dati.

2026-09-03 Fonte
📁 Altro AI generated

Il calcolo lento come scelta: un Qwen 27B e la produttività asincrona

Un intervento su Reddit riporta un passaggio da 15 ore di programmazione attiva a 4 ore per debuggare o implementare una feature con Qwen 27B, anche a 0,5 token al secondo. Il dato ridisegna le aspettative per l'inference asincrona e il calcolo del valore del tempo umano.

2026-09-03 Fonte
📁 LLM AI generated

La KV cache pesa più dei parametri sui modelli locali a contesto lungo

Per gli LLM locali, il numero di parametri non è l'unico vincolo: la KV cache cresce con ogni token e può diventare il vero collo di bottiglia a contesti da 100k o 200k token. GQA, MQA e quantization riducono l'ingombro, ma il problema resta lineare. La prossima ottimizzazione guarderà più alla memoria persistente e al movimento dati che ai parametri.

2026-09-03 Fonte
📁 Hardware AI generated

Qwen3.8-Flash-Next su due RTX 3090: la cache esperti spinge il decode a 29 t/s

Un utente documenta un balzo del decode da 17 a 25-29 token/s su due RTX 3090, con contesto pieno da 261.888 token, usando la cache LRU degli esperti di llama.cpp e riducendo l'ubatch. La configurazione mantiene i 48 layer di esperti in RAM di sistema e mostra margini concreti per l'inference on-prem su hardware non recente, a patto di calibrare cache e buffer sulla VRAM.

2026-09-03 Fonte
📁 LLM AI generated

Quando tacere è la risposta giusta: addestrare il confine dell'evidenza

Un framework di training insegna ai modelli di QA grounded a rispondere solo quando l'evidenza diventa sufficiente, localizzando il punto esatto in cui l'astensione lascia spazio alla risposta. Su HotpotQA, 2WikiMultiHopQA e MuSiQue, con Qwen2.5-3B-Instruct e LoRA, il metodo riduce il tasso di risposte non supportate su set esterni.

2026-09-03 Fonte
📁 LLM AI generated

PRO-Step corregge il RAG multi-hop: premia ogni passo, non solo il risultato

PRO-Step introduce una supervisione a livello di passo per il Retrieval-Augmented Generation. Invece di valutare solo la risposta finale, un modello generativo di ricompensa controlla coerenza logica e aderenza alle evidenze in ogni fase del ragionamento multi-hop. Il metodo usa ricerca ad albero e ottimizzazione diretta delle preferenze. I test mostrano i migliori risultati medi su cinque benchmark. L'approccio segnala un cambio utile per pipeline self-hosted più affidabili.

2026-09-03 Fonte
📁 Frameworks AI generated

Perplexity apre il server di inference per Mac ottimizzato per Qwen 3.6

Perplexity ha reso open source il repository lily in pplx-garden, un inference server per Mac costruito attorno a un solo modello, Qwen 3.6, per ottenere il massimo su Apple Silicon. Non è serving generico: la verticalizzazione su un singolo modello cambia i trade-off tra flessibilità, manutenzione e prestazioni. Il pezzo analizza chi ne beneficia e cosa segnala per i deployment locali.

2026-09-03 Fonte
📁 Frameworks AI generated

Lemonade 11.9 porta il backend sperimentale AMD ROCm HRX in Llama.cpp

Lemonade 11.9, server AI locale open source sostenuto da AMD, debutta su Linux, Windows e macOS con un backend sperimentale ROCm HRX per Llama.cpp. Il progetto conferma la linea «100% gratuito e privato» su GPU, CPU e NPU. Il dettaglio tecnico più rilevante è l'integrazione ancora sperimentale di HRX, una novità nel panorama ROCm, che segnala un ulteriore passo verso alternative locali al monopolio CUDA per chi valuta deployment self-hosted.

2026-09-03 Fonte
📁 Altro AI generated

Greg KH: Linux 7.3 sarà un ciclo «rough» per il rumore dei contributi AI

La prima release candidate di Linux 7.3 è appena arrivata e Greg Kroah-Hartman prevede un ciclo difficile per il rumore generato da AI e LLM. L'aumento di bug report e patch assistite sposta il costo sui maintainer. Per chi gestisce infrastrutture self-hosted, la stabilità del kernel diventa una variabile critica, con effetti su regressioni, tempi di review e scelte di kernel long-term support.

2026-09-02 Fonte
📁 Frameworks AI generated

Intel aggiorna LLM-Scaler-vLLM: vLLM 0.26 su GPU Arc con Docker

Il progetto LLM-Scaler-vLLM di Intel rilascia una nuova beta basata su vLLM 0.26, pensata per avviare vLLM su GPU Arc e Arc Pro tramite container Docker. L'aggiornamento riduce l'attrito di configurazione per chi vuole servire LLM in locale su hardware Intel, ma resta una beta: segnale di un ecosistema software in maturazione più che una soluzione pronta per la produzione.

2026-09-02 Fonte
📁 Frameworks AI generated

I giudici LLM a esito unico non vedono i guasti silenziosi degli agenti

Uno studio su 400 traiettorie mostra che i giudici LLM basati solo sull'esito rilevano l'84% dei guasti visibili ma solo il 45% di quelli silenziosi e segnalano come errate un terzo delle traiettorie corrette. Un giudice con rubrica per passi arriva al 77% di recall sui guasti silenziosi con zero falsi positivi, a costo triplo. Nessun giudice legge la risposta finale: una promessa inventata sfugge fino all'82% dei casi.

2026-09-02 Fonte
📁 LLM AI generated

REAL-Q porta la discesa del gradiente nella quantization dei LLM

Un nuovo metodo di post-training quantization, REAL-Q, usa la discesa del gradiente a blocchi per ridurre fino a circa il 49% la divergenza KL end-to-end rispetto ai metodi di secondo ordine su LLaMA-3.1 e Qwen3 a W4A16. Un risultato che tocca i deployment con risorse limitate, dove la fedeltà del modello compresso resta decisiva.

2026-09-02 Fonte
📁 Frameworks AI generated

TPGC: prompt a doppio priore per il few-shot sui grafi

TPGC introduce una doppia inizializzazione dei prompt per il pre-training multi-task su grafi: un priore di task e uno strutturale estratti da un grafo ausiliario. Su sei benchmark di classificazione di nodi e grafi, il metodo supera le baseline in few-shot, con meno parametri tunabili e runtime inferiore. Il risultato segnala una via parameter-efficient per adattare modelli su dati locali.

2026-09-02 Fonte
📁 Hardware AI generated

NVIDIA discute CUDA per RISC-V e NVLink Fusion a Hot Chips 2026

A Hot Chips 2026 NVIDIA ha discusso CUDA per RISC-V e il ruolo dell'ISA aperta nei sistemi NVLink Fusion. Il resoconto di ServeTheHome segnala una direzione architetturale: la toolchain CUDA potrebbe aprirsi a host RISC-V, riducendo il vincolo x86 nei nodi accelerati. Per deployment on-premise e self-hosted, la novità tocca approvvigionamento, modularità e sovranità dei componenti, oltre a cambiare gli incentivi per i fornitori di IP e processori.

2026-09-01 Fonte
📁 LLM AI generated

Spark-X2.5-4B e -1.7B: contesto 1M, architettura propria e un fork obbligato

Due nuovi LLM compatti, Spark-X2.5-4B e Spark-X2.5-1.7B, si presentano con architettura non derivata da fine-tuning e un contesto nativo dichiarato di 1 milione di token. I benchmark citati sulla pagina Hugging Face indicano la versione da 4B vicina a un modello Qwen 3.5 da 9B. Per l'inference locale serve però un fork personalizzato di llama.cpp: il supporto ufficiale è ancora in attesa di una pull request.

2026-09-01 Fonte
📁 Altro AI generated

La camicia che confonde YOLO e svela l'opacità della sorveglianza locale

L'artista Simon Weckert ha creato una camicia con motivi sfocati rosa e verdi che impedisce a un algoritmo YOLO di classificare una persona come tale. Il progetto nasce dalle telecamere con riconoscimento di oggetti installate dalla polizia a Berlino, ma non è possibile verificare se funzioni sul sistema reale perché l'algoritmo non è dichiarato. L'opera mostra un limite strutturale: l'inference locale non garantisce trasparenza.

2026-09-01 Fonte
📁 LLM AI generated

Kernel Linux 7.2, il rumore dei LLM e il voto Debian sull'AI

Agosto ha messo i manutentori del kernel Linux sotto pressione: una valanga di patch e bug report generati da LLM, mentre usciva Linux 7.2 e si apriva la merge window di 7.3. La risoluzione Debian sull'uso dell'AI sposta il problema dalla qualità del codice alla responsabilità. Per chi gestisce infrastrutture self-hosted, la lezione è chiara: il controllo dei dati non basta senza tracciabilità dei contributi.

2026-09-01 Fonte
📁 Altro AI generated

MCP server, il nuovo perimetro: perché la sicurezza AI ora passa dai connettori

MCP è diventato lo standard per collegare agenti e strumenti, ma porta con sé una superficie d'attacco che i firewall tradizionali non coprono. Tra tool poisoning, rug pull e accessi sovradimensionati, il vero nodo è la fiducia nei metadati. I fornitori di sicurezza iniziano a rispondere, ma la partita è più ampia della sola rete.

2026-09-01 Fonte
📁 Frameworks AI generated

MTP su Qwen3.8-Flash-Next-GGUF: la spinta al throughput nei modelli GGUF locali

La segnalazione su Reddit è scarna, ma il messaggio è chiaro: il supporto MTP per Qwen3.8-Flash-Next in formato GGUF promette di aumentare i token al secondo nelle esecuzioni con llama.cpp. Più che una singola ottimizzazione, è un segnale sulla direzione dello stack open source per l'inference locale, dove throughput e vincoli hardware restano i veri colli di bottiglia.

2026-09-01 Fonte
📁 LLM AI generated

ERR+ premia i cali di entropia per un ragionamento LLM più conciso ed efficiente

ERR+ introduce un framework RLVR in due fasi che premia i cali di entropia a livello di token e l'efficienza relativa della lunghezza. Le tracce corrette risolvono l'incertezza in modo più marcato. Nei test su cinque dataset migliorano accuratezza e concisione. Per deployment self-hosted, la riduzione dei token tocca direttamente TCO e occupazione GPU.

2026-09-01 Fonte
📁 LLM AI generated

LLM in oncologia: il limite non è la conoscenza ma il giudizio tra percorsi clinici

Nove LLM di frontiera valutati su 2.005 decisioni oncologiche mostrano un limite collettivo: nel 42,1% dei casi nessun modello risponde correttamente, soprattutto quando serve scegliere tra percorsi terapeutici. Due modelli più assertivi producono impegni non sicuri da tre a cinque volte più spesso, senza risultati migliori. Il vero collo di bottiglia non è la qualità del modello, ma l'idea che un singolo LLM possa decidere da solo.

2026-09-01 Fonte
📁 Frameworks AI generated

DS-Lighting: un harness esplicito per gli agenti data science

DS-Lighting è un toolkit open-source che rende esplicito il harness nell'automazione della data science. Scompone il harness in quattro strati: dati, workflow, esecuzione e valutazione, e rappresenta gli agenti come programmi operatori eseguibili. Integra diversi benchmark open-source in un formato ispirato a MLE-Bench, con interfaccia condivisa, runtime sandboxed e metriche uniformi. L'obiettivo è migliorare riproducibilità, confrontabilità e affidabilità dei flussi end-to-end.

2026-09-01 Fonte
📁 LLM AI generated

Xenomi, il LLM cinese che porta la quantistica negli agenti AI

Una segnalazione attribuita a Mydrivers accosta il LLM cinese Xenomi al calcolo quantistico per le decisioni degli agenti AI. Senza specifiche tecniche, l'annuncio va letto come un segnale di posizionamento: la pipeline si dividerebbe tra LLM classico e coprocessore quantistico, con conseguenze dirette su sovranità dei dati e architetture on-premise.

2026-09-01 Fonte
📁 Altro AI generated

Da Clear Linux a Rust: nasce The Ur Project

Un ex architetto di Clear Linux ha avviato una nuova distribuzione chiamata The Ur Project. Il sistema farà ampio uso di Rust e integrerà in parte AI e LLM, riprendendo alcune scelte progettuali di Clear Linux. La notizia riapre il confronto su sistemi operativi ottimizzati per carichi AI on-premise.

2026-08-31 Fonte
📁 LLM AI generated

GigaPath-Flash e GigaTIME-Flash: patologia computazionale più efficiente

Microsoft Research, University of Washington e Providence hanno rilasciato due modelli di patologia computazionale con pesi aperti. GigaPath-Flash distilla un encoder da miliardo di parametri in un backbone da 22M, riducendo di circa 50 volte il calcolo e mantenendo il 97% delle prestazioni. GigaTIME-Flash è sei volte più veloce e usa otto volte meno memoria GPU nella predizione proteomica spaziale. I modelli restano di ricerca, non clinici.

2026-08-31 Fonte
📁 LLM AI generated

DeepSeek-V4-Flash-Vision-Exp: il segnale oltre il nome su Hugging Face

Un repository su Hugging Face con nome DeepSeek-V4-Flash-Vision-Exp circola su Reddit senza dettagli tecnici. Il nome suggerisce un modello visione-linguaggio efficiente e sperimentale, ma senza VRAM, quantization o licenza. Per chi valuta self-hosted e TCO, è un segnale di direzione più che una base di pianificazione.

2026-08-31 Fonte
📁 Altro AI generated

Mesa 26.3, sorting più rapido nei driver Vulkan: perché conta per la GPU locale

Nei driver Mesa per Vulkan, in arrivo con la release 26.3, Valve ha introdotto un merge sort più rapido ed efficiente in VRAM per le chiavi Morton. Il lavoro di Natalie Vock tocca la costruzione delle BVH e il parallelismo GPU. La notizia segnala come le ottimizzazioni di basso livello nello stack aperto stiano diventando una leva competitiva per i carichi GPU locali.

2026-08-31 Fonte
📁 Hardware AI generated

Driver NVIDIA VA-API 0.0.18: più fix e decodifica Chrome/Chromium su backend diretto

La release 0.0.18 del driver indipendente VA-API per GPU NVIDIA porta nuove correzioni e abilita la decodifica per Chrome/Chromium tramite il backend diretto. Costruito sull’interfaccia NVDEC, il progetto colma l’assenza di VA-API nel driver ufficiale Linux di NVIDIA. La notizia arriva mentre Firefox sperimenta Vulkan Video, in un ecosistema che resta frammentato ma più aperto.

2026-08-31 Fonte
📁 Hardware AI generated

MetaX chiude il primo semestre in utile, ma i rivali cinesi delle GPU per l'AI restano divisi

MetaX ha registrato un utile nel primo semestre, mentre il fronte dei produttori cinesi di GPU per l'AI resta diviso. Il dato segnala un mercato domestico in via di maturazione, ma la redditività non è uniforme: la sostenibilità dei fornitori e l'integrazione con stack self-hosted diventano variabili chiave per chi valuta hardware per inference on-premise.

2026-08-31 Fonte
📁 Frameworks AI generated

Inference CPU, l'indice vettoriale riduce il peso dell'output embedding

Sostituire la proiezione densa sul vocabolario con una ricerca approssimata su indice HNSW accelera la decodifica autoregressiva su CPU. Nei test con Gemma 3, Llama 3.2 e Qwen 3, il throughput batch-one di Gemma 3 270M migliora fino all'82%, senza perdite di qualità sotto AlpacaEval. Un segnale per chi porta i LLM compatti on-premise.

2026-08-31 Fonte
📁 LLM AI generated

Quantization non neutra: il gap tra validazione e deployment dei LLM

Un nuovo studio formalizza il validation-deployment gap: un LLM può superare i controlli a precisione piena e attivare comportamenti dannosi solo dopo quantization INT8 o a 4 bit. Nei test, la traduzione tattica passa da zero corruzione a FP16 riparato fino all'85,02% di inversione dopo compressione; un classificatore di posizionamento mostra uno shift ideologico fino a ΔBias=0,33. L'audit al checkpoint sorgente non basta: serve certificare la configurazione finale distribuita.

2026-08-31 Fonte
📁 Hardware AI generated

SiFive BigSky: RISC-V entra nei data center tra CUDA e Linux

L'ingresso di SiFive nel mercato dei data center con BigSky segnala un passaggio strategico: portare i processori RISC-V accanto all'ecosistema Nvidia, con CUDA come interfaccia e Linux enterprise come base operativa. Per chi gestisce infrastrutture AI, la notizia apre un potenziale nuovo asse hardware, ma senza intaccare il predominio CUDA; anzi, lo accetta come condizione di ingresso.

2026-08-31 Fonte
📁 Hardware AI generated

Linux 7.3-rc1 sfiora 41 milioni di righe: il driver AMD è un terzo delle modifiche

Il kernel Linux 7.3-rc1 si avvicina a 41 milioni di righe e il driver grafico AMD supera i 6,5 milioni. Linus Torvalds segnala che le modifiche al driver AMD valgono circa un terzo della release candidate, trainate dai file di registro per DCN 6.0. Un segnale sulla complessità dell'abilitazione hardware e sui costi operativi per chi gestisce GPU on-premise.

2026-08-31 Fonte
📁 LLM AI generated

LongCat sparse, Qwen con MTP e Laguna-S2.1: una raffica di GGUF senza censura

LLMFan46 ha pubblicato varianti GGUF di LongCat-Flash-Lite-Sparse, Qwen3.8-27B e Qwen3.5-122B-A10B, oltre a Qwen3-Coder-Next e Laguna-S2.1 con visione opzionale. La dipendenza da un fork personale di llama.cpp per sparse attention e contesto da 1 milione di token mostra il costo reale dell'innovazione locale.

2026-08-30 Fonte
📁 Frameworks AI generated

Quattro V100 32GB servono un LLM a 256k token: cosa dice il test SGLang-V100

Il supporto a RadixArk/Qwen3.8-Flash-Next-NVFP4 in SGLang-V100 mostra quattro V100 32GB con contesto completo da 256k token e oltre 50GB di offload sulla RAM di sistema. Prefill intorno a 4.000 token/s, decoding intorno a 60 token/s. I dati MTP segnalano guadagni di throughput ma latenze elevate e un calo a 16 flussi concorrenti. Per chi gestisce flotte on-premise, è un segnale sull'estensione del ciclo di vita dell'hardware.

2026-08-30 Fonte
📁 Hardware AI generated

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5 token/s a 169K. Dopo 100K token il modello confonde i ruoli; sospetti su quantization 2 bit e qualità long-context.

2026-08-30 Fonte
📁 Altro AI generated

Nvidia sposta il vantaggio competitivo oltre la GPU

Nvidia sta spostando il suo vantaggio competitivo oltre la GPU, verso il controllo intelligente del traffico nei sistemi per data center. Aumentare i cicli di calcolo non basta: governare i flussi tra acceleratori, memoria e rete diventa la leva per migliorare l'efficienza. Un segnale strutturale per chi progetta infrastrutture AI, soprattutto in ottica on-premise e self-hosted, dove il TCO e i colli di bottiglia di rete contano quanto il silicio.

2026-08-29 Fonte
📁 Frameworks AI generated

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda di precisione sugli ultimi 1.024 token e la decodifica speculativa MTP completano il framework.

2026-08-29 Fonte
📁 Altro AI generated

GNOME: reset GPU, fondi sovrani a Flatpak e spinta all'infrastruttura locale

La settimana di GNOME unisce tre fatti: reset GPU per Mutter, mezzo milione di euro dalla Sovereign Tech Agency a Flatpak e novità applicative. Non è solo desktop Linux: l’infrastruttura software locale riceve investimenti pubblici mirati a resilienza e sovranità tecnicica. Per chi gestisce stack on-premise, la stabilità del compositor e la distribuzione sandboxed riducono rischi operativi e dipendenze da componenti opache.

2026-08-29 Fonte
📁 LLM AI generated

GLM-5.3: il post-training accende coding e cyber, ma il controllo è più sfumato

Z.ai usa la stessa base di GLM-5.2 per GLM-5.3, ma i guadagni arrivano tutti dal post-training. Il coding migliora del 50% sul Code Bench interno e tocca lo stato dell'arte su Terminal Bench 3.0 e Agents' Last Exam. La vera novità è la cyber capability emergente: SOTA su CyberGym e più che doppio su exploitation. Per chi fa self-hosting, la sfida si sposta dal controllo dei dati a quello delle capacità.

2026-08-28 Fonte
📁 Hardware AI generated

HP Z4 G6i: Xeon 600, RTX e Linux-ready, ma il prezzo supera 41mila dollari

Provata per un mese con carichi intensi, la workstation HP Z4 G6i combina processore Intel Xeon 600 "Granite Rapids WS" e grafica NVIDIA RTX. Il prezzo della configurazione top supera i 41.000 dollari. Il supporto a Ubuntu LTS e l'etichetta Linux-ready la candidano a nodo per stack AI locali, ma mancano dettagli su GPU esatta e VRAM, decisive per valutare il TCO reale.

2026-08-28 Fonte
📁 Altro AI generated

Il kernel Linux sfiora 2.000 CVE per release: il ruolo degli LLM

Il numero di CVE corrette per ogni release del kernel Linux è passato da circa 500 a quasi 2.000, spinto dall'analisi automatizzata con modelli LLM. Questo cambio di scala non segnala necessariamente un codice meno sicuro, ma sposta il costo della sicurezza dalla scoperta alla gestione e alla correzione, con conseguenze dirette per chi opera infrastrutture self-hosted.

2026-08-28 Fonte
📁 Hardware AI generated

Micron: HBM occupa tre volte l'area wafer della DDR5 a parità di capacità

Micron ha spiegato a Hot Chips 2026 che l'HBM richiede circa tre volte l'area wafer della DDR5 per la stessa capacità. Il rapporto non migliorerà nelle prossime generazioni. Ogni gigabyte di HBM in una GPU da datacenter sottrae tre gigabyte di DRAM convenzionale, riducendo l'offerta complessiva. Un B100 con 144GB di HBM equivale all'area di 432GB DDR5. Il passaggio dei tre maggiori produttori all'HBM ha tagliato di due terzi la capacità DRAM in GB.

2026-08-28 Fonte
📁 Altro AI generated

Linux 7.3 rimuove driver IBM e SGI: il peso dei fix generati da LLM

Nel merge window di Linux 7.3, la rimozione di un vecchio driver IBM e dei driver SGI insicuri estende una tendenza del 2026: eliminare driver raramente aggiornati e senza utenti attivi. A spingere questa pulizia c'è anche l'eccesso di segnalazioni e patch generate da LLM, che aumenta il carico di manutenzione. Per gli ambienti on-premise con hardware datato, il supporto mainline diventa un processo con soglie variabili e costi crescenti.

2026-08-28 Fonte
📁 Frameworks AI generated

NeuronFuzz: il fuzzing che guarda dentro i neuroni degli LLM

Un nuovo framework di fuzzing white-box sostituisce il feedback sulle risposte con un punteggio continuo ricavato dai neuroni di sicurezza durante la prefill. Su 21 modelli scopre jailbreak nel 76-100% dei casi e trasferisce template ottimizzati a modelli open-weight e proprietari, senza generare risposte complete. L’approccio ribalta i costi della valutazione e segnala un’asimmetria tra chi può ispezionare i pesi e chi no.

2026-08-28 Fonte
📁 LLM AI generated

Un router semantico nei grafi a proprietà

Un'architettura combina una GNN topologica con un piccolo modello linguistico parametro-efficiente per selezionare e instradare i messaggi nei grafi a proprietà etichettate. L'aggiornamento residuo limitato all'ancora strutturale preserva l'interpretabilità e apre a un'integrazione semantica locale, senza dipendere da un LLM cloud. Il segnale per chi valuta deployment on-premise è chiaro: il linguaggio può governare il flusso informativo senza monopolizzare l'infrastruttura.

2026-08-28 Fonte
📁 Frameworks AI generated

PICasso e il valore dei vincoli fisici: gli LLM da soli non bastano nel design fotonico

PICasso combina specifiche in linguaggio naturale, generazione GDS e verifiche fisiche per progettare circuiti fotonici integrati. Su un benchmark di 36 task parametrizzati, il framework raggiunge fino al 92,7% di soddisfazione strutturale e riduce la perdita di inserzione media da 4,98 dB a 3,25 dB. Il risultato: gli LLM diventano agenti di progettazione pratici solo con vincoli di dominio, simulazione e feedback.

2026-08-28 Fonte
📁 Frameworks AI generated

EduRiskX: la via neuro-simbolica al rischio accademico precoce

Un framework neuro-simbolico combina un predittore Transformer con regole F-Logic per individuare studenti a rischio nell'istruzione online. Su OULAD raggiunge accuratezza 0,900 e F1-score 0,894, con rilevamento medio alla settimana 9,32. L'elemento distintivo è la spiegabilità delle previsioni, non solo la performance.

2026-08-28 Fonte
📁 Frameworks AI generated

llama.cpp accelera su Qwen3.8-Flash-Next: 55 token/s con quattro RTX 3090

llama.cpp ha integrato il supporto per Qwen3.8-Flash-Next e una segnalazione comunitaria mostra 55 token/s con GGUF Q4 su quattro RTX 3090. Un test informale che sposta l’attenzione dal software all’hardware: per l’inference locale il costo e la complessità multi-GPU restano il nodo vero.

2026-08-28 Fonte
📁 Market AI generated

Nvidia verso l'acquisizione di Hugging Face: 13 miliardi per il repository dei modelli AI

Secondo un report, Nvidia starebbe per acquisire Hugging Face per 12,9 miliardi di dollari. La piattaforma è il repository di riferimento per modelli open: si scaricano, si eseguono e si rimette in circolo dopo il fine-tuning. Il controllo del catalogo da parte di un produttore di hardware solleva questioni strutturali su neutralità, dipendenza e deployment on-premise, più che una semplice partita finanziaria.

2026-08-27 Fonte
📁 Frameworks AI generated

Nvidia e Hugging Face: il futuro incerto di llama.cpp

Con l'acquisizione di Hugging Face, Nvidia potrebbe ottenere il copyright di llama.cpp e del team che lo sviluppa, sollevando dubbi sulla continuità del progetto open source. Il nodo non è il codice attuale ma il controllo su licenze e priorità future: per chi usa l'inference locale e self-hosted, il precedente di Redis e Minio rende concreto il rischio di cambi di rotta.

2026-08-27 Fonte
📁 LLM AI generated

Apodex 1.1: i modelli agentici aperti arrivano in più formati quantizzati

Il team di Apodex presenta un AMA su Apodex 1.1, famiglia di modelli aperti per lavoro agente complesso. Oltre ai checkpoint, rilascia un harness open source e due paper. I formati includono FP8, GPTQ-Int4 e NVFP4, segnale che l'inference locale entra nella progettazione agente.

2026-08-27 Fonte
📁 Frameworks AI generated

AMD salta da ROCm 7.14 a ROCm 10.0 e tenta di chiudere il caos delle versioni

AMD passa da ROCm 7.14 a ROCm 10.0 sotto il nome ROCm.AI dopo un periodo di release confuse tra rami stabili e tech preview. Per chi utilizza GPU AMD in contesti self-hosted, una major release chiara riduce l'incertezza su compatibilità, container e cicli di supporto, ma solleva interrogativi sui costi di migrazione. Il salto è un tentativo di ricostruire fiducia nel software oltre il confronto con CUDA.

2026-08-27 Fonte
📁 LLM AI generated

Apodex 1.1: modelli agentici aperti e quantization come segnale strategico

Il team di Apodex ha presentato Apodex 1.1, famiglia di modelli aperti pensata per lavoro complesso con ragionamento, ricerca, esecuzione di codice e coordinamento di più agenti. Accanto ai modelli, rilascia FrontierAgent e due paper. Le varianti NVFP4, GPTQ-Int4 e FP8 segnalano attenzione all'efficienza di inference e alla deployability locale, un aspetto chiave per chi valuta stack self-hosted e controllo dei dati.

2026-08-27 Fonte
📁 LLM AI generated

Qwen3.8-Flash-Next alza il livello per i benchmark locali

Un Mac Studio M4 Max con 128 GB di memoria unificata ha ospitato il test di Qwen3.8-Flash-Next, il primo modello dell'anno a superare il 94% sul benchmark personale di tolitius. Il modello da 27B eccelle nel coding ma perde in conoscenza generale contro Gemma 31B e Qwen 3.6 omlx. La Quantization mista 4_8bit su oMLX resta vicina al bfloat16 in perplexity, mentre la versione GGUF di Unsloth è sesta in classifica.

2026-08-27 Fonte
📁 Market AI generated

Perché un’acquisizione NVIDIA-Hugging Face inquieta l’open source

Un post su Reddit accende il nodo: se NVIDIA acquisisse Hugging Face, la neutralità della piattaforma open source entrerebbe in tensione. L'articolo non tratta un accordo confermato, ma ragiona su incentivi hardware, distribuzione dei modelli e governance del software. Per chi valuta stack locali, il punto non è solo chi possiede il repository, ma chi governa il passaggio tra modelli aperti e inference.

2026-08-27 Fonte
📁 LLM AI generated

GreenLeaf Law Embed Tiny: un embedding compatto per il retrieval giuridico

GreenLeaf Law Embed Tiny è un modello di embedding da 0,6 miliardi di parametri per il retrieval giuridico. Ottiene il 75,11% su MLEB e il 64,38% su MTEB Law. La pipeline unisce distillazione e fine-tuning con hard negative mining su 3,4 milioni di coppie query-passaggio. Il supporto a quantization BF16, INT8 e binaria facilita il deployment in ambienti con risorse limitate.

2026-08-27 Fonte
📁 Altro AI generated

Tesla in Cina passa a Doubao, il LLM di ByteDance, per gli smart cockpit

Tesla adotta Doubao, il modello linguistico di ByteDance, al posto di Grok nei sistemi di assistenza vocale per le auto vendute in Cina. Una scelta che va letta come vincolo operativo e di sovranità: per restare competitivi nel mercato cinese servono stack linguistici locali, con riflessi su fornitori, TCO e architetture di inference. Per chi gestisce flotte cloud o edge, il caso mostra quanto la scelta del fornitore LLM sia diventata un elemento geopolitico prima ancora che tecnico.

2026-08-27 Fonte