Cloudflare ha annunciato l'implementazione della sua piattaforma server "Gen 13", basata sui processori AMD EPYC Turin. Grazie a questi processori di ultima generazione e a ottimizzazioni software, Cloudflare dichiara di aver raddoppiato il throughput e migliorato del 50% l'efficienza energetica.
AMD delinea la futura offerta enterprise con le CPU Venice basate su architettura Zen 6 e le GPU Verano. La roadmap include anche Helios e CDNA, delineando l'evoluzione dell'azienda nel mercato dei processori ad alte prestazioni per data center e applicazioni enterprise.
Recensione del MacBook Air 13 pollici con chip M5. L'articolo analizza le prestazioni del dispositivo, focalizzandosi sull'esperienza utente e sull'efficienza del nuovo processore. Non vengono forniti dettagli su specifiche hardware per inference LLM o considerazioni sul deployment on-premise.
Un dottorando in nanofotonica ha progettato un chip fotonico per accelerare la selezione dei blocchi nella KV cache, un collo di bottiglia nelle applicazioni di modelli linguistici di grandi dimensioni (LLM). La soluzione, denominata PRISM, promette prestazioni superiori e consumi energetici drasticamente inferiori rispetto alle scansioni GPU tradizionali, specialmente in scenari con contesti ampi.
L'aumento della densità di potenza, l'integrazione 3D e i nuovi materiali nei semiconduttori richiedono un'evoluzione della metrologia termica. Le misurazioni tradizionali non sono più sufficienti per affrontare le sfide poste dai nuovi requisiti di progettazione, in particolare per quanto riguarda l'affidabilità e la gestione del calore.
L'integrazione notturna per Mesa 26.1 abilita l'Arm Ethos U85 NPU all'interno del driver EthosU Gallium3D. Grazie al framework TEFLON di Mesa, sarà possibile gestire carichi di lavoro di intelligenza artificiale.
Una scheda RTX 5060 è sopravvissuta a un incendio domestico con il PCB intatto, nonostante lo shroud e le ventole completamente fusi. Dopo una pulizia e la sostituzione del sistema di raffreddamento, la scheda è tornata a funzionare. Un esempio di resilienza in condizioni estreme.
Groq, azienda specializzata in unità di elaborazione del linguaggio (LPU), ha scelto Samsung per la fabbricazione dei suoi chip. Questa decisione strategica è legata alla scalabilità e alle esigenze di inference di Groq, che punta a ottimizzare le prestazioni e l'efficienza energetica per carichi di lavoro di intelligenza artificiale.
La Cina sviluppa DeepLink, una tecnicia per aggregare potenza di calcolo AI da chip diversi. L'obiettivo è superare le limitazioni imposte dalle sanzioni sull'export di tecnicie avanzate, creando un'alternativa con risorse di calcolo eterogenee.
Tescan ha inaugurato un nuovo laboratorio dimostrativo a Seul, in Corea del Sud, per accelerare i test e la validazione di soluzioni di memoria per applicazioni di intelligenza artificiale e packaging avanzato. L'iniziativa mira a supportare più rapidamente i clienti nell'innovazione tecnicica.
Un post su Reddit celebra il ritorno in auge delle GPU dedicate (dGPU) per l'esecuzione di modelli linguistici di grandi dimensioni (LLM) in locale. La discussione sottolinea i vantaggi prestazionali e di controllo offerti dall'utilizzo di hardware dedicato per l'inference e il training di modelli AI, rispetto a soluzioni cloud o integrate.
Un utente ha sperimentato con un cluster di 9 GPU RTX 3090 per carichi di lavoro AI, riscontrando che scalare oltre 6 GPU porta a un degrado delle prestazioni a causa di limitazioni delle linee PCIe, problemi di stabilità e gestione termica. L'articolo evidenzia i trade-off tra l'utilizzo di servizi cloud e configurazioni locali per l'AI, sottolineando che l'hardware non è sempre la soluzione migliore.
Il CERN sviluppa chip AI dedicati per l'analisi dei dati scientifici, integrando l'intelligenza artificiale direttamente nel silicio per accelerare l'elaborazione ed eliminare i dati superflui. L'obiettivo è gestire l'enorme quantità di dati generata dagli esperimenti.
Il driver Direct Rendering Manager di Loongson, che gestisce il controller display sui SoC LS7A/LS2K, non è più senza manutentore. Nuovi ingegneri Loongson si sono fatti avanti per mantenere e sviluppare il codice.
Il presidente di TSMC, C.C. Wei, sottolinea come l'innovazione nella robotica sia intrinsecamente legata ai progressi nel campo dei semiconduttori. L'articolo evidenzia l'importanza del silicio come fondamento per lo sviluppo di sistemi robotici avanzati.
Delta Electronics si prepara a supportare i data center AI di prossima generazione con alimentazione a 800V DC e sistemi di raffreddamento a liquido. L'azienda mira a soddisfare le crescenti esigenze di potenza e raffreddamento delle infrastrutture dedicate all'intelligenza artificiale.
Sony introdurrà la frame generation basata su machine learning sulle console PlayStation. Questa funzionalità, pensata per migliorare le performance, potrebbe non essere disponibile prima del prossimo anno. La prima console a beneficiare di questa tecnicia dovrebbe essere la PlayStation 5 Pro.
La versione 7.0 del kernel Linux include una correzione per un bug che affliggeva le GPU AMD GCN 1.0 "Hainan". Il problema, segnalato nel 2021, causava blocchi del sistema. La patch verrà retro-portata anche alle versioni stabili del kernel Linux.
Un utente di Reddit chiede consigli sull'acquisto di hardware per l'esecuzione di modelli linguistici di grandi dimensioni (LLM) in locale. La discussione verte sull'usabilità, le velocità di elaborazione e il confronto tra l'utilizzo di un singolo modello di grandi dimensioni rispetto a più modelli più piccoli. La domanda solleva considerazioni importanti per chi desidera gestire carichi di lavoro AI on-premise.
Intel afferma di aver tentato più volte di collaborare con lo sviluppatore di Crimson Desert per l'utilizzo delle GPU Arc. L'azienda sostiene di aver fornito hardware, driver e risorse ingegneristiche in anticipo, ma senza successo.