🏷️ LLM On-Premise

60 articoli con questo tag · tutti i tag

Qwen3.8-27B batte Qwen3.6-27B nell'iterazione autonoma su ray tracer BASIC
LLM Qwen3.8-27B batte Qwen3.6-27B nell'iterazione autonoma su ray tracer BASIC 2026-08-16
Qwen3.8-27B in ufficio genera un clone di Super Mario in un colpo solo
Altro Qwen3.8-27B in ufficio genera un clone di Super Mario in un colpo solo 2026-08-15
RustConn 0.20 rifinisce il client GTK4: la gestione remota on-premise diventa meno ruvida
Altro RustConn 0.20 rifinisce il client GTK4: la gestione remota on-premise diventa meno ruvida 2026-08-15
KDE Plasma 6.8 aggiunge la regolazione fine della velocità di mouse e touchpad
Frameworks KDE Plasma 6.8 aggiunge la regolazione fine della velocità di mouse e touchpad 2026-08-15
Debian al voto sull'uso dei LLM: il bivio tra automazione e fiducia
LLM Debian al voto sull'uso dei LLM: il bivio tra automazione e fiducia 2026-08-15
Qwen 3.8 35BA3B spunta in un commit: il segnale prima del lancio
LLM Qwen 3.8 35BA3B spunta in un commit: il segnale prima del lancio 2026-08-15
Qwen 3.8 27B: il giorno del rilascio e la corsa dei formati locali
LLM Qwen 3.8 27B: il giorno del rilascio e la corsa dei formati locali 2026-08-15
Lemonade 11.6 integra Muse-Glimmer 30B e la generazione immagini ROCm sperimentale
Frameworks Lemonade 11.6 integra Muse-Glimmer 30B e la generazione immagini ROCm sperimentale 2026-08-14
Auto-riflessione LLM: contano le azioni, non le domande o le tassonomie
LLM Auto-riflessione LLM: contano le azioni, non le domande o le tassonomie 2026-08-14
Doom dentro un LLM: 34 GB di checkpoint e rendering via token
Hardware Doom dentro un LLM: 34 GB di checkpoint e rendering via token 2026-08-13
Writer punta sul contenimento dei costi token con un nuovo LLM basato su GLM-5.2
LLM Writer punta sul contenimento dei costi token con un nuovo LLM basato su GLM-5.2 2026-08-13
DeepSeek V4 Pro 0813 su Hugging Face: un nome non basta
LLM DeepSeek V4 Pro 0813 su Hugging Face: un nome non basta 2026-08-13
Qwen apre il countdown ufficiale per Qwen3.8-27B su Hugging Face
LLM Qwen apre il countdown ufficiale per Qwen3.8-27B su Hugging Face 2026-08-13
Nvidia raddoppia la RTX PRO 6000 Blackwell: on-premise più caro
Hardware Nvidia raddoppia la RTX PRO 6000 Blackwell: on-premise più caro 2026-08-13
Retrofit ricorrente nei LLM: pensiero latente più veloce, ma con confini netti
LLM Retrofit ricorrente nei LLM: pensiero latente più veloce, ma con confini netti 2026-08-13
Backtrader-Bench: il benchmark che costringe gli LLM a eseguire codice
Frameworks Backtrader-Bench: il benchmark che costringe gli LLM a eseguire codice 2026-08-13
Rilevatori AI e integrità accademica: il paradosso che punisce l’uso trasparente
Altro Rilevatori AI e integrità accademica: il paradosso che punisce l’uso trasparente 2026-08-13
Distribird porta la calibrazione bayesiana su LLM locali e open-weight
Altro Distribird porta la calibrazione bayesiana su LLM locali e open-weight 2026-08-13
Governare LLM in conflitto: il controllo che evita il collasso del dialogo
Frameworks Governare LLM in conflitto: il controllo che evita il collasso del dialogo 2026-08-13
Comma.ai lancia il dock Chestnut con GPU AMD e firmware open source
Hardware Comma.ai lancia il dock Chestnut con GPU AMD e firmware open source 2026-08-13
Attacco supply-chain a LiteLLM: terabyte di credenziali esposte
Altro Attacco supply-chain a LiteLLM: terabyte di credenziali esposte 2026-08-12
Allarme sicurezza IA: ad Ai4 Hinton, Li e Ng discutono il valore dell'apertura
Altro Allarme sicurezza IA: ad Ai4 Hinton, Li e Ng discutono il valore dell'apertura 2026-08-12
Linux sblocca la grafica ibrida sui MacBook Pro 2018-19: un vantaggio (anche) per chi fa inference locale
Hardware Linux sblocca la grafica ibrida sui MacBook Pro 2018-19: un vantaggio (anche) per chi fa inference locale 2026-08-12
Decifrati i ragionamenti segreti di Claude e GPT: cosa cambia
Altro Decifrati i ragionamenti segreti di Claude e GPT: cosa cambia 2026-08-12
LACT 0.10: overclock NVIDIA e sensori Blackwell per chi spinge le GPU Linux
Hardware LACT 0.10: overclock NVIDIA e sensori Blackwell per chi spinge le GPU Linux 2026-08-12
Intel LLM-Scaler e Muse Glimmer: inference locale su GPU Arc (Pro) B si semplifica
Frameworks Intel LLM-Scaler e Muse Glimmer: inference locale su GPU Arc (Pro) B si semplifica 2026-08-12
AMD: gli agenti IA spingeranno il rapporto CPU-GPU verso l'1:1
Hardware AMD: gli agenti IA spingeranno il rapporto CPU-GPU verso l'1:1 2026-08-12
L’UE impone la filigrana anche ai modelli locali: cosa cambia per l’AI open source
Altro L’UE impone la filigrana anche ai modelli locali: cosa cambia per l’AI open source 2026-08-12
Robuste per il conflitto, deboli per la morale: le pipeline LLM alla prova dei titoli francesi
LLM Robuste per il conflitto, deboli per la morale: le pipeline LLM alla prova dei titoli francesi 2026-08-12
LLM Agents Factory: la fabbrica di agenti che riduce i costi di inference
Frameworks LLM Agents Factory: la fabbrica di agenti che riduce i costi di inference 2026-08-12
Reti neurali random più robuste: il fuzzy intuitionistico contro dati rumorosi
Frameworks Reti neurali random più robuste: il fuzzy intuitionistico contro dati rumorosi 2026-08-12
Come la topologia svela l'evoluzione interna dei Transformer
LLM Come la topologia svela l'evoluzione interna dei Transformer 2026-08-12
Unsloth Desktop porta il training in locale: 2× più veloce, 70% VRAM in meno
Altro Unsloth Desktop porta il training in locale: 2× più veloce, 70% VRAM in meno 2026-08-11
Nemotron-3.5 Lightning: la scommessa di NVIDIA sull'efficienza per l'inference locale
LLM Nemotron-3.5 Lightning: la scommessa di NVIDIA sull'efficienza per l'inference locale 2026-08-11
FastFlowLM 1.0: AMD unifica l’AI su NPU sotto l’ombrello ROCm
Frameworks FastFlowLM 1.0: AMD unifica l’AI su NPU sotto l’ombrello ROCm 2026-08-11
Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi
LLM Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi 2026-08-11
LLM e gestione rifiuti: WuYuEval svela i limiti dell'AI generalista
LLM LLM e gestione rifiuti: WuYuEval svela i limiti dell'AI generalista 2026-08-11
Fuzzing adattivo svela le crepe delle MLLM: perché l’allucinazione resiste ai benchmark statici
Frameworks Fuzzing adattivo svela le crepe delle MLLM: perché l’allucinazione resiste ai benchmark statici 2026-08-11
Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile
LLM Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile 2026-08-11
Linux: il driver open-source NVIDIA ‘Nova’ guadagna funzionalità con Rust
Hardware Linux: il driver open-source NVIDIA ‘Nova’ guadagna funzionalità con Rust 2026-08-11
Fedora CoreOS attiva systemd-oomd e swap su zRAM: un segnale per chi fa inference on-premise
Altro Fedora CoreOS attiva systemd-oomd e swap su zRAM: un segnale per chi fa inference on-premise 2026-08-10
Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook
Altro Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook 2026-08-10
Agenti AI on-device: Meta porta Muse Glimmer su ExecuTorch con decoding speculativo e 128K contesto
Altro Agenti AI on-device: Meta porta Muse Glimmer su ExecuTorch con decoding speculativo e 128K contesto 2026-08-10
Muse-Glimmer-30B in GGUF: l'ultimo tassello di un ecosistema locale sempre più maturo
LLM Muse-Glimmer-30B in GGUF: l'ultimo tassello di un ecosistema locale sempre più maturo 2026-08-10
Meta Muse Glimmer: agenti AI locali su GPU consumer, il nuovo modello da 30 miliardi di parametri
LLM Meta Muse Glimmer: agenti AI locali su GPU consumer, il nuovo modello da 30 miliardi di parametri 2026-08-10
Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud
LLM Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud 2026-08-10
Linux 7.3 elimina i driver SGI: sicurezza e rumore degli agenti AI spingono la potatura del kernel
Altro Linux 7.3 elimina i driver SGI: sicurezza e rumore degli agenti AI spingono la potatura del kernel 2026-08-10
Niente cloud, solo edge: Edgify alza 9 milioni per l’AI che impara sui dispositivi
Altro Niente cloud, solo edge: Edgify alza 9 milioni per l’AI che impara sui dispositivi 2026-08-10
Il symlink ereditato e la manutenzione del debito tecnico: cosa insegna l’hack di Walter
Altro Il symlink ereditato e la manutenzione del debito tecnico: cosa insegna l’hack di Walter 2026-08-10
TEXAS usa il routing nativo dei MoE per un fine-tuning più chirurgico
LLM TEXAS usa il routing nativo dei MoE per un fine-tuning più chirurgico 2026-08-10
La verità è un vettore: individuare fake news senza uscire dal modello
LLM La verità è un vettore: individuare fake news senza uscire dal modello 2026-08-10
WeatherNext 2: DeepMind porta le previsioni dei cicloni su una singola GPU H100
Hardware WeatherNext 2: DeepMind porta le previsioni dei cicloni su una singola GPU H100 2026-08-09
BDH: scalabilità GPT-2 su GPU normali, la sfida post-transformer di Pathway
LLM BDH: scalabilità GPT-2 su GPU normali, la sfida post-transformer di Pathway 2026-08-09
DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s
Frameworks DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s 2026-08-09
Lophius: il workbench per l’esplorazione dei trasformer che viene dal creatore di Heretic
Frameworks Lophius: il workbench per l’esplorazione dei trasformer che viene dal creatore di Heretic 2026-08-09
Die nudo e blocco 3D: RTX 2060 Super a 28°C sotto carico
Hardware Die nudo e blocco 3D: RTX 2060 Super a 28°C sotto carico 2026-08-09
Meetily trascrive e riassume riunioni senza abbonamento, open source. Ecco come
Altro Meetily trascrive e riassume riunioni senza abbonamento, open source. Ecco come 2026-08-09
Quando l’AI scrive i driver: DeepSeek genera il kernel Metal per Kimi K2 su Mac
Altro Quando l’AI scrive i driver: DeepSeek genera il kernel Metal per Kimi K2 su Mac 2026-08-09
Kimi K3 scende a 478 GB: la sforbiciata multilingua che cambia i conti dell’on-premise
LLM Kimi K3 scende a 478 GB: la sforbiciata multilingua che cambia i conti dell’on-premise 2026-08-09
BitNet a 36 tok/s su Xeon: zero dipendenze, tutto C, e il soffitto della DRAM
Frameworks BitNet a 36 tok/s su Xeon: zero dipendenze, tutto C, e il soffitto della DRAM 2026-08-08