Topic / Trend Stable

Applicazioni e valutazione dei LLM in domini specifici

I LLM vengono impiegati in previsioni meteo, controllo di serre, gestione rifiuti, trading e calibrazione scientifica, con benchmark specializzati e sperimentazioni che mostrano sia vantaggi sia limiti. Gli stress test rivelano che i modelli generalisti possono degradare in condizioni complesse specifiche di dominio.

Detected: 2026-08-15 · Updated: 2026-08-15

Articoli Correlati

2026-08-13 ArXiv cs.CL

Backtrader-Bench: il benchmark che costringe gli LLM a eseguire codice

Backtrader-Bench introduce due pipeline per valutare agenti LLM nel trading algoritmico: una genera quesiti a risposta multipla da configurazioni di backtest con verifica indipendente, l'altra estrae domande più difficili che richiedono esecuzione di...

#LLM On-Premise #Fine-Tuning
2026-08-13 ArXiv cs.AI

Distribird porta la calibrazione bayesiana su LLM locali e open-weight

Distribird è un'applicazione agentica che automatizza la costruzione di prior bayesiani dalla letteratura, girando interamente in locale con modelli open-weight. Valutata su 24 parametri in 10 domini, la pipeline multi-agente eguaglia una baseline LL...

#Hardware #LLM On-Premise #DevOps
2026-08-13 ArXiv cs.AI

Governare LLM in conflitto: il controllo che evita il collasso del dialogo

Due agenti LLM con obiettivi opposti non competono: collassano. Experience Orchestrator, testato in 60.000 simulazioni in servizi finanziari, aggiunge un livello di controllo con Contextual Bandit, PID e POMDP. Il tasso di contatto ad alto intento sa...

#Hardware #LLM On-Premise #DevOps
2026-08-12 ArXiv cs.AI

Guida autonoma per serre: l’LLM riduce energia e tempi del 35–68%

Un sistema a ciclo chiuso, basato su un LLM che elabora i dati di 49 sensori fitotecnicici e comanda luci e microclima, ha ottimizzato in autonomia una vertical farm. Il modello ha ridotto il ciclo produttivo del 35% e scoperto una strategia improbab...

#Hardware #DevOps
2026-08-11 ArXiv cs.CL

LLM e gestione rifiuti: WuYuEval svela i limiti dell'AI generalista

Un benchmark dedicato mette alla prova 33 Large Language Model su compiti di gestione dei rifiuti solidi. Il migliore sfiora il 95% di accuratezza nelle domande semplici, ma in quelle complesse la media crolla al 42,5%. Calcolo, progettazione sperime...

#LLM On-Premise #Fine-Tuning #DevOps
← Torna ai Topic