Topic / Trend Rising

Agenti IA autonomi e flussi di lavoro agentici

Ricerca e strumenti stanno andando oltre la singola risposta verso agenti LLM che eseguono codice, iterano sugli errori, controllano hardware e coordinano obiettivi in conflitto. Benchmark e framework valutano sempre più autonomia, costi e stabilità in compiti reali.

Detected: 2026-08-16 · Updated: 2026-08-16

Articoli Correlati

2026-08-16 LocalLLaMA

Qwen3.8-27B: la chiusura del loop visivo sposta il valore on-premise

Un confronto amatoriale tra Qwen3.6-27B e Qwen3.8-27B su un ray tracer in BASIC mostra una differenza decisiva: la capacità di osservare il rendering e correggere il codice in autonomia. Con quantization spinta e hardware locale, il ciclo chiuso ridu...

2026-08-16 LocalLLaMA

Qwen3.8-27B batte Qwen3.6-27B nell'iterazione autonoma su ray tracer BASIC

Un appassionato ha confrontato due LLM da 27 miliardi di parametri con quantization unsloth UD-Q8_K_XL in un harness agentico: scrivere un ray tracer ricorsivo in BASIC, eseguirlo, guardare l'immagine e iterare. Qwen3.6 richiedeva interventi umani qu...

#Hardware #LLM On-Premise #DevOps
2026-08-15 LocalLLaMA

Qwen3.8-27B in ufficio genera un clone di Super Mario in un colpo solo

Un modello locale su Framework Desktop con quantization Q8 GGUF genera al primo tentativo un clone di Super Mario. Non è veloce, ma abbastanza intelligente per batch notturni e lavori in background. Il caso solleva questioni concrete su velocità, acc...

#Hardware #LLM On-Premise #DevOps
2026-08-14 ArXiv cs.CL

Auto-riflessione LLM: contano le azioni, non le domande o le tassonomie

Uno studio controllato a sei condizioni smonta un'assunzione diffusa: il valore dell'auto-riflessione nei LLM non arriva da domande diagnostiche o vocabolari di incertezza, ma dal routing tipizzato delle azioni. I dati mostrano guadagni consistenti e...

#LLM On-Premise #DevOps
2026-08-13 ArXiv cs.CL

Backtrader-Bench: il benchmark che costringe gli LLM a eseguire codice

Backtrader-Bench introduce due pipeline per valutare agenti LLM nel trading algoritmico: una genera quesiti a risposta multipla da configurazioni di backtest con verifica indipendente, l'altra estrae domande più difficili che richiedono esecuzione di...

#LLM On-Premise #Fine-Tuning
2026-08-13 ArXiv cs.AI

Distribird porta la calibrazione bayesiana su LLM locali e open-weight

Distribird è un'applicazione agentica che automatizza la costruzione di prior bayesiani dalla letteratura, girando interamente in locale con modelli open-weight. Valutata su 24 parametri in 10 domini, la pipeline multi-agente eguaglia una baseline LL...

#Hardware #LLM On-Premise #DevOps
2026-08-13 ArXiv cs.AI

Governare LLM in conflitto: il controllo che evita il collasso del dialogo

Due agenti LLM con obiettivi opposti non competono: collassano. Experience Orchestrator, testato in 60.000 simulazioni in servizi finanziari, aggiunge un livello di controllo con Contextual Bandit, PID e POMDP. Il tasso di contatto ad alto intento sa...

#Hardware #LLM On-Premise #DevOps
2026-08-12 ArXiv cs.CL

LLM Agents Factory: la fabbrica di agenti che riduce i costi di inference

Un framework basato su retrieval e distillazione consente di costruire agenti LLM specializzati senza generazione al volo, riducendo drasticamente i costi computazionali e migliorando la stabilità. I test mostrano accuratezza paragonabile ad AutoGen ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-12 ArXiv cs.AI

Guida autonoma per serre: l’LLM riduce energia e tempi del 35–68%

Un sistema a ciclo chiuso, basato su un LLM che elabora i dati di 49 sensori fitotecnicici e comanda luci e microclima, ha ottimizzato in autonomia una vertical farm. Il modello ha ridotto il ciclo produttivo del 35% e scoperto una strategia improbab...

#Hardware #DevOps
← Torna ai Topic