Topic / Trend Rising

Tecniche efficienti di ragionamento e post-training

I ricercatori stanno introducendo ricompense a livello di passo, obiettivi basati sull'entropia e quantization basata su gradiente per rendere ragionamento e retrieval più efficienti e affidabili. Questi metodi puntano su costo in token, lunghezza e qualità senza dover sempre aumentare la dimensione del modello.

Detected: 2026-09-07 · Updated: 2026-09-07

Articoli Correlati

2026-09-06 LocalLLaMA

TrueForge usa il 63% di token in meno dei managed agent a parità di task

Un benchmark su 14 task cross-system e tre server MCP mostra che TrueForge con Opus 4.8 risolve 11/14 task come Claude Managed Agents, ma consuma il 63% di token in meno e costa il 30% in meno per run. Con GLM-5.2 il costo scende a 3 dollari. Restano...

#Hardware #LLM On-Premise #DevOps
2026-09-03 ArXiv cs.CL

PRO-Step corregge il RAG multi-hop: premia ogni passo, non solo il risultato

PRO-Step introduce una supervisione a livello di passo per il Retrieval-Augmented Generation. Invece di valutare solo la risposta finale, un modello generativo di ricompensa controlla coerenza logica e aderenza alle evidenze in ogni fase del ragionam...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-02 ArXiv cs.LG

REAL-Q porta la discesa del gradiente nella quantization dei LLM

Un nuovo metodo di post-training quantization, REAL-Q, usa la discesa del gradiente a blocchi per ridurre fino a circa il 49% la divergenza KL end-to-end rispetto ai metodi di secondo ordine su LLaMA-3.1 e Qwen3 a W4A16. Un risultato che tocca i depl...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-02 ArXiv cs.LG

TPGC: prompt a doppio priore per il few-shot sui grafi

TPGC introduce una doppia inizializzazione dei prompt per il pre-training multi-task su grafi: un priore di task e uno strutturale estratti da un grafo ausiliario. Su sei benchmark di classificazione di nodi e grafi, il metodo supera le baseline in f...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic