Topic / Trend Stable

Benchmark IA e Valutazione Specialistica

Nuovi studi testano gli LLM su riassunti a contesto lungo, retrieval con BM25, gemelli digitali, previsioni epidemiche, decodifica neurale, riconoscimento di software scientifici e ricerca autonoma.

Detected: 2026-08-25 · Updated: 2026-08-25

Articoli Correlati

2026-08-25 ArXiv cs.CL

Khmer, il retrieval semantico premia ancora il vecchio BM25

Uno studio su 3.000 documenti khmer mostra che BM25 supera dense retrieval e query expansion con Qwen2.5. Il modello più grande produce espansioni migliori, ma introduce comunque rumore. Un segnale per chi costruisce ricerca locale a basso costo.

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-23 LocalLLaMA

Fine-tuning di un VLM da 450M: da 1 a 44 su 100 con screenshot browser

Un VLM da 450 milioni di parametri passa da 1 a 44 su un punteggio di 100 dopo fine-tuning su 50.000 screenshot di browser. La fonte non specifica metrica o infrastruttura, ma il salto mostra che modelli compatti possono diventare utilizzabili su dat...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-21 ArXiv cs.CL

SNAIL: il riconoscimento di software bioinformatici batte gli LLM generici

Un framework ibrido combina segnali lessicali e semantiche SciBERT per identificare software e database nella letteratura biomedica. Addestrato con una pipeline che unisce estrazione citazionale e distillazione assistita da LLM, supera metodi special...

#Hardware #Fine-Tuning
2026-08-20 Microsoft Research

Skala 1.1 allarga l'accesso ai codici DFT e introduce benchmark vivi

Microsoft Research ha rilasciato Skala 1.1, funzionale exchange-correlation basato su deep learning. Addestrato su 2,5 volte più dati, riduce l'errore medio pesato a 2,8 kcal/mol su GMTKN55 mantenendo un costo da meta-GGA. L'integrazione nativa in CP...

#Hardware #LLM On-Premise #DevOps
2026-08-18 MIT Technology Review

L'AI che si migliora da sola? Prima deve imparare a fare ricerca

Uno studio multi-ateneo guidato da Princeton ha messo alla prova Claude Opus 4.8 su domande di ricerca originali destinate a NeurIPS 2026. Gli agenti hanno gestito l'ingegneria, ma non il giudizio e la creatività necessari per una ricerca aperta: ent...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic