Topic / Trend Rising

Modelli aperti compatti ed efficienza dei dati

LLM aperti compatti sotto i 4B-10B parametri e i risultati BabyLM mostrano progressi legati a organizzazione dei dati, architettura e addestramento su singola GPU piuttosto che alla sola scala dei parametri.

Detected: 2026-09-13 · Updated: 2026-09-13

Articoli Correlati

2026-09-13 LocalLLaMA

Un LLM denso da 9,4B pronto per il training su una sola scheda

Un ricercatore indipendente ha reso pubblico un modello da circa 9,4 miliardi di parametri, pensato per l'addestramento su una singola scheda. Il progetto include architetture ispirate a Moonshot e una distillazione da Llama 3, con il training già av...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-11 ArXiv cs.CL

BabyLM 2026: il metodo che impara da 10 milioni di parole e cambia i vincoli

Qiushi Engine ha condotto un programma di ricerca autonomo su BabyLM 2026 Strict-Small, con 10 milioni di parole e 100 milioni di presentazioni cumulative. Tre fasi hanno unito avanzamento, scoperta di principi e miglioramento guidato. L'Overall sale...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-07 LocalLLaMA

MiniCPM5-2B: OpenBMB guida i modelli open weights sotto i 4B

OpenBMB ha pubblicato MiniCPM5-2B, un modello open weights da 2 miliardi di parametri che ottiene 15 sull'Artificial Analysis Intelligence Index v4.2, il punteggio più alto tra i modelli aperti fino a 4B. Il risultato interessa chi valuta deployment ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-06 LocalLLaMA

Spark-X2.5 in GGUF: llama.cpp apre la strada ai modelli compatti da 1M token

Una pull request su llama.cpp introduce il supporto per Spark-X2.5, due LLM compatti da 4B e 1.7B parametri, con contesto nativo fino a 1M token e architettura ibrida a finestra scorrevole. La mossa abbassa la soglia per l'inference locale e self-hos...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic