Non c'è un annuncio, non c'è una scheda tecnica, non c'è ancora un checkpoint da scaricare. C'è un commit nel repository di ms-swift, il framework per il fine-tuning e il deployment di LLM, che contiene la stringa Qwen 3.8 35BA3B. Per chi segue le mosse di Alibaba nel rilascio di modelli open-weight, è il genere di indizio che di solito precede di poco una novità concreta.
Il nome 35BA3B non è neutro. Dentro il codice sorgente di un framework, una stringa del genere serve a registrare architettura, dimensioni e variante. Il 35B suggerisce una scala da 35 miliardi di parametri complessivi; A3B richiama la convenzione dei modelli mixture-of-experts, con una frazione di parametri attivi per token. In pratica, il checkpoint potrebbe pesare come un modello da 35 miliardi, ma il costo computazionale per singolo passo di inference sarebbe più vicino a quello di un modello attivo da 3 miliardi.
Il punto non è se arriverà, ma come cambierebbe i conti di chi porta i modelli dentro i propri server. Un MoE con molti parametri totali e pochi attivi ha implicazioni opposte su due fronti: memoria e calcolo. Tutti gli esperti vanno caricati in VRAM, quindi il requisito di memoria resta legato al totale; ogni token, però, attiva solo una parte della rete, con un beneficio diretto su latenza e throughput per le architetture che riescono a sfruttare il routing. In un contesto self-hosted, questo sposta l'attenzione dalla sola capacità della GPU alla banda di memoria e all'efficienza del serving layer, perché un modello MoE mal servito può sprecare proprio il vantaggio che promette.
La presenza in ms-swift ha un valore diverso da un leak di marketing. Non è un poster: è un punto di integrazione. Il framework viene usato per addestrare, quantizzare e distribuire modelli in ambienti diversi, quindi il commit segnala che qualcuno sta già predisponendo il supporto tecnico, non solo la notizia. Per chi valuta deployment on-premise, AI-RADAR offre framework analitici su /llm-onpremise per soppesare questi trade-off.
Il nome 3.8, poi, apre un interrogativo: è una variante intermedia di Qwen3 o un ramo parallelo? La fonte non lo dice. E proprio questo silenzio, unito alla stringa nel codice, rende il segnale più interessante di molti annunci confezionati.
💬 Commenti (0)
🔒 Accedi o registrati per commentare gli articoli.
Nessun commento ancora. Sii il primo a commentare!