La leva runtime che porta un LLM da 27B a 100k token su 16 GB
Un setup su Reddit mostra un modello dense da 27 miliardi di parametri a 47-50 token/s con contesto da 100.000 token su una RTX 4070 Ti SUPER da 16 GB. Il segnale non è il modello, ma il controllo fine del runtime: cache KV asimmetrica kvarn5/kvarn4,...