Inkling-Small porta il contesto da 1 milione di token sulle GPU locali, ma il vero collo di bottiglia resta la memoria
thinkingmachines ha rilasciato Inkling-Small, un LLM a mistura di esperti con 276 miliardi di parametri e soli 12 miliardi attivi, finestra di contesto da 1 milione di token e quantizzazioni NVFP4 e GGUF. L'analisi AI-RADAR mette a fuoco il nodo nasc...