RTX 5090でFreeTokenを試してみた。35Bでは不要、120B級MoEでは話が変わる 2026年8月22日時点のFreeToken 0.1.2を、RTX 5090 32GBとRAM 128GBのPCで試しました。 FreeTokenは、Mixture-of-Experts(MoE)モデルのexpertをホストRAMへ置き、必要なexpertだけをGPUへキャッシュしながら推論するサービングエンジンです。狙いはvLLMやllama.cppを単純に高速化することではなく、VRAMに収まらない巨... はてなテクノロジー 2026年08月22日 10:40