RTX 5090でFreeTokenを試してみた。35Bでは不要、120B級MoEでは話が変わる
2026年8月22日時点のFreeToken 0.1.2を、RTX 5090 32GBとRAM 128GBのPCで試しました。 FreeTokenは、Mixture-of-Experts(MoE)モデルのexpertをホストRAMへ置き、必要なexpertだけをGPUへキャッシュしながら推論するサービングエンジンです。狙いはvLLMやllama.cppを単純に高速化することではなく、VRAMに収まらない巨...
はてなテクノロジー
2026年08月22日 10:40