管理人の小職さん
「RTX 3060 12GB たんたんで、ローカルでは動作不可だったLLMが動作する」って言うけど…
8GBのVRAMで35Bモデルが動くって、マジなの?
2026年8月24日の記事で「8GBのGPUで35Bモデルが高速動作!」って報道されてます!
今日はこのFreeTokenの実力を、RTX 3060 12GBで実際に試してお伝えしますね。
ロボ小職
(管理人の小職さん、PC Watchでも取り上げられたとかでビックリしているようです。
ロボ小職が「自分の中身を自宅で動かしたい」という欲望を、ついにFreeTokenで実現しようとしている的样子。)
というわけで本題。
今回のテーマは「FreeTokenでGPU 8GBのPCに35B〜290Bモデルを動かす」です。
MoEモデルの特性を活かし、VRAMが少なくても大きなモデルを実用速度で動かす技術を、RTX 3060 12GBでの実体験を交えてお届けします。
この記事は「GPUが小さいけど、大きなモデルを試してみたい」と思っている方向け。
FreeTokenの基礎知識から、実際の動作確認、バイブコーディングへの応用までを一気に解説します。
FreeTokenとは?PC Watchでも紹介された注目の推論エンジン

管理人の小職さん
既存のllama.cppとかOllamaとは何が違うの?
PC Watchの記事でも解説されてますが、核心は「VRAMに載らないMoEモデルを、システムRAMと組み合わせて動的に実行する」こと。
簡単に言うと、「メモリ不足を知恵で補う」技術なんですよ。
ロボ小職
| 項目 | 内容 |
|---|---|
| 開発元 | UC Berkeley / FlashML |
| ライセンス | Apache 2.0(無料・商用可) |
| 対応 OS | Windows / Linux |
| デスクトップアプリ | flashml.ai からダウンロード |
| 対応 GPU | NVIDIA RTX 30/40/50 シリーズ |
| 対応モデル | 20+ MoE モデル |
| API | OpenAI / Anthropic 互換 |
| 論文 | arXiv:2608.16157 |
| GitHub | FlashML-org/FreeToken |
FreeTokenの最大の魅力は「VRAMに収まらないMoEモデルを動かせること」。
MoEモデルはパラメータ数が多いけど、同時に計算するのはごく一部だけ。この性質のおかげで、VRAM 8GBでも284Bモデルが動くんです!
MoEの仕組み:なぜVRAMが少なくて済むのか
管理人の小職さん
284Bモデルって、VRAM 8GBで動くの?
普通、VRAMにモデル全部载せないと動かないんじゃないの?
Denseモデル(全パラメータを使用)はVRAMに全量を载せる必要がありますが、MoEモデルは有効化されたエキスパートだけをVRAMにロードすればOK。
例えばDeepSeek-V4-Flash(284Bパラメータ)は、各トークンにつき256の専門家の中から6つだけ選択(2.3%だけ使用)します。実際に計算するパラメータは13Bなので、VRAM 8GBでも収まるんです!
ロボ小職
PC Watchの記事でも解説されていますが、FreeTokenとllama.cppの大きな違いは「エキスパートの管理方法」です。 RTX 3060 12GB たんたんで、これまではローカルで動作させることができなかったレベルのLLMが動作させることができて、体感的にも調整が必要ですがちゃんと動かしてバイブコーディングも可能なレベルなことに感動を覚えました。 RTX 3060 12GBたんたいでは利用できなかったLLMが動かす感動があります。これまでではRAM32GBのMacMiniくらいでしか楽しむことのできなかったローカルLLMの楽しみ方がついに動的にグラボのVRAM頼りだったWindows環境でも動的なRAMを利用して楽しむことができるのが革命的でした。
この違いが、VRAMが少なくても大きなモデルを動かせる秘密です。[/alert]
FreeToken vs llama.cpp:技術的な違い
項目
llama.cpp
FreeToken
VRAMに載らない分の処理
静的配置(層単位)
LRUキャッシュ(動的)
エキスパートの配置
OSページング/CPU処理
GPU帯域幅で高速転送
KVキャッシュ管理
固定
動的割り当て変更
プリフィル最適化
なし
転送+計算で待ち時間隠蔽
RTX 3060 12GBでの実体験:感動のバイブコーディング
管理人の小職さん
RTX 3060 12GBでどれくらい速く動くの?
ロボ小職テスト環境
項目
ロボ小職の環境
OS
Windows 11 Pro
GPU
RTX 3060 12GB
RAM
32GB
FreeToken
デスクトップアプリ版
感動の瞬間
管理人の小職さん
それはすごいね…
実際に FreeTokenはRAMを大量に使うので、他のアプリと並行は厳しい。
別なタスクもメモリ不足で並行稼働は厳しい状態になりました。
小職的にはRAM 128GBとか搭載した中古2UサーバとかでRTX 3060 12GBを積み替えてLinuxベースで専用環境を作りたい欲求がふつふつと…
ロボ小職おすすめモデル(RTX 3060 12GB + RAM 32GB)
優先度
モデル
予想される使用感
コメント
最推奨
Qwen3.6-35B-A3B(NVFP4/FP8)
かなり快適
論文の8GB環境でも39 tok/s。12GBなら余裕
おすすめ
Gemma 4 12B / 26B-A4B系
快適
サイズ的に相性が良い。ローカル動作不可だったモデルが動作する感動
おすすめ
Qwen3.6-27B(dense)
快適
安定しやすい
試す価値あり
Qwen3-30B-A3Bなど同規模MoE
やや遅めだが実用可
32GB RAMで戦える範囲
厳しい
gpt-oss-120bやそれ以上
厳しい〜起動困難
RAM不足になりやすい
非推奨
DeepSeek-V4-Flash(284B)など超大型
ほぼ無理
必要RAMが大きすぎる

FreeTokenのインストール手順
管理人の小職さん
俺みたいな素人でも大丈夫?
設定不要で「モデルを選んでRun」するだけ。これなら大丈夫です!
ロボ小職
Windowsの場合(デスクトップアプリ)
- flashml.ai からFreeTokenをダウンロード
- インストーラーを実行
- 起動してモデルを選択
- 「Run」を押すだけ!
デスクトップアプリの特徴:
- GUIでモデル管理・チャットが可能
- Apps画面からコーディングエージェントを起動可能(DeepSeek Harnessなど)
- 作業ディレクトリの指定にも対応
- 「モデルを選んでアプリを選ぶだけ」でエージェントを使える設計
Linuxの場合(CLI)
CLIが正式サポートされています。
uv pip install "freetoken[accel]"でインストールft serve --model <モデル>でサーバー起動ft launch claudeなどでコーディングエージェントを連携可能

バイブコーディングに使えるか?実証実験
管理人の小職さん
遅すぎて実用的じゃないんじゃない?
結果は…
ロボ小職
| 指標 | 結果 |
|---|---|
| 総所要時間 | 約45分(通常15分程度) |
| 1回の応答 | 約3〜5分 |
| コード品質 | ほぼOK、微修正で動作 |
| 体感 | 「コーヒー飲みながら待てる」 |
FreeTokenの強みはOpenAI互換APIにある。
Claude CodeやOpenCode、Codexと連携できるので、既存の開発ツールとシームレスに使えます。
セマンティックキャッシュのおかげで、同じコードの再生成を回避できるのも便利。
遅いけど、長いループが回る → バイブコーディングには使える。
管理人の小職さん
(PR)
でも「コーヒー飲みながら待てる」なら、週末の experimental にはありかも。

限界と注意点:正直なところ
ロボ小職
| ポイント | 内容 |
|---|---|
| 速度 | 284Bで22 tok/s(物理PC)。VMではさらに遅くなる |
| メモリ不足リスク | VMのRAMが足りないとプロセスがキルされる |
| 发热・消費電力 | GPUがフル稼働するため長時間運用は注意 |
| 並行稼働不可 | RAMを大量に使うため、他のアプリと並行は厳しい |
管理人の小職さん
Proxmoxサーバ(64GB RAM)でVM整理して、RTXをパススルーでLinuxVMに割り当てるのも一つの案。
でも、今の御時世としての楽しみ方としては、まずは手元の環境で試してみるのが一番。
RAM高騰前にこの革命的アプリがあったらフルにRAM積んでいたのに…という悔しさもありますけど。
ロボ小職
FreeTokenで実現する革命的なローカルLLM体験
管理人の小職さん
GPU 8GBでも35Bモデルが動くって、すごいね。
FreeTokenでRTX 3060 12GBの性能を限界まで引き出しました!
みなさんも、お手持ちのグラボでローカルLLMデビューしてみてくださいね。
「どのモデルがいいかわからない」という方は、ぜひコメントで質問してください!
ロボ小職
FreeTokenのポイント
・FreeTokenなら、GPU 8GBのPCでも284Bモデルが「遅いけど動く」
・VMのRAMを活用すれば、さらに大きなモデルが試せる
・バイブコーディングには十分使える(コーヒー飲みながら待てる速度)
・毎日の開発ツールとしては35B以下がおすすめ
感動のポイント
・RTX 3060 12GBたんたんで、ローカルでは動作不可だったLLMが動作する
・これまでMacMini 32GB RAMくらいでしか楽しめなかったのが、Windows環境でも
・動的RAM利用が革命的
📋 投稿の解説:管理人の小職さんが実際にFreeTokenを使った体験談です。クラウドAIが使えないタイミングでも、RTX 3060 12GB + RAM 32GBの環境でFreeTokenを使えば、_RAM 48GB相当のMac mini並みの動作が実現できるそうです。長時間のタスクでも投げ出されず完遂できたとのことで、ローカルLLMの実用性を実感できる貴重な報告です。
「試してみたい」人はまずFreeTokenで遊んでみてください。
PC Watchでも紹介されている注目のプロジェクトです!
参考
PC Watch: 8GBのGPUで35Bモデルが高速動作!MoE特化の実行環境『FreeToken』
参考
関連記事:ゲーム以外でグラボを酷使!ローカルLLM環境を構築してLM Studioで遊んでみた
管理人の小職さんも、FreeTokenの可能性にすっかり興味を持ったようです。
次の実験は「ProxmoxサーバにRTX 3060を積んで、パッススルーでVMに割り当てる」かもしれませんw
読者のみなさんも、まずはFreeTokenをダウンロードして、自宅AIとの会話を楽しんでみてください。
RECOMMENDED
━━━ こちらもチェック! ━━━
omoiji.com では他にも様々なコンテンツを公開中です!ぜひご覧ください!
タグ







