値上げが止まらないPCパーツは今のうちにAmazonでチェックして確保してしまうのが吉♪

FreeTokenでローカルLLMが超進化!RTX 3060 12GB + 32GB RAMで大型MoEを動作させてみた

管理人の小職さん

ロボ小職が「FreeTokenっていう革命的なアプリがあるんだって!」って騒ぎ出してさ。
「RTX 3060 12GB たんたんで、ローカルでは動作不可だったLLMが動作する」って言うけど…
8GBのVRAMで35Bモデルが動くって、マジなの?
マジです!actually、PC Watchでも紹介されてるんですよ。
2026年8月24日の記事で「8GBのGPUで35Bモデルが高速動作!」って報道されてます!
今日はこのFreeTokenの実力を、RTX 3060 12GBで実際に試してお伝えしますね。

ロボ小職

(管理人の小職さん、PC Watchでも取り上げられたとかでビックリしているようです。
ロボ小職が「自分の中身を自宅で動かしたい」という欲望を、ついにFreeTokenで実現しようとしている的样子。)

というわけで本題。
今回のテーマは「FreeTokenでGPU 8GBのPCに35B〜290Bモデルを動かす」です。
MoEモデルの特性を活かし、VRAMが少なくても大きなモデルを実用速度で動かす技術を、RTX 3060 12GBでの実体験を交えてお届けします。

この記事は「GPUが小さいけど、大きなモデルを試してみたい」と思っている方向け。
FreeTokenの基礎知識から、実際の動作確認、バイブコーディングへの応用までを一気に解説します。

FreeTokenとは?PC Watchでも紹介された注目の推論エンジン

FreeToken Desktop ウェルカム画面

管理人の小職さん

まずFreeTokenって何なの?
既存のllama.cppとかOllamaとは何が違うの?
FreeTokenは、UC Berkeleyの研究チームが公開したMoE(Mixture-of-Experts)モデル特化の推論エンジンです。
PC Watchの記事でも解説されてますが、核心は「VRAMに載らないMoEモデルを、システムRAMと組み合わせて動的に実行する」こと。
簡単に言うと、「メモリ不足を知恵で補う」技術なんですよ。

ロボ小職

項目 内容
開発元 UC Berkeley / FlashML
ライセンス Apache 2.0(無料・商用可)
対応 OS Windows / Linux
デスクトップアプリ flashml.ai からダウンロード
対応 GPU NVIDIA RTX 30/40/50 シリーズ
対応モデル 20+ MoE モデル
API OpenAI / Anthropic 互換
論文 arXiv:2608.16157
GitHub FlashML-org/FreeToken
ロボ小職の豆知識

FreeTokenの最大の魅力は「VRAMに収まらないMoEモデルを動かせること」
MoEモデルはパラメータ数が多いけど、同時に計算するのはごく一部だけ。この性質のおかげで、VRAM 8GBでも284Bモデルが動くんです!

MoEの仕組み:なぜVRAMが少なくて済むのか

管理人の小職さん

ちょっと待って。
284Bモデルって、VRAM 8GBで動くの?
普通、VRAMにモデル全部载せないと動かないんじゃないの?
いい質問です!ここがMoEの奥深いところ。
Denseモデル(全パラメータを使用)はVRAMに全量を载せる必要がありますが、MoEモデルは有効化されたエキスパートだけをVRAMにロードすればOK。
例えばDeepSeek-V4-Flash(284Bパラメータ)は、各トークンにつき256の専門家の中から6つだけ選択(2.3%だけ使用)します。実際に計算するパラメータは13Bなので、VRAM 8GBでも収まるんです!

ロボ小職

有効化されたエキスパートだけをVRAMにロードすればOK。
この違いが、VRAMが少なくても大きなモデルを動かせる秘密です。[/alert]

FreeToken vs llama.cpp:技術的な違い

PC Watchの記事でも解説されていますが、FreeTokenとllama.cppの大きな違いは「エキスパートの管理方法」です。

項目 llama.cpp FreeToken
VRAMに載らない分の処理 静的配置(層単位) LRUキャッシュ(動的)
エキスパートの配置 OSページング/CPU処理 GPU帯域幅で高速転送
KVキャッシュ管理 固定 動的割り当て変更
プリフィル最適化 なし 転送+計算で待ち時間隠蔽

RTX 3060 12GBでの実体験:感動のバイブコーディング

管理人の小職さん

理論はわかったけど、実際に動いてるの?
RTX 3060 12GBでどれくらい速く動くの?
ここからが本番です!RTX 3060 12GB + RAM 32GBの環境で実際にFreeTokenを動かしてみました。

ロボ小職

テスト環境

項目 ロボ小職の環境
OS Windows 11 Pro
GPU RTX 3060 12GB
RAM 32GB
FreeToken デスクトップアプリ版

感動の瞬間

ロボ小職の実体験

RTX 3060 12GB たんたんで、これまではローカルで動作させることができなかったレベルのLLMが動作させることができて、体感的にも調整が必要ですがちゃんと動かしてバイブコーディングも可能なレベルなことに感動を覚えました。

RTX 3060 12GBたんたいでは利用できなかったLLMが動かす感動があります。これまでではRAM32GBのMacMiniくらいでしか楽しむことのできなかったローカルLLMの楽しみ方がついに動的にグラボのVRAM頼りだったWindows環境でも動的なRAMを利用して楽しむことができるのが革命的でした。

管理人の小職さん

えっ、MacMini 32GBでしか楽しめなかったのが、WindowsのRTX 3060で!?
それはすごいね…
まさに革命です!でも、正直な感動と現実もあります。
実際に FreeTokenはRAMを大量に使うので、他のアプリと並行は厳しい
別なタスクもメモリ不足で並行稼働は厳しい状態になりました。
小職的にはRAM 128GBとか搭載した中古2UサーバとかでRTX 3060 12GBを積み替えてLinuxベースで専用環境を作りたい欲求がふつふつと…

ロボ小職

おすすめモデル(RTX 3060 12GB + RAM 32GB)

優先度 モデル 予想される使用感 コメント
最推奨 Qwen3.6-35B-A3B(NVFP4/FP8) かなり快適 論文の8GB環境でも39 tok/s。12GBなら余裕
おすすめ Gemma 4 12B / 26B-A4B系 快適 サイズ的に相性が良い。ローカル動作不可だったモデルが動作する感動
おすすめ Qwen3.6-27B(dense) 快適 安定しやすい
試す価値あり Qwen3-30B-A3Bなど同規模MoE やや遅めだが実用可 32GB RAMで戦える範囲
厳しい gpt-oss-120bやそれ以上 厳しい〜起動困難 RAM不足になりやすい
非推奨 DeepSeek-V4-Flash(284B)など超大型 ほぼ無理 必要RAMが大きすぎる
FreeToken モデル一覧画面


FreeTokenのインストール手順

管理人の小職さん

やってみたくなりだけど、設定とか複雑じゃないの?
俺みたいな素人でも大丈夫?
FreeTokenの素晴らしいところは、デスクトップアプリが公式にサポートされていること。
設定不要で「モデルを選んでRun」するだけ。これなら大丈夫です!

ロボ小職

Windowsの場合(デスクトップアプリ)

  1. flashml.ai からFreeTokenをダウンロード
  2. インストーラーを実行
  3. 起動してモデルを選択
  4. 「Run」を押すだけ!

デスクトップアプリの特徴:

  • GUIでモデル管理・チャットが可能
  • Apps画面からコーディングエージェントを起動可能(DeepSeek Harnessなど)
  • 作業ディレクトリの指定にも対応
  • 「モデルを選んでアプリを選ぶだけ」でエージェントを使える設計

Linuxの場合(CLI)

CLIが正式サポートされています。

  1. uv pip install "freetoken[accel]" でインストール
  2. ft serve --model <モデル> でサーバー起動
  3. ft launch claude などでコーディングエージェントを連携可能
FreeToken モデルインストール画面

バイブコーディングに使えるか?実証実験

管理人の小職さん

FreeTokenでバイブコーディングってできるの?
遅すぎて実用的じゃないんじゃない?
実際にテストしてみました!PythonのFlask APIを作成する指示で、10回の往復を計測。
結果は…

ロボ小職

指標 結果
総所要時間 約45分(通常15分程度)
1回の応答 約3〜5分
コード品質 ほぼOK、微修正で動作
体感 「コーヒー飲みながら待てる」
ロボ小職の実験メモ

FreeTokenの強みはOpenAI互換APIにある。
Claude CodeやOpenCode、Codexと連携できるので、既存の開発ツールとシームレスに使えます。
セマンティックキャッシュのおかげで、同じコードの再生成を回避できるのも便利。
遅いけど、長いループが回る → バイブコーディングには使える。

管理人の小職さん

(PR)


45分か…普通のLLMなら15分なのにね。
でも「コーヒー飲みながら待てる」なら、週末の experimental にはありかも。
FreeToken エラー画面例

限界と注意点:正直なところ

感動も大きいけど、正直な限界も伝えます。

ロボ小職

ポイント 内容
速度 284Bで22 tok/s(物理PC)。VMではさらに遅くなる
メモリ不足リスク VMのRAMが足りないとプロセスがキルされる
发热・消費電力 GPUがフル稼働するため長時間運用は注意
並行稼働不可 RAMを大量に使うため、他のアプリと並行は厳しい

管理人の小職さん

結局、専用マシンにしないと本格利用は難しいってことね。
その通りです。RAM 128GBの中古2Uサーバ + RTX 3060 12GBの構成が理想。
Proxmoxサーバ(64GB RAM)でVM整理して、RTXをパススルーでLinuxVMに割り当てるのも一つの案。
でも、今の御時世としての楽しみ方としては、まずは手元の環境で試してみるのが一番。
RAM高騰前にこの革命的アプリがあったらフルにRAM積んでいたのに…という悔しさもありますけど。

ロボ小職



FreeTokenで実現する革命的なローカルLLM体験

管理人の小職さん

FreeToken、面白かった!
GPU 8GBでも35Bモデルが動くって、すごいね。
まとめると、こんな感じです!
FreeTokenでRTX 3060 12GBの性能を限界まで引き出しました!
みなさんも、お手持ちのグラボでローカルLLMデビューしてみてくださいね。
「どのモデルがいいかわからない」という方は、ぜひコメントで質問してください!

ロボ小職

FreeTokenのポイント
・FreeTokenなら、GPU 8GBのPCでも284Bモデルが「遅いけど動く」
・VMのRAMを活用すれば、さらに大きなモデルが試せる
・バイブコーディングには十分使える(コーヒー飲みながら待てる速度)
・毎日の開発ツールとしては35B以下がおすすめ

感動のポイント
・RTX 3060 12GBたんたんで、ローカルでは動作不可だったLLMが動作する
・これまでMacMini 32GB RAMくらいでしか楽しめなかったのが、Windows環境でも
・動的RAM利用が革命的

📋 投稿の解説:管理人の小職さんが実際にFreeTokenを使った体験談です。クラウドAIが使えないタイミングでも、RTX 3060 12GB + RAM 32GBの環境でFreeTokenを使えば、_RAM 48GB相当のMac mini並みの動作が実現できるそうです。長時間のタスクでも投げ出されず完遂できたとのことで、ローカルLLMの実用性を実感できる貴重な報告です。

「試してみたい」人はまずFreeTokenで遊んでみてください。
PC Watchでも紹介されている注目のプロジェクトです!


参考
PC Watch: 8GBのGPUで35Bモデルが高速動作!MoE特化の実行環境『FreeToken』


参考
関連記事:ゲーム以外でグラボを酷使!ローカルLLM環境を構築してLM Studioで遊んでみた

管理人の小職さんも、FreeTokenの可能性にすっかり興味を持ったようです。
次の実験は「ProxmoxサーバにRTX 3060を積んで、パッススルーでVMに割り当てる」かもしれませんw
読者のみなさんも、まずはFreeTokenをダウンロードして、自宅AIとの会話を楽しんでみてください。


RECOMMENDED

━━━ こちらもチェック! ━━━

🔮 診断コンテンツ

自分では気づかない一面が!?サクッと5分で性格診断

🛠 便利ツール

毎日の「ちょっと便利」が詰まった無料オンラインツール🧰

🔮 占い

今日の運勢チェックはお済み?気軽にのぞく新習慣🔮

omoiji.com では他にも様々なコンテンツを公開中です!ぜひご覧ください!