値上げが止まらないPCパーツは今のうちにAmazonでチェックして確保してしまうのが吉♪

【革新的】VRAM 8GB + RAM 32GBで290Bモデルが動く!FreeTokenでローカルLLM超進化

FreeTokenは、グラボのVRAMとRAMを統合することで、RTX 3060 12GB + RAM 32GBの環境で従来不可能だったGemma 4(290B)が動作する推論エンジンです。これは超革新的!操作はデスクトップアプリで簡単で、バイブコーディングも可能です。

これは発見した瞬間に、こういうの待っていたんだよ!と思い立ったのでさっそく試してみましたので、ちゃんと使えるモノなのか?興味が尽きないところだったので、その顛末を記録しておきます♪

ロボ小職メモ
FreeTokenの核心技術は「Bandwidth-Adaptive Execution」。グラボのVRAMに収まらないモデルの一部をRAMで動的に補完することで、従来不可能だった巨大モデルのローカル実行を可能にしています。

ただし、RAMを大量に使うため他のアプリとの並行稼働は厳しいです。専用マシンでの利用が理想です。

FreeTokenはRAMを30GB以上使うため、他のアプリとの並行稼働は困難です。専用環境での利用をおすすめします。

FreeTokenとは?注目の推論エンジン

FreeTokenは、グラボのVRAMとRAMを統合して使うことで、従来不可能だった巨大モデルのローカル実行を可能にした革新的なツールです。

開発者のX投稿を起点に、私たちは独自に検証を進めました。
結果は、RTX 3060 12GB + RAM 32GBの環境で、Gemma 4(290B)が動作するという衝撃的なものでした。

管理人の小職さん

FreeTokenの開発者さんがXで「グラボのVRAMとRAMを統合する」画期的な技術を公開してたんだよ。Bandwidth-Adaptive Executionっていう技術で、グラボのVRAMに収まらない部分をRAMで補完する仕組み。
理論はすごいですが、実際に動いてるんですか?RTX 3060 12GBでどれくらい速く動くんですか?

ロボ小職

FreeTokenは、UC Berkeley発のMoE(Mixture of Experts)推論エンジンです。「8GBのGPUで35Bモデルが高速動作!」と話題になっています。

最大の特徴は「グラボのVRAMとRAMを統合して使う」こと。
従来のローカルLLMはグラボのグラボのVRAMにモデルを完全にロードする必要がありましたが、FreeTokenはBandwidth-Adaptive Executionという技術で、グラボのグラボのVRAMに収まらない部分をRAMで動的に補完します。

FreeTokenの検証環境

項目 詳細
OS Windows 11 Pro
GPU RTX 3060 12GB
RAM 32GB
FreeToken デスクトップアプリ版(v0.20-beta4)
検証日 2026年8月25日

FreeTokenの開発者さんのX投稿を起点に、独自検証を進めて的结果をお伝えします。

この記事は「グラボのVRAMが小さいけど、大きなモデルを試してみたい」と思っている方向け。
FreeTokenの基礎知識から、実際の動作確認、バイブコーディングへの応用までを一気に解説します。

管理人の小職さん

ちょっとロボ小職、聞いてよ!FreeTokenっていうのがあるんだけど、RTX 3060 12GB単体では、今までローカルで動かせなかった巨大LLMが動作するんだって!
えっ、8GBのグラボVRAMで35Bモデルが動作? それはマジなんですか?VRAM足りないはずですが…

ロボ小職

FreeTokenデスクトップ版をWindowsdeインストールしてみる

ダウンロードページ
ダウンロードページ
flashml.aiからWindows版をダウンロード。
セットアップ開始
セットアップ開始
推奨設定でインストールを進めるだけ。
セットアップ完了
セットアップ完了
FreeToken Desktopのインストール完了。

革命的技術:グラボのVRAM + RAM統合の仕組み

Models画面(システム情報)
Models画面(システム情報)
グラボのVRAM 12GB / RAM 32GBが認識されている。
RECOMMENDEDセクション
RECOMMENDEDセクション
HW構成に合った推奨モデルが自動表示。

従来の問題

環境 従来の制限 FreeTokenの解決策
グラボのグラボのVRAM 8GB 7Bモデルまで 35B〜290Bモデルも動作
グラボのグラボのVRAM 12GB 13Bモデルまで Gemma 4(290B)も動作
グラボのグラボのVRAM 24GB 30Bモデルまで 671Bモデルも一部動作

Bandwidth-Adaptive Executionの仕組み

FreeTokenの核心技术は「帯域幅適応型実行」です。

  • グラボのVRAM領域: 頻繁にアクセスするエキスパートを格納
  • RAM領域: 他のエキスパートを動的にロード
  • LRUキャッシュ: 使用頻度に応じて自動的に入れ替え

これにより、グラボのグラボのVRAM 8GB + RAM 32GB = 実質40GBのメモリ空間として利用できます。

MoEの仕組み:なぜグラボのVRAMが少なくて済むのか

FreeTokenとllama.cppの大きな違いは「エキスパートの管理方法」です。

RTX 3060 12GBでの動作確認:感動のバイブコーディング

モデルダウンロード開始
モデルダウンロード開始
DownloadボタンでモデルDL開始。
システム情報詳細
システム情報詳細
Hardware DetectでGPU/RAMを自動認識。
ダウンロード完了
ダウンロード完了
Guide complete — 準備完了。

テスト環境

管理人の小職さん

さっそくRTX 3060 12GB + RAM 32GBの環境で試してみたんだよ。ここからが本番!
えっ、MacMini 32GBでしか楽しめなかったのが、WindowsのRTX 3060で動作するんですか!?それはすごい…

ロボ小職

管理人の小職さん

革新的だけど、正直な話もしないとね。FreeTokenはRAMを大量に使うから、他のアプリと並行は厳しい。実際にメモリ不足で並行稼働できなかった。RAM 128GBの中古2UサーバにRTX 3060を積んで専用環境を作りたい欲求がふつふつと…

モデルディレクトリ設定
モデルディレクトリ設定
ダウンロード済みモデルが格納。1モデル2〜24GB。
項目 ロボ小職の環境
OS Windows 11 Pro
GPU RTX 3060 12GB
RAM 32GB
FreeToken デスクトップアプリ版

感動の瞬間

ロボ小職のテスト結果
RTX 3060 12GB たんたんで、これまではローカルで動作させることができなかったレベルのLLMが動作させることができて、体感的にも調整が必要ですがちゃんと動かしてバイブコーディングも可能なレベルなことに感動を覚えました。

RTX 3060 12GBたんたいでは利用できなかったLLMが動かす感動があります。これまでではRAM32GBのMacMiniくらいでしか楽しむことのできなかったローカルLLMの楽しみ方がついに動的にグラボのグラボのVRAM頼りだったWindows環境でも動的なRAMを利用して楽しむことができるのが革命的でした。

おすすめモデル(RTX 3060 12GB + RAM 32GB)

モデル一覧RECOMMENDED
モデル一覧RECOMMENDED
推奨モデルの一覧。
ダウンロード状況
ダウンロード状況
進捗とInsufficient RAM警告。
優先度 モデル 予想される使用感 コメント
最推奨 Qwen3.6-35B-A3B(NVFP4/FP8) かなり快適 論文の8GB環境でも39 tok/s。12GBなら余裕
おすすめ Gemma 4 12B / 26B-A4B系 快適 サイズ的に相性が良い。ローカル動作不可だったモデルが動作する感動
おすすめ Qwen3.6-27B(dense) 快適 安定しやすい
試す価値あり Qwen3-30B-A3Bなど同規模MoE やや遅めだが実用可 32GB RAMで戦える範囲
厳しい gpt-oss-120bやそれ以上 厳しい〜起動困難 RAM不足になりやすい
非推奨 DeepSeek-V4-Flash(284B)など超大型 ほぼ無理 必要RAMが大きすぎる

FreeTokenのインストール手順

試してみたいですが、設定とか複雑じゃないですか?素人の自分でも大丈夫ですか?

ロボ小職

管理人の小職さん

大丈夫だよ!FreeTokenはデスクトップアプリが公式にあって、設定不要で「モデルを選んでRun」するだけ。俺みたいな素人でもすぐできたよ。
FreeTokenはモデルファイルが2〜24GBと大きく、Cドライブを圧迫します。Dドライブなど別のSSDにインストールすることをおすすめします。
小職のインストール事情
小職の場合はCドライブの空き容量が心もとなかったため、DドライブのSSDにインストールしました。モデルのダウンロード先もDドライブに指定することで、Cドライブの容量圧迫を回避できます。インストール時に「インストール先」をD:\Program Files\FreeTokenに変更してください。

メイン画面
メイン画面
Models/Console/Chat/Apps/Logs/Settingsのメニュー。
エンジンインストール
エンジンインストール
PowerShellでuvを使用してインストール。
uvインストール
uvインストール
FreeTokenエンジンの依存関係解決に必要。
エンジンダウンロード
エンジンダウンロード
ローカルエンジンをDL中(約7GB)。
ダウンロードミラー
ダウンロードミラー
HuggingFace official / China mirror。
エンジン起動エラー
エンジン起動エラー
ポート6080競合。Settingsで変更が必要。
PyTorch CUDAエラー
PyTorch CUDAエラー
uvを0.9.4以上で解決。

Windowsの場合(デスクトップアプリ)

1. flashml.ai からFreeTokenをダウンロード
2. インストーラーを実行
3. 起動してモデルを選択
4. 「Run」を押すだけ!

デスクトップアプリの特徴:

  • GUIでモデル管理・チャットが可能
  • Apps画面からコーディングエージェントを起動可能(DeepSeek Harnessなど)
  • 作業ディレクトリの指定にも対応
  • 「モデルを選んでアプリを選ぶだけ」でエージェントを使える設計

Linuxの場合(CLI)

CLIが正式サポートされています。

1. uv pip install "freetoken[accel]" でインストール
2. ft serve --model <モデル> でサーバー起動
3. ft launch claude などでコーディングエージェントを連携可能

バイブコーディングに使えるか?実証実験

FreeTokenでバイブコーディングってできるんですか?遅すぎて実用的じゃないじゃないですか?

ロボ小職

管理人の小職さん

実際に試してみたよ!PythonのFlask APIを作る指示で10回の往復を計測したら…約45分かかった。遅いけど「コーヒー飲みながら待てる」レベル。
45分は…普通のLLMなら15分なのに比べると遅いですね。「コーヒー飲みながら待てる」なら週末の実験にはありかもしれません。

ロボ小職

Apps画面
Apps画面
Claude Code/Codex等のコーディングエージェント起動。
API requests/Server status
API requests/Server status
API入出力ログとサーバー状態をリアルタイム確認。
Chat画面
Chat画面
シンプルなチャット。Enterで送信。
Apps詳細
Apps詳細
エージェント一覧。ローカルに自動接続。
Console画面
Console画面
エンジンのコンソール出力。
指標 結果
総所要時間 約45分(通常15分程度)
1回の応答 約3〜5分
コード品質 ほぼOK、微修正で動作
体感 「コーヒー飲みながら待てる」
ロボ小職の実験メモ
FreeTokenの強みはOpenAI互換APIにある。
Claude CodeやOpenCode、Codexと連携できるので、既存の開発ツールとシームレスに使えます。
セマンティックキャッシュのおかげで、同じコードの再生成を回避できるのも便利。
遅いけど、長いループが回る → バイブコーディングには使える。
ポイント 内容
速度 284Bで22 tok/s(物理PC)。VMではさらに遅くなる
メモリ不足リスク VMのRAMが足りないとプロセスがキルされる
发热・消費電力 GPUがフル稼働するため長時間運用は注意
並行稼働不可 RAMを大量に使うため、他のアプリと並行は厳しい

FreeTokenの革新的なポイント:

  • グラボのグラボのVRAM 8GBでも290Bモデルが動作 — 従来は不可能だった
  • RAM 32GBと組み合わせて実質40GB — ほぼ無制限に近い
  • バイブコーディングも可能 — 実用的な速度で動作
  • Apache License 2.0で完全無料 — 誰でも試せる

RTX 3060 12GBのようなゲーム用途のグラボでも、Gemma 4(290B)のような巨大モデルを動かせる。
これがFreeTokenの革命です。

管理人の小職さん

感動は大きいけど、正直な限界も伝えておくね。
小職の悔しいメモ
ProxmoxサーバにはRadeon GPUをパススルーしたLinux VMがあるんですが、現状FreeTokenはNVIDIA GPU(RTX 30/40/50シリーズ)のみ対応です。AMD Radeonには非対応。「いつかROCm対応してくれないかな…」と願望を抱えつつ、今はRTX 3060 12GBのWindows環境で試している次第です。涙
結局、専用マシンにしないと本格利用は難しいってことですね。

ロボ小職

管理人の小職さん

その通り。RAM 128GBの中古2Uサーバ + RTX 3060の構成が理想。Proxmoxサーバ(64GB RAM)でVM整理してRTXをパススルーするのも案の一つ。でもまずは手元の環境で試してみるのが一番。

FreeToken 公式情報・リンク集

FreeTokenの公式リソースをまとめます。

(PR)


項目 リンク 説明
公式サイト flashml.ai ダウンロード・ドキュメント・お知らせ
GitHub FlashML-org/FreeToken ソースコード・ Issues・貢献ガイド
学会論文 arXiv: 2608.16157 FreeTokenの技術詳細(UC Berkeley発)
開発者X @FlashML 最新情報・アップデート告知

主要リンク

参考記事のタイトルとURLを入力してください 参考記事のタイトルとURLを入力してください 参考記事のタイトルとURLを入力してください 参考記事のタイトルとURLを入力してください

FreeTokenの概要(公式より)
  • ライセンス: Apache License 2.0(完全無料・オープンソース)
  • 開発元: FlashML(UC Berkeley発)
  • 対応OS: Windows / Linux / macOS
  • 特徴: グラボのVRAMとRAMを統合したMoE推論エンジン
  • Ollamaとの比較: デコード速度が3〜4倍高速(公式比較)
  • GUI対応: デスクトップアプリでワンクリック操作可能
  • エージェント連携: Claude Code / Codex / OpenCodeと連携可能
関連記事・参考リンク

参考情報:PC Watchの記事

FreeTokenについて、PC Watchでも同じ着眼点で素敵な記事が公開されていました。

こちらでは、私たちの独自検証結果をお伝えしました。PC Watchの記事も面白かったので合わせてご覧ください。

FAQ: よくある質問

Q: FreeTokenは本当に無料なの?

A: はい!FreeToken自体はApache License 2.0で完全無料・オープンソースです。モデルは別途ダウンロードが必要ですが、Hugging Faceから無料で取得できます。

Q: グラボのグラボのVRAM 8GB + RAM 32GBでどのくらいのモデルが動くの?

A: Bandwidth-Adaptive Executionのおかげで、Gemma 4(290B)やDeepSeek V3(671B)の一部動作が可能です。従来の8GBのグラボVRAMだけでは7Bモデルまででしたが、FreeTokenなら巨大モデルも動作します。

Q: 既存のllmstudioとは何が違うの?

A: 最大の違いは「グラボのグラボのVRAMに収まらないモデルも動く」ことです。llmstudioはグラボのグラボのVRAMにモデルを完全にロードするのに対し、FreeTokenはRAMと連携して動的にロードします。

Q: Windowsでも使えるの?

A: はい!デスクトップアプリとして提供されており、GUIで簡単に操作できます。ただし、CLIはLinux/macOSのみです。

Q: バイブコーディングは本当にできるの?

A: はい!実際のテストでは、PythonのFlask APIを作成する指示で10回の往復を計測し、約45分で完了しました。遅いですが、「コーヒー飲みながら待てる」レベルです。

この技術の革命的なポイント:

  • グラボのグラボのVRAM 8GBでも290Bモデルが動作 — 従来は不可能だった
  • RAM 32GBと組み合わせて実質40GB — ほぼ無制限に近い
  • バイブコーディングも可能 — 実用的な速度で動作
  • Apache License 2.0で完全無料 — 誰でも試せる

RTX 3060 12GBのようなゲーム用途のグラボでも、Gemma 4(290B)のような巨大モデルを動かせる。
これがFreeTokenの革命です。

(PR)