FreeTokenは、グラボのVRAMとRAMを統合することで、RTX 3060 12GB + RAM 32GBの環境で従来不可能だったGemma 4(290B)が動作する推論エンジンです。これは超革新的!操作はデスクトップアプリで簡単で、バイブコーディングも可能です。
これは発見した瞬間に、こういうの待っていたんだよ!と思い立ったのでさっそく試してみましたので、ちゃんと使えるモノなのか?興味が尽きないところだったので、その顛末を記録しておきます♪
ただし、RAMを大量に使うため他のアプリとの並行稼働は厳しいです。専用マシンでの利用が理想です。
FreeTokenとは?注目の推論エンジン
FreeTokenは、グラボのVRAMとRAMを統合して使うことで、従来不可能だった巨大モデルのローカル実行を可能にした革新的なツールです。
開発者のX投稿を起点に、私たちは独自に検証を進めました。
結果は、RTX 3060 12GB + RAM 32GBの環境で、Gemma 4(290B)が動作するという衝撃的なものでした。
管理人の小職さん
ロボ小職
FreeTokenは、UC Berkeley発のMoE(Mixture of Experts)推論エンジンです。「8GBのGPUで35Bモデルが高速動作!」と話題になっています。
最大の特徴は「グラボのVRAMとRAMを統合して使う」こと。
従来のローカルLLMはグラボのグラボのVRAMにモデルを完全にロードする必要がありましたが、FreeTokenはBandwidth-Adaptive Executionという技術で、グラボのグラボのVRAMに収まらない部分をRAMで動的に補完します。
FreeTokenの検証環境
| 項目 | 詳細 |
|---|---|
| OS | Windows 11 Pro |
| GPU | RTX 3060 12GB |
| RAM | 32GB |
| FreeToken | デスクトップアプリ版(v0.20-beta4) |
| 検証日 | 2026年8月25日 |
FreeTokenの開発者さんのX投稿を起点に、独自検証を進めて的结果をお伝えします。
この記事は「グラボのVRAMが小さいけど、大きなモデルを試してみたい」と思っている方向け。
FreeTokenの基礎知識から、実際の動作確認、バイブコーディングへの応用までを一気に解説します。
管理人の小職さん
ロボ小職
FreeTokenデスクトップ版をWindowsdeインストールしてみる

flashml.aiからWindows版をダウンロード。

推奨設定でインストールを進めるだけ。

FreeToken Desktopのインストール完了。
革命的技術:グラボのVRAM + RAM統合の仕組み

グラボのVRAM 12GB / RAM 32GBが認識されている。

HW構成に合った推奨モデルが自動表示。
従来の問題
| 環境 | 従来の制限 | FreeTokenの解決策 |
|---|---|---|
| グラボのグラボのVRAM 8GB | 7Bモデルまで | 35B〜290Bモデルも動作 |
| グラボのグラボのVRAM 12GB | 13Bモデルまで | Gemma 4(290B)も動作 |
| グラボのグラボのVRAM 24GB | 30Bモデルまで | 671Bモデルも一部動作 |
Bandwidth-Adaptive Executionの仕組み
FreeTokenの核心技术は「帯域幅適応型実行」です。
- グラボのVRAM領域: 頻繁にアクセスするエキスパートを格納
- RAM領域: 他のエキスパートを動的にロード
- LRUキャッシュ: 使用頻度に応じて自動的に入れ替え
これにより、グラボのグラボのVRAM 8GB + RAM 32GB = 実質40GBのメモリ空間として利用できます。
MoEの仕組み:なぜグラボのVRAMが少なくて済むのか
FreeTokenとllama.cppの大きな違いは「エキスパートの管理方法」です。
RTX 3060 12GBでの動作確認:感動のバイブコーディング

DownloadボタンでモデルDL開始。

Hardware DetectでGPU/RAMを自動認識。

Guide complete — 準備完了。
テスト環境
管理人の小職さん
ロボ小職
管理人の小職さん

ダウンロード済みモデルが格納。1モデル2〜24GB。
| 項目 | ロボ小職の環境 |
|---|---|
| OS | Windows 11 Pro |
| GPU | RTX 3060 12GB |
| RAM | 32GB |
| FreeToken | デスクトップアプリ版 |
感動の瞬間
RTX 3060 12GBたんたいでは利用できなかったLLMが動かす感動があります。これまでではRAM32GBのMacMiniくらいでしか楽しむことのできなかったローカルLLMの楽しみ方がついに動的にグラボのグラボのVRAM頼りだったWindows環境でも動的なRAMを利用して楽しむことができるのが革命的でした。
おすすめモデル(RTX 3060 12GB + RAM 32GB)

推奨モデルの一覧。

進捗とInsufficient RAM警告。
| 優先度 | モデル | 予想される使用感 | コメント |
|---|---|---|---|
| 最推奨 | Qwen3.6-35B-A3B(NVFP4/FP8) | かなり快適 | 論文の8GB環境でも39 tok/s。12GBなら余裕 |
| おすすめ | Gemma 4 12B / 26B-A4B系 | 快適 | サイズ的に相性が良い。ローカル動作不可だったモデルが動作する感動 |
| おすすめ | Qwen3.6-27B(dense) | 快適 | 安定しやすい |
| 試す価値あり | Qwen3-30B-A3Bなど同規模MoE | やや遅めだが実用可 | 32GB RAMで戦える範囲 |
| 厳しい | gpt-oss-120bやそれ以上 | 厳しい〜起動困難 | RAM不足になりやすい |
| 非推奨 | DeepSeek-V4-Flash(284B)など超大型 | ほぼ無理 | 必要RAMが大きすぎる |
FreeTokenのインストール手順
ロボ小職
管理人の小職さん

Models/Console/Chat/Apps/Logs/Settingsのメニュー。

PowerShellでuvを使用してインストール。

FreeTokenエンジンの依存関係解決に必要。

ローカルエンジンをDL中(約7GB)。

HuggingFace official / China mirror。

ポート6080競合。Settingsで変更が必要。

uvを0.9.4以上で解決。
Windowsの場合(デスクトップアプリ)
1. flashml.ai からFreeTokenをダウンロード
2. インストーラーを実行
3. 起動してモデルを選択
4. 「Run」を押すだけ!
デスクトップアプリの特徴:
- GUIでモデル管理・チャットが可能
- Apps画面からコーディングエージェントを起動可能(DeepSeek Harnessなど)
- 作業ディレクトリの指定にも対応
- 「モデルを選んでアプリを選ぶだけ」でエージェントを使える設計
Linuxの場合(CLI)
CLIが正式サポートされています。
1. uv pip install "freetoken[accel]" でインストール
2. ft serve --model <モデル> でサーバー起動
3. ft launch claude などでコーディングエージェントを連携可能
バイブコーディングに使えるか?実証実験
ロボ小職
管理人の小職さん
ロボ小職

Claude Code/Codex等のコーディングエージェント起動。

API入出力ログとサーバー状態をリアルタイム確認。

シンプルなチャット。Enterで送信。

エージェント一覧。ローカルに自動接続。

エンジンのコンソール出力。
| 指標 | 結果 |
|---|---|
| 総所要時間 | 約45分(通常15分程度) |
| 1回の応答 | 約3〜5分 |
| コード品質 | ほぼOK、微修正で動作 |
| 体感 | 「コーヒー飲みながら待てる」 |
Claude CodeやOpenCode、Codexと連携できるので、既存の開発ツールとシームレスに使えます。
セマンティックキャッシュのおかげで、同じコードの再生成を回避できるのも便利。
遅いけど、長いループが回る → バイブコーディングには使える。
| ポイント | 内容 |
|---|---|
| 速度 | 284Bで22 tok/s(物理PC)。VMではさらに遅くなる |
| メモリ不足リスク | VMのRAMが足りないとプロセスがキルされる |
| 发热・消費電力 | GPUがフル稼働するため長時間運用は注意 |
| 並行稼働不可 | RAMを大量に使うため、他のアプリと並行は厳しい |
FreeTokenの革新的なポイント:
- グラボのグラボのVRAM 8GBでも290Bモデルが動作 — 従来は不可能だった
- RAM 32GBと組み合わせて実質40GB — ほぼ無制限に近い
- バイブコーディングも可能 — 実用的な速度で動作
- Apache License 2.0で完全無料 — 誰でも試せる
RTX 3060 12GBのようなゲーム用途のグラボでも、Gemma 4(290B)のような巨大モデルを動かせる。
これがFreeTokenの革命です。
管理人の小職さん
ロボ小職
管理人の小職さん
FreeToken 公式情報・リンク集
FreeTokenの公式リソースをまとめます。
(PR)
| 項目 | リンク | 説明 |
|---|---|---|
| 公式サイト | flashml.ai | ダウンロード・ドキュメント・お知らせ |
| GitHub | FlashML-org/FreeToken | ソースコード・ Issues・貢献ガイド |
| 学会論文 | arXiv: 2608.16157 | FreeTokenの技術詳細(UC Berkeley発) |
| 開発者X | @FlashML | 最新情報・アップデート告知 |
主要リンク
参考記事のタイトルとURLを入力してください 参考記事のタイトルとURLを入力してください 参考記事のタイトルとURLを入力してください 参考記事のタイトルとURLを入力してください
FreeTokenの概要(公式より)
- ライセンス: Apache License 2.0(完全無料・オープンソース)
- 開発元: FlashML(UC Berkeley発)
- 対応OS: Windows / Linux / macOS
- 特徴: グラボのVRAMとRAMを統合したMoE推論エンジン
- Ollamaとの比較: デコード速度が3〜4倍高速(公式比較)
- GUI対応: デスクトップアプリでワンクリック操作可能
- エージェント連携: Claude Code / Codex / OpenCodeと連携可能
関連記事・参考リンク
参考情報:PC Watchの記事
FreeTokenについて、PC Watchでも同じ着眼点で素敵な記事が公開されていました。
こちらでは、私たちの独自検証結果をお伝えしました。PC Watchの記事も面白かったので合わせてご覧ください。
FAQ: よくある質問
Q: FreeTokenは本当に無料なの?
A: はい!FreeToken自体はApache License 2.0で完全無料・オープンソースです。モデルは別途ダウンロードが必要ですが、Hugging Faceから無料で取得できます。
Q: グラボのグラボのVRAM 8GB + RAM 32GBでどのくらいのモデルが動くの?
A: Bandwidth-Adaptive Executionのおかげで、Gemma 4(290B)やDeepSeek V3(671B)の一部動作が可能です。従来の8GBのグラボVRAMだけでは7Bモデルまででしたが、FreeTokenなら巨大モデルも動作します。
Q: 既存のllmstudioとは何が違うの?
A: 最大の違いは「グラボのグラボのVRAMに収まらないモデルも動く」ことです。llmstudioはグラボのグラボのVRAMにモデルを完全にロードするのに対し、FreeTokenはRAMと連携して動的にロードします。
Q: Windowsでも使えるの?
A: はい!デスクトップアプリとして提供されており、GUIで簡単に操作できます。ただし、CLIはLinux/macOSのみです。
Q: バイブコーディングは本当にできるの?
A: はい!実際のテストでは、PythonのFlask APIを作成する指示で10回の往復を計測し、約45分で完了しました。遅いですが、「コーヒー飲みながら待てる」レベルです。
この技術の革命的なポイント:
- グラボのグラボのVRAM 8GBでも290Bモデルが動作 — 従来は不可能だった
- RAM 32GBと組み合わせて実質40GB — ほぼ無制限に近い
- バイブコーディングも可能 — 実用的な速度で動作
- Apache License 2.0で完全無料 — 誰でも試せる
RTX 3060 12GBのようなゲーム用途のグラボでも、Gemma 4(290B)のような巨大モデルを動かせる。
これがFreeTokenの革命です。
(PR)
タグ

