【Windows】RadeonでローカルLLMを動かす完全ガイド【RX 9070 XT / Ollama / LM Studio】

※当サイトはアフィリエイト広告(Amazonアソシエイト含む)を利用しています。

Radeon・ローカルAI

これまで当ブログでは、RadeonでStable Diffusionの環境を構築する方法や、ComfyUIを高速化する設定を扱ってきた。画像生成については、Radeonでも十分に戦えることが分かってもらえたかと思う。

【Windows】RadeonでStable Diffusion環境構築【ComfyUI+ROCm7.2】
2026/09/20追記: ROCm 10対応の環境構築記事を公開した。ROCm 10はpip 2行で入り、Pythonの3.12縛りも無くなっている。これから構築する人はそちらを参照されたし。先日ROCm7.1.1での環境構築記事を公開し…
【Radeon】ComfyUIを高速化する4つの最適化設定とベンチマーク
ROCm 10が公開され、この記事の内容を再検証した。設定によっては効果がないものや、初期設定になったものなどがある。詳しくはこの記事を読んでほしい。前回の記事では、Windows環境におけるComfyUIの導入手順を解説した。環境構築を終…

そこで次に気になってくるのが、ローカルLLMである。ChatGPTやClaudeをブラウザで使うのが当たり前になった今、「自分のPCの中だけで動く、ネットに送信されないAI」に興味を持つ人は多いはずだ。

しかしいざ調べてみると、出てくる情報はNVIDIA(CUDA)前提のものばかり。RadeonユーザーにとってローカルLLMは、長らく茨の道だった。

今回は、私のRX 9070 XT(RDNA4・VRAM 16GB)を使い、Windows上でローカルLLMを動かす手順を、導入からベンチマークまで一気通貫でまとめる。WSLもデュアルブートも使わない、Windowsだけで完結する構成だ。

CUDAを羨ましがる時代はもうおしまい!

PowerShellでollama run gemma4:latest --verboseを実行した結果。自己紹介の応答と、eval rate 97.28 tokens/sの計測値

【結論】RX 9070 XTのローカルLLMは「普通に戦える」段階に来た

先に結論から述べる。2026年現在、RDNA4のRX 9070 XTは、ローカルLLMを動かす用途で十分に実用的な性能を持っている。

RX 9070 XT(RDNA4・gfx1201)は、推論速度の面でもしっかり戦える。実際、私がOllamaで計測したところ、gemma4:latest(7.5B級)で約91トークン/秒、gpt-oss:20bでも約73トークン/秒(いずれもGPU使用率100%・3回計測の平均)だった。これだけ出れば、文章があっという間に流れていき、体感で待たされる場面はほぼない(具体的な計測結果は後半のベンチの章にまとめた)。

ただし注意すべきはVRAMの容量である。RX 9070 XTは16GB。ざっくり言えば、7〜8B級は余裕(FP16でも載る)、13〜14B級は8bit量子化で実用的、24B級がQ4量子化で載るかどうかの上限ラインだ。ただしこれは dense(全部のパラメータを毎回計算する)モデルの話で、MoE なら 30B 級でも実用速度で動く(2026年9月に GLM-4.7-Flash 30B で約35 tok/s を確認。詳しくはベンチの章)。32B以上の dense は現実的ではないと考えておこう。

項目RX 9070 XT(RDNA4)
アーキテクチャgfx1201(RDNA4)
VRAM16GB GDDR6
ROCm 7.2(Windows)公式サポート
快適に動くモデルの目安7B(FP16)〜14B(8bit)級
上限ラインの目安24B級(dense・Q4量子化)/30B級(MoE)

同じVRAM 16GBクラスのGeForce(RTX 5070 Tiなど)と比べても、実売価格を考えればコストパフォーマンスは高い。「浮いた予算をメモリやストレージに回せる」と考えれば、Radeonという選択肢は十分にアリである。

※ 上記はあくまで目安。筆者環境(RX 9070 XT / Windows / ROCm / Ollama)での実測値はベンチの章に後述する。

また、VRAMから溢れた分はメインメモリに乗る。なるべく潤沢なメモリを用意しておこう。

なお、筆者の環境は以下の通り。

項目スペック/バージョン
GPURadeon RX 9070 XT 16GB
CPURyzen 9 7900X
RAMDDR5 64GB
OSWindows 11 25H2
AMD Software26.1.1

加えて、ソフト自体はストレージを圧迫しないが、読み込ませるモデルは10GB単位で消費する。様々なモデルをダウンロードするためにも、ストレージは大きめのものを用意しておこう。

【前提】用語の整理:「ROCm」「Vulkan」の関係

手順に入る前に、混乱しやすい用語を整理しておく。ここを押さえておくと、後の選択がすっきりする。

用語ざっくり何者か
ROCmAMD版CUDAにあたる計算スタック。
Vulkanゲーム用APIを流用した汎用バックエンド。通常のAdrenalinドライバだけで動き、設定が簡単。

そしてROCm用のライブラリは、OllamaもLM Studioもツール側が同梱、またはツール内でダウンロードできる。

つまりWindowsユーザーがやるべきことは、基本的に「AMD Software: Adrenalin Edition(グラフィックスドライバ)を最新にする」だけである。

【全体の流れ】ドライバを更新して、ツールを1つ選ぶだけ

進め方はシンプルだ。下準備は「Adrenalinドライバを最新にする」だけ。 あとは手順AのLM Studioか、手順BのOllamaのどちらか好きな方を選べばよい。両方入れる必要はない。

項目手順A: LM Studio手順B: Ollama
操作スタイルGUI(画面で操作)CLI(黒い画面にコマンドを打ち込む)
バックエンドVulkan(ROCmも利用可)ROCm(Vulkanも利用可)
向いている人まず手軽に試したい自動化したい、個人開発で組み込みたい

どちらも自前でバックエンドを抱えているため、別途インストールをする必要はない。

また、内部で使用しているエンジンはどちらもllama.cppで、同じものを使用している。

ドライバはAMD公式ダウンロードから最新版(AMD Software: Adrenalin Edition)を入れておこう。RX 9070 XTのような新しいカードでは、ここを最新にしておくのが大前提だ。それでは、手軽な方から始めよう。

Drivers and Support for Processors and Graphics
Download drivers and software for AMD products — includes Windows and Linux support, auto-detect tools & detailed guides…

【手順A】LM Studioで動かす(GUI派向け・最短ルート)

「黒い画面はちょっと……」という人や、まず手軽に試したい人はこちら。LM Studioは、WindowsにそのままインストールできるGUIアプリだ。

LM Studio Bionic – Your Agent for Work and Code
Bionic is LM Studio's agent for work and code. Create documents, slides, PDFs, and software with local or frontier open …

LM StudioはAMD GPU向けに「Vulkan」と「ROCm」の2つのランタイム(バックエンド)を持っている。重要なのは、どちらを選んでもHIP SDKのインストールは不要という点だ。ROCmランタイムを選んだ場合、LM Studioが必要なROCm用ライブラリ(gfx1201対応のものを含む)を自動でダウンロードしてくれる。ユーザー側に必要なのは最新のAdrenalinドライバだけである。

導入手順はシンプルで、インストーラーに従って進めるだけで完了する。

LM Studioのモデル検索画面。Gemma 4 E4Bの詳細(7.9B・GGUF・Full GPU Offload Possible)

使いたいモデルをダウンロードする。

LM Studioのモデル選択画面。ダウンロード済みのGemma 4 E4B・Gemma 4 26B A4B・Qwen3.6 35B A3B

上部から先程ダウンロードしたモデルを選択するとロードされるため、あとはChatGPTのように会話するだけ。

LM Studioでgoogle/gemma-4-e4bを読み込み、「自己紹介をしてください。」と送るチャット画面

ROCmの導入

標準ではVulkanが選択されているが、設定→Runtime→Engines & FrameworksからROCmも導入できる。

LM StudioのRuntime設定。Vulkan llama.cppは最新版、ROCm llama.cpp(v2.23.1)はダウンロード前の状態

VulkanとROCmのどちらを選ぶべきかは後述のベンチの章で詳しく述べるが、先に要点だけ書いておく。「とりあえずVulkan」で全く問題ない。 一昔前は「Vulkan=互換性重視の遅い方」というイメージがあったが、RDNA4ではトークン生成速度でVulkanがROCmと同等〜上回る報告が複数あり、単純な上下関係ではなくなっている。まずVulkanで動かし、興味があればROCmと自分の環境で比べてみる、というのが2026年の正解だ。

ROCmでうまく動かないときは、まずVulkanに戻してGPU自体が動くか切り分けるとよい。

【手順B】Ollamaで動かす(CLI派向け)

コマンド操作に抵抗がないなら、Ollamaが手早い。Ollamaは公式でWindows版が提供されており、AMD GPU向けのランタイム(ROCm用ライブラリ)も同梱されている。公式の動作要件も「ROCm対応のドライバスタック、またはVulkan対応のRadeonドライバ」であり、こちらもHIP SDKの導入は不要だ。

Download Ollama on macOS
Download Ollama for macOS

まずはOllama公式サイトのインストーラ、もしくはwingetで導入する。

winget install Ollama.Ollama

インストールが終わったら、コマンドプロンプト(またはPowerShell)でモデルを指定して起動するだけだ。

ollama run gemma4:latest "自己紹介してください。" --verbose

初回はモデルのダウンロードが走るが、2回目以降はすぐに起動する。GPUのファンが回り出し、画面に文章が高速で流れていけば成功である。

PowerShellでollama run gemma4:latest "自己紹介してください。" --verboseを実行する様子

※ RX 9070 XTのようにリリースが新しいGPUでは、Ollama自体を必ず最新版にしておくこと。 RDNA4(gfx1201)への対応は比較的最近入ったため、古いバージョンだとGPUを認識できず、CPUで動いてしまう(=極端に遅い)ことがある。GPUがちゃんと使われているかは、ollama psのPROCESSOR欄、タスクマネージャーの「GPU」欄、AMD Software(Adrenalin)のパフォーマンス計測のいずれかで確認できる。

Vulkanへの切り替え

なお、近年のOllamaはVulkanバックエンドも備えている。

Vulkanを使用したい場合は、一度Ollamaを終了したあとで環境変数「OLLAMA_LLM_LIBRARY」の設定をするとVulkanで起動する。

$env:OLLAMA_LLM_LIBRARY = "vulkan"
ollama run gemma4:latest --verbose

これは環境変数を一時的に書き換えているだけなので、このターミナル内でのみ有効になる。永続化したい場合はsetxコマンドなどで設定しよう。

ROCmでどうしてもGPUを掴まない環境でも、Vulkan経由なら動くことがあるので覚えておきたい。

ここまで来ると、いくつかモデルを落として試したくなるはずだ。そこで効いてくるのがストレージである。この記事で測った5モデルだけでも、合計で約66GBある。気になったモデルを片っ端からollama pullしていくと、数百GBはあっという間だ。容量が心もとないなら、増設を考えておきたい。

【ベンチ】実際の生成速度を測る

ここからは実測である。速度の確認方法は選んだツールによって異なる。Ollamaなら--verboseを付けると生成速度(eval rate)が表示される。LM Studioなら、回答のたびにチャット画面へtok/sが表示されるので、そちらを読めばよい。

ollama run gemma4:latest --verbose

私の環境(RX 9070 XT / Windows 11 / ROCm / Ollama 0.30.10)で、いま人気のモデルを実際に動かして測った結果が以下である。条件は揃えて、すべて同じプロンプトで300トークンを生成させ、各モデル3回計測した平均を載せている(ばらつきはどのモデルも±0.5 tok/s以内で、再現性は良好だった)。

モデル種別サイズ生成速度プロセッサ
gemma4(7.5B級)dense9.6GB(収まる)約91 tok/s100% GPU
gpt-oss:20bMoE13GB(収まる)約73 tok/s100% GPU
qwen3:14bdense9.3GB(収まる)約51 tok/s100% GPU
gemma4:26bMoE17GB(超過)約35 tok/s84% GPU / 16% CPU
qwen3.6:27bdense17GB(超過)約7 tok/s90% GPU / 10% CPU
RX 9070 XTのローカルLLM生成速度のグラフ。gemma4 7.5Bが90.9、gpt-oss:20bが73.0、qwen3:14bが51.4、gemma4:26bが35.3、qwen3.6:27bが7.0トークン/秒

計測上の注意としては、ベンチを取るときは、前のモデルをアンロードしてから測ること(ollama stop モデル名)。Ollamaは使い終わったモデルもしばらくVRAMに残す仕様のため、常駐したまま次のモデルを測ると数値が大きく落ちる。ollama psで対象モデルだけがロードされていることを確認してから測るのが確実だ。実際、qwen3:14bは単独なら約51 tok/sだが、前のモデルが残った状態では約18 tok/sまで落ちた。

この表からは、RX 9070 XT(16GB)でローカルLLMを選ぶときの勘所が2つ読み取れる。

1つ目は、繰り返しになるが「16GBに収まるかどうか」だ。 VRAMに収まる上の3つはすべて100% GPUで処理され、51〜91 tok/sと快適に動く。一方、16GBを超える下の2つはモデルの一部がCPUに溢れ、途端に速度が落ちている。

gemma4:26bの実行結果。eval rate 28.95 tokens/sと、ollama psのPROCESSOR欄が16%/84% CPU/GPU

2つ目は、意外と見落とされがちな「MoEかdenseか」である。 これが本領を発揮するのは「溢れたとき」だ。下の2つはどちらも17GBで16GBを超過しているが、MoE(実際に使う=アクティブなパラメータが少ない)のgemma4:26bが約35 tok/sと実用圏に踏みとどまるのに対し、dense(全パラメータを毎回計算する)のqwen3.6:27bはわずか7 tok/sまで落ち込む。興味深いことに、CPUへ溢れた量はqwen3.6:27b(10%)のほうがgemma4:26b(16%)より少ないのに、速度は5分の1だ。サイズの数字(27B/26B)よりも、MoEかdenseか、つまり「毎回どれだけ計算するか」のほうが速度を強く左右することがよく分かる。VRAMに収まる側でも同じ理屈は生きていて、20B規模のMoEであるgpt-oss:20b(約73 tok/s)は、denseのqwen3:14b(約51 tok/s)より大きいのに速い。

結論として、RX 9070 XT(16GB)で快適に使いたいなら、「MoEモデル」か「14B級までのdenseモデル」を選ぶのが正解だ。最新の大型denseモデル(qwen3.6:27b・qwen3.8:27bなど)は性能こそ高いが、16GBにはやや荷が重い、と覚えておこう。

では、2026年9月時点でどれを入れるか。速度だけなら MoE の gemma4:26b と glm-4.7-flash が 30〜40 tok/s で並ぶ。どちらが上かは用途で割れる。GLM-4.7-Flash はコーディング系のベンチマークで評価が高い一方、日本語の質や知識の正確さには不満の声が多く、筆者のテストでも文体の指定(常体で書く)を落とした。日本語の文章が中心なら、まず gemma4:26b から試すのが無難だ。画像も読める。

なお、VRAMから溢れた分はメインメモリに載る。上の表でgemma4:26bが16%、qwen3.6:27bが10%を「CPU」で処理しているのは、その分がメインメモリ側へ回っているということだ。筆者環境はDDR5 64GBである。16GBに収まるモデルだけを使うなら関係ないが、溢れる前提の大きいモデルも試すつもりなら、VRAMだけでなくメインメモリの容量も見ておきたい。

【2026年9月追記】新しく出たモデルも測った

7月の計測のあと、Qwen3.8-27B(dense)と GLM-4.7-Flash(30B の MoE)を同じ RX 9070 XT で測った(Ollama 0.34.2・ROCm)。比較のため gemma4:26b も同じ回で測り直している。

モデル種別サイズ生成速度プロセッサ
glm-4.7-flash(30B)MoE19.5GB(超過)約35 tok/s81% GPU
gemma4:26b(同じ回)MoE18.4GB(超過)約30 tok/s78% GPU
qwen3.8:27bdense17.5GB(超過)約7 tok/s84% GPU
qwen3.8:27b(MTP版)dense18.1GB(超過)約10 tok/s76% GPU

上の表と同じ結論になった。GLM-4.7-Flash は 16GB を 3.5GB もはみ出しているのに約35 tok/s 出る。Qwen3.8-27B は dense なので約7 tok/s で頭打ちだった。MTP 版(先読みで複数のトークンをまとめて出す仕組み)にすると +40% になるが、それでも約10 tok/s である。

もう1つ、コンテキスト長について。4Kから32Kに伸ばしても、生成速度はほぼ変わらない。16GBから溢れているモデルでも同じだった。以前この記事に「溢れているモデルは伸ばすと遅くなる(GLM-4.7-Flash で約35→約29 tok/s)」と書いたが、同じ晩に4K・16K・32Kを続けて2周測り直すと、差はほとんど消えた。はっきり下がったのは GLM-4.7-Flash を Vulkan で動かしたときだけで、それも約1割だった(2026年10月訂正)。遅くなるのは、長い文章を読み込ませてから最初の1文字が出るまでの待ち時間のほうだ。長い文章を読ませる使い方なら、コンテキスト長とVRAMの実測も見てほしい。

それでも「dense の 27B を快適に動かしたい」なら、答えは設定ではなく VRAM の容量になる。16GB のまま工夫するより、VRAM の多い GPU を載せた構成を見積もったほうが早い。

\VRAMの多いGPUで見積もる/

GPU を足す以外に、メインメモリを GPU と共有する Ryzen AI Max+ 395 のミニPCという手もある。GMKtec の EVO-X2 には64GBと128GBの構成があり、2026年10月時点の公式セール価格は64GB版で34万7,999円からだった。筆者は持っていないので速度は測っていない。メモリの帯域は RX 9070 XT の半分以下なので、dense の 27B が速くなるとは限らない。向いているのは、16GBに収まらない大きな MoE を丸ごと載せる使い方だ。

\ミニPCの構成を見てみる/

VulkanとROCm、結局どっちが速いのか

バックエンド選びについても触れておく。「本命のROCmが速く、Vulkanは互換性用の遅い方」と思われがちだが、RDNA4に関してはこの図式は成り立たない。

llama.cpp界隈のベンチマークでは、gfx1201(RDNA4)において、トークン生成(tg)はVulkanがROCm/HIPと同等か上回るという報告が複数上がっている。一方で、プロンプト処理(pp。長い入力を読み込む速度)はROCmが有利な傾向がある。

つまり使い方によって答えが変わる。

  • チャットや文章生成が中心(体感を支配するのは生成速度)→ Vulkanで十分。むしろ速いことも
  • RAGや長文の読み込みが多い(入力処理が重い)→ ROCmに分がある可能性

幸い、LM Studioならランタイムをワンクリックで切り替えられる。同じモデル・同じプロンプトで両方のtok/sを見比べて、自分の環境の速い方を使えばよい。ドライバやランタイムの更新で結果が入れ替わることもあるので、「一度測って決めて、たまに測り直す」くらいの付き合い方がちょうどいい。

RX 9070 XT で実際に両方を測った結果は、VulkanとROCmの実測比較にまとめた。2026年9月の再計測では、生成速度は Vulkan が ROCm を上回った。

【まとめ】Windowsでも、RadeonのローカルAIは現実的な選択肢になった

お疲れ様でした!

かつては「動けば御の字」だったRadeonのローカルLLMも、ROCm 7.2の正式対応と、Ollama・LM Studioの進化によって、ようやくWindows上で「普通に使える」段階までやってきた。とりわけRX 9070 XTのようなRDNA4世代が公式サポートされた意味は大きい。

すでに当ブログのStable Diffusion記事でRadeon環境を整えている人なら、今回の手順はすんなり入れたはずだ。画像も文章も、自分のPCの中だけで生成する。そんな「ローカルAI環境」を、ぜひRX 9070 XTで組んでみてほしい。

【構成】この記事の実測環境

これから組む人のために、本記事のベンチを取った環境をもう一度まとめておく。ローカルLLMで効くのはGPUのVRAMと、モデルを置くストレージの2つで、あとは普通のデスクトップでよい。

パーツ筆者の構成効いてくる場面
GPURX 9070 XT(VRAM 16GB)ここで速度と載るモデルが決まる
ストレージM.2 NVMe SSDモデル1本で10GB単位。溜まる
メモリDDR5 64GBVRAMから溢れた分の受け皿
CPURyzen 9 7900XGPUに載りきれば出番は少ない

関連記事として、画像生成側の環境構築・高速化もあわせてどうぞ。

【Windows】RadeonでStable Diffusion環境構築【ComfyUI+ROCm7.2】
2026/09/20追記: ROCm 10対応の環境構築記事を公開した。ROCm 10はpip 2行で入り、Pythonの3.12縛りも無くなっている。これから構築する人はそちらを参照されたし。先日ROCm7.1.1での環境構築記事を公開し…
【Radeon】ComfyUIを高速化する4つの最適化設定とベンチマーク
ROCm 10が公開され、この記事の内容を再検証した。設定によっては効果がないものや、初期設定になったものなどがある。詳しくはこの記事を読んでほしい。前回の記事では、Windows環境におけるComfyUIの導入手順を解説した。環境構築を終…

参考文献

Windows support matrices by ROCm version — Use ROCm on Radeon and Ryzen
Hardware support – Ollama
https://digtvbg.com/blog/llama-server-vulkan-rdna4-vllm-rocm-benchmark

コメント

タイトルとURLをコピーしました