「RadeonでAIは動くのか」——数年前なら、答えは「動くには動くが茨の道」だった。
だが2026年のいま、Windows上のRadeonで画像生成もローカルLLMも普通に動く。 筆者は RX 9070 XT 16GB で、Stable Diffusion も Ollama も日常的に回している。
問題は、情報が散らばっていることのほうだ。 ROCmとVulkanのどちらを使うのか、どのバージョンを入れるのか、16GBで足りるのか。この記事では、これまで当ブログで実測してきた内容を1本にまとめて、読む順番まで示す。
なお、当ブログのRadeon関連記事はすべて同じマシン(RX 9070 XT 16GB)での実測である。伝聞や公式スペックの引き写しではない。
【結論】決めることは2つだけ
Radeonで生成AIを始めるとき、迷う点はこの2つに集約される。
1つ目は「何をやりたいのか」。 画像生成とローカルLLMでは、入れるものも詰まる場所も違う。
2つ目は「ROCmとVulkanのどちらを使うのか」。 そしてこれは、1つ目の答えによって変わる。
| やりたいこと | 使うバックエンド |
|---|---|
| 画像生成(Stable Diffusion / ComfyUI) | ROCm一択 |
| ローカルLLM(4B以下・MoE) | Vulkanが速い |
| ローカルLLM(12B以上の dense) | ROCmが速い(Vulkanは半分) |
| ローカルLLMで長文を読ませる | ROCmが速い |
画像生成をやるだけならVulkanは考えなくていい。 悩む必要があるのはLLM側だけである。根拠は後述する。
LLM 側の答えは 2026年9月の AMD ドライバ更新で入れ替わった。7月は「チャットなら Vulkan」だったが、いまは 12B 以上の dense モデルで Vulkan が半減している。数字は VulkanとROCmの比較 の追記に置いた。まだカードを持っていない人は、先に AMDとNVIDIAどっちを買うか を読んでから戻ってきてほしい。
【早見表】あなたが読むべき記事はどれか
先にここを見てほしい。全部読む必要はない。
なお、どれをやろうとしてもモデルの保存場所は必要になる。先に用意しておこう。
| やりたいこと | 読む記事 | 種類 |
|---|---|---|
| 画像生成をこれから始める | ROCm 10をWindowsに入れた | 手順 |
| すでに動いているが、遅い | ComfyUIを高速化する4つの設定 | 手順 |
| ROCmのバージョンで速度がどう違うか知りたい | 生成速度ベンチマーク | 実測データ |
| ROCm 7.1.1 の環境を組みたい | 旧バージョンの手順 | 手順 |
| ローカルLLMをこれから始める | ローカルLLM完全ガイド | 手順 |
| VulkanとROCm、どちらにするか決めたい | VulkanとROCm実測比較 | 実測データ |
| どのサイズのモデルまで載るか知りたい | Gemma 4を5サイズ実測 | 実測データ |
| どの ROCm を入れるか迷っている | WindowsのROCmはどれを入れる? | 判断 |
| ROCm 10 に上げるべきか知りたい | ROCm 10をWindowsに入れた | 実測データ |
| 動画生成をやりたい | 16GBでローカル動画生成 | 実測データ |
| 長文を読ませる・コンテキスト長を上げたい | コンテキスト長4K→32K | 実測データ |
| これから GPU を買う | AMDとNVIDIAどっちを買う? | 判断 |
【横断】RX 9070 XT 16GBで、何ができて何ができないか
16GBという枠が、できることの境界を決める。 これまでの実測を1枚にまとめる。
| やること | 可否 | 実測値 |
|---|---|---|
| Stable Diffusion 1.5 / SDXL | ◎ | ROCm 7.1で実用速度 |
| FLUX.1 | ○ | ROCm 10 で 41秒(7.11 の 3.2倍) |
| 動画生成 | △ | Wan 2.2 14B+蒸留LoRA で 5秒動画 6分30秒。メインメモリ 64GB 前提 |
| ローカルLLM 12Bまで | ◎ | VRAMに全部載る |
| ローカルLLM 26B | △ | VRAM超過で 33〜36 tok/s(9月・ROCm/Vulkan) |
| ローカルLLM 31B | ✕ | 4.7 tok/s |
26Bと31Bの間に崖があるのがこのGPUの特徴で、パラメータ数からは予想できない。MoEかDenseかで、溢れたあとの落ち方が7.4倍違うためだ。詳細はGemma 4の実測記事に書いた。
「16GBで足りるか」の答えは、LLMのサイズで決まる。 画像生成しかやらないなら16GBで困る場面はほとんどない。
動画生成は例外で、16GB では VAE デコードで溢れる。ノードの差し替えとメインメモリ 64GB で 14B まで完走した。詳細は 動画生成の記事。
なおVRAMが足りない場合でも、メインメモリが十分にあれば、速度は落ちるもののとりあえず動作させることは可能だ。
【横断】ROCmとVulkanの使い分け
ローカルLLMをやるなら、ここが最初の分かれ道になる。同じマシン・同じモデル・同じ日に測った結果がこれだ。
| 観点 | 速いほう | 差 | 例外 |
|---|---|---|---|
| トークン生成(4B以下・MoE 26B) | Vulkan | E4B 133 vs 100 tok/s(+33%)、E2B +35% | 12B以上の dense は ROCm が2〜2.8倍(gemma4 12B 60.5 vs 29.4、qwen3 14B 53.1 vs 19.2)。gpt-oss:20b も ROCm +44% |
| プロンプト処理(長文の読み込み) | ROCm | +50%〜5.4倍(E4B 4,815 vs 3,160、qwen3 14B 1,979 vs 365) | gpt-oss:20b はほぼ同じ |
4B以下の小さいモデルだけ Vulkan、12B以上と長文は ROCm。7月は逆だったが、AMD ドライバ 26.7 で Vulkan の 12B 級が半減した。Ollama でも LM Studio でも同じ結果で、ランタイムの版は関係なかった。最後は自分の常用モデルで測るしかないのは変わらない。
測り方も含めてVulkanとROCmの実測比較にまとめてある。
なお画像生成ではこの悩みは発生しない。ComfyUIはROCm一択である。
【画像生成】Stable Diffusion / ComfyUI を動かす
画像生成だけやりたいなら
もし、「今すぐ手っ取り早くStable Diffusionで画像生成をしてみたい」という場合は、ブラウザ上で完結するクラウド環境『ConoHa AI Canvas』を利用するのが一番簡単である。
複雑なインストール作業は一切不要で、スマホや非力なノートPCからでもすぐに高品質なAIイラストを作成できる。まずはクラウドで試してみよう。エントリープランは月500円と経済的だ。

まず環境を作る → ROCm 10
一番新しい手順がこれだ。これから始めるなら、ここから読めばいい。
2026年9月に ROCm 10 が Windows でも入るようになった。FLUX.1 は 133秒 → 41秒(3.2倍)、SD1.5 は 14% 遅くなり、SDXL は誤差。FLUX.1 を回すなら上げる価値がある、SD1.5 しか使わないなら一つ下の7.2が良いかもしれない。入れ方と数字は ROCm 10 の記事。
一つ古いバージョンでの詳細手順 → ROCm 7.2
古いバージョンでの手順も解説している。もしROCm 10で上手く行かなかった場合はこちらの記事を参考にしてほしい。詳しいやり方も解説している。
WSL2を使わず、Windowsネイティブで動かす手順である。
遅いと感じたら → 高速化の4設定
導入しただけのデフォルト状態では、Radeonの性能を使い切れていない。ただし ROCm 10 で効くのは COMFYUI_ENABLE_MIOPEN=1 の1つだけ(SD1.5 −38%・SDXL −31%)で、VAE まわりのソース改変は逆に遅くなる(SDXL +17%・FLUX.1 +28%)。7.1 系の人は既存の記事、ROCm 10 の人は 測り直しの記事 を読んでほしい。
バージョンで速度がどう変わるか → ベンチマーク
ROCm 6.4 / 7.1 / 7.11 をSD1.5・SDXL・FLUX.1で比較した。
6.4は7系の2〜3倍遅いので、古い記事を見て6.4を入れないこと。常用は7.1、FLUX.1中心なら7.11という結論だった。
この記事は 7.11 までの計測で、ROCm 10 との比較は 別記事 にある。6.4 → 7系の差は変わらず、7.11 → 10 は FLUX.1 だけ大きく伸びた。
動画生成もやるなら
こちらの記事を参照してほしい。
なお、動画生成はメモリの使用量が多く、メインメモリにも溢れてくる。メインメモリの増設もおすすめする。
【ローカルLLM】Ollama / LM Studio を動かす
まず動かす → 完全ガイド
OllamaとLM Studioの両方を、Windows上のRadeonで動かす手順。モデルの取得から最初の応答までを通しで書いてある。
バックエンドを決める → VulkanとROCmの実測比較
上の横断表の根拠になっている記事である。測り方も書いてあるので、自分のモデルで再現できる。
どのサイズまで載るか → Gemma 4を5サイズ実測
E2B / E4B / 12B / 26B / 31B の5サイズを全部動かした。
ダウンロードサイズとVRAM消費は一致しないという、実際に動かさないと分からない話も書いた。
長文を読ませるなら → コンテキスト長の実測
コンテキスト長を 4K から 32K にしても生成速度は落ちない。落ちるのは読み込みで、Qwen3 14B は 32K で 1/5。VRAM は Qwen3 14B が +4.7GB、Gemma 4 12B は +0.4GB とモデルで全然違う。16GB で長文をやるなら この記事 を読んでほしい。
【つまずきポイント】Radeonで詰まるのは、だいたいこの3か所
記事をまたいで同じ罠に何度もハマったので、先に共有しておく。どれも「エラーが出ない」のがたちが悪い。
古いROCmを入れてしまう
検索で上位に出る記事には ROCm 6.4 世代のものが混ざっている。 6.4は7系と比べて2〜3倍遅い。動いてしまうので気づきにくい。バージョンだけは確認して入れること。
内蔵GPUを掴んでいる
Ryzenなどの内蔵グラフィックスがあるマシンで、LM StudioのVulkanランタイムがdGPUではなく内蔵GPU側でモデルを実行してしまうことがある。
症状は「エラーは出ないのに異常に遅い」。筆者の環境では本来107 tok/s出るところが5.3 tok/sだった。タスクマネージャーでRX 9070 XTが暇をしていたら、これを疑う。
LM Studio は ROCm ランタイムと Vulkan ランタイムで GPU の番号が入れ替わる(ROCm: 内蔵=0/RX 9070 XT=1、Vulkan: 逆)ので、設定を使い回すと片方で内蔵GPUに載る。
VRAMに前のモデルが残っている
Ollamaは使い終わったモデルを既定で5分間VRAMに残す。 この状態で別のモデルを測ると大幅に遅くなる。ollama ps で空を確認してから測ること。
「Radeonは遅い」と言われる原因の一部は、この3つを踏んだままの計測である。
【ハードウェア】これから買うなら
GPU
ここまでの記事は、すべてこのカードで測っている。
カードだけ買っても、載せるPCが無い人はBTOでよい。GPU を RX 9070 XT に指定して、メモリ 64GB・SSD 2TB 以上で見積もると、このサイトの手順を全部なぞれる構成になる(根拠は AMDとNVIDIAどっちを買うか の【構成】の表)。
16GBという容量が、そのまま「どのモデルまで載るか」を決める。 画像生成が主目的なら十分に戦えるカードだ。LLMで26Bより上を常用したいなら、VRAMの大きいカードを検討する段階になる。
メモリ
VRAMから溢れたときのために、メインメモリも増設しておこう。
なお、動画生成と FLUX.1 は 64GB で完走した数字で、32GB は未検証である。
PCを買わずに試すなら
もし、「今すぐ手っ取り早くStable Diffusionで画像生成をしてみたい」という場合は、ブラウザ上で完結するクラウド環境『ConoHa AI Canvas』を利用するのが一番簡単である。
複雑なインストール作業は一切不要で、スマホや非力なノートPCからでもすぐに高品質なAIイラストを作成できる。まずはクラウドで試してみよう。エントリープランは月500円と経済的だ。

【まとめ】読む順番
画像生成をやりたいなら:
- ROCm 10で環境構築 で動かす
- 高速化設定 で速くする
- 動画もやるなら 動画生成の記事
ローカルLLMをやりたいなら:
- 完全ガイド で動かす
- VulkanとROCmの比較 でバックエンドを決める
- Gemma 4の実測 でモデルサイズを決める
- 長文をよませるなら コンテキスト長の実測
Radeonは、もう「AIには向かない」GPUではない。 ただし情報がNVIDIA前提で書かれていることが多く、そこで詰まる人が多い。この記事が最初の地図になれば幸いである。
まだGPUを持っていないなら AMDとNVIDIAどっちを買うか を読んで判断してほしい。














コメント