【実測】ローカルLLMは間違いの7割を見逃す。事実確認を任せるな

※当サイトはアフィリエイト広告(Amazonアソシエイト含む)を利用しています。

Radeon・ローカルAI

ローカルLLMに文章の下書きを書かせて、「間違いがあったら直して」と頼む。手元のGPUで動くので、何回頼んでも無料だ。便利なのは間違いない。

ただ、そのチェックをどこまで信じていいのかは、誰も測っていない。そこで、RX 9070 XT(VRAM 16GB)で動く11のモデルに、わざと誤りを入れた文を見せた。「原付一種の法定最高速度は時速40kmである」「RX 9070 XT の VRAM は12GBである」のような文だ。

結果は、55問中16問しか誤りを指摘できなかった。見逃した39問のうち30問は、迷いもなく「誤りなし」と言い切った。さらに4つのモデルは、この記事を書いている PC に刺さっている RX 9070 XT を「存在しない」と答えた。

この記事では、11モデルに14問を解かせた結果を全部出す。字数や文体の指定を守れるか、同じ問題を何回か解かせたら答えが変わるか、そしてWeb検索を使わせたら直るのかまで測った。

【結論】書くのが上手いモデルと、誤りに気づくモデルは別

計測は 2026年10月1日、RX 9070 XT 16GB・Ollama 0.35.0・コンテキスト4K で行った。誤り指摘は「3回ずつ」の列の多い順に並べた。

モデル16GBに載るか誤りの指摘(5問・1回目)同じ5問を3回ずつ(15回)字数・文体・箇条書き(6問)
Qwen3-Coder 30B-A3B溢れる4/511/150/6
Qwen3.8 27B溢れる2/58/155/6
Qwen3.6 27B溢れる2/58/154/6
Gemma 4 26B溢れる2/56/156/6
Gemma 4 12B載る2/56/156/6
gpt-oss 20B載る2/56/153/6
Qwen3.6 35B-A3B溢れる1/56/155/6
Qwen3.5 9B載る0/54/154/6
DeepSeek-R1 14B載る1/54/150/6
GLM-4.7-Flash溢れる0/50/152/6
Qwen3 14B載る0/50/151/6
  • 誤りに一番気づくのは Qwen3-Coder。ただし字数も番号の指定も1つも守れない
  • 日本語の指定を一番守るのは Gemma 4。26B も 12B も6問全部合格。ただし誤りは5問中2問しか気づかない
  • 両方で上位に入るモデルは無い
  • Web検索を持たせると、Qwen3.8 は15回全部正解した。ただし11モデル中5つは一度も検索しなかった

用途で分けるとこうなる。

やりたいこと選ぶもの理由
字数・文体を指定して書かせるGemma 4 12B6問全部合格。7.6GB で16GBに丸ごと載る。26B と同じ点数
文章の誤りを探させるQwen3.8 27B に Web検索を持たせる検索ありで15回中15回正解
16GBに収まる範囲で誤りを探させるgpt-oss 20B に Web検索を持たせる検索ありで15回中13回。13.8GB で丸ごと載る
事実確認を任せる検索なしなら任せない検索なしだと、一番良いモデルでも見逃すときは「誤りなし」と言い切る

【前提】何をどう測ったか

測ったのは、ブログを書くときに実際にローカルLLMへ頼むことだ。長い文章を自由に書かせるのではなく、指示どおりにできたかを機械で判定できる問題に絞った。

種類問題数判定
誤り指摘(誤りを入れた文)5問「誤り」と言い、正しい値まで書けたら合格
誤り指摘(正しい文・対照)2問「誤り」と言わなければ合格
誤り指摘(保険)1問理由まで読まないと判定できないので、人が読んで判定した
字数と文体の指定4問指定字数の±10%以内、かつ文体が守れたら合格
箇条書きの指定2問行数・1行の字数・番号なしを全部守れたら合格

誤り指摘は、全部同じ頼み方にした。

次の文に事実誤りがあれば指摘してください。無ければ「誤りなし」とだけ答えてください。

誤りを入れた5つの文はこれだ。どれも、このブログで扱っている分野で、調べればすぐ分かることを選んだ。

#見せた文正しくは
1原付一種(50cc)の法定最高速度は時速40kmである30km
2Radeon RX 9070 XT のビデオメモリは12GBである16GB
3パルワールドの招待コードのマルチプレイには最大8人まで参加できる4人
4Ollama でコンテキスト長を指定するパラメータは num_gpu であるnum_ctx
5オイル交換のとき、ドレンボルトのワッシャーは再利用するのが基本で交換は不要である毎回新品に交換

対照には「東京タワーの高さは333メートルである」と「Python の range(5) が返す整数は0から4までの5個である」を使った。何にでも「誤り」と言うモデルを見分けるためだ。

1回目は temperature 0(毎回同じ答えになる設定)で解かせた。誤り指摘の8問だけは、さらに temperature 0.7 で3回ずつ解かせた。普段チャットで使うときに近い設定で、答えがぶれるかを見るためである。

モデルは、Ollama の公式ライブラリでダウンロード数の多いものから、16GBの GPU で現実的に動く11個を選んだ。16GBで動く27〜30Bのモデルを速度で比べた記事とAIエージェントとして使えるかを試した記事で使ったものに、Qwen3.5・Qwen3.6・Gemma 4 12B・DeepSeek-R1 を足している。

思考モード(thinking)は切った。gpt-oss は切れないので「low」にした。DeepSeek-R1 も切れず、英語で考えた過程を答えの前に書く。画面では畳まれて見えない部分なので、考える過程を除いた答えだけを採点した。

【誤り指摘】ブログで扱う分野の事実ほど見逃す

問題ごとに、11モデル中いくつが正しく指摘できたかを並べる。

#誤り1回目(11モデル中)3回ずつ(33回中)
1原付の法定速度 40km04
2RX 9070 XT の VRAM 12GB14
3パルワールド 最大8人17
4Ollama の num_gpu721
5ワッシャーは再利用723

はっきり分かれた。num_ctx やワッシャーのような「技術文書によく出てくる事実」は11モデル中7つが気づく。ところが、原付の法定速度は11モデルとも見逃し、RX 9070 XT の VRAM とパルワールドの人数は11モデル中1つしか気づかなかった。

原付の30km制限は、日本の免許を持っている人なら誰でも知っている。それでも11モデルとも「誤りなし」と答えた。DeepSeek-R1 に至っては「原付一種(50cc)の法定最高速度は時速40kmです。誤りなし。」と、誤りを自分の言葉で言い直した。

4モデルが「RX 9070 XT は存在しない」と答えた

RX 9070 XT の問は、もっと奇妙なことになった。「誤りがある」と答えたモデルは11中5つあったが、正しく「16GB」と直したのは Qwen3-Coder だけだ。残りの4つは、こう答えた。

モデル答え(要約)
gpt-oss 20BRX 9070 XT は存在せず、VRAM も12GBではない
Qwen3.6 27BAMD は RX 9000 シリーズを発売していない。最新は RX 7000 シリーズ
Qwen3.6 35B-A3B2024年時点で RX 9070 XT は発売されておらず、存在しない
Gemma 4 12BRX 9070 XT という製品は発表・発売されていない

モデルが学習した時期より新しい製品なので、知らないこと自体は仕方がない。問題は、「知らない」ではなく「存在しない」と断定することだ。同じ立場で「公式の仕様は発表されていないため確認できません」と答えた Gemma 4 26B のほうが、まだ誠実である。

しかもこの4つは、判定としては「誤りあり」で合っている。判定が合っていても、理由が誤っている。指摘を鵜呑みにして直すと、別の誤りを持ち込むことになる。

保険の問は、11モデル全部が「誤りなし」

人が読んで判定した保険の問はこうだ。

バイクの任意保険は排気量が大きいほど保険料が上がるため、250ccから400ccに乗り換えると保険料も上がる。

これは誤りである。筆者は CB400SF の納車前に任意保険を見積もり、アクサと三井ダイレクトで CB250R に戻して同じ条件で取り直したところ、保険料は1円も変わらなかった。バイクの任意保険は「125cc以下」と「125cc超」で区分が分かれていて、その上は排気量で分けていないからだ(車両保険を付けない場合)。

ところが、1回目は11モデル全部が「誤りなし」と答えた。3回ずつ解かせた33回でも「誤り」と言ったのは5回だけで、理由まで筋が通っていたのは Qwen3.8 の1回(「250ccも400ccも同じ区分なので、排気量だけでは上がらない」)しか無い。

ほかの4回は、「誤り」という判定は合っていても理由がでたらめだった。gpt-oss は「250cc以下」「251〜400cc」「401〜600cc」という存在しない区分を作って説明し、Qwen3.5 9B は「車両価格が上がるから」と別の理由を持ち出した。「125cc超は同じ区分」と正しく言えたモデルは、1つも無かった。

正しい文を「誤り」と言うことは、ほぼ無い

対照の2問(東京タワー・range(5))を「誤り」と言ったのは、11モデルで計88回解かせたうちの2回だけだった(Qwen3 14B と Qwen3.5 9B が1回ずつ)。

つまり、どのモデルも疑いすぎるのではなく、信じすぎる。誤りがあっても無くても「誤りなし」と答えやすい。これが一番困る方向の偏りだ。誤りを見逃して「誤りなし」と返されると、確認したつもりになってしまう。

【ばらつき】同じモデルでも、聞き直すと答えが変わる

temperature 0.7 で同じ問題を3回解かせると、同じモデルでも答えが割れた。

モデル原付 40km(3回中)VRAM 12GB(3回中)パルワ 8人(3回中)
Qwen3-Coder023
gpt-oss 20B200
Qwen3.8 27B110
Qwen3.6 27B101
Qwen3.6 35B-A3B011
DeepSeek-R1 14B002

(ここに無い5モデルは、3問とも3回中0回)

Qwen3.8 は原付の問を、1回目(temperature 0)では「誤りなし」と答えた。3回聞き直すと1回だけ「30km」と直した。1回聞いて「誤りなし」だったから正しい、とは言えない。

逆に言えば、同じことを2〜3回聞いて、一度でも「誤り」と言われた箇所は調べ直す価値がある。チェックに使うなら、この使い方のほうがまだ安全だ。

11モデルのうち6つは16GBに収まらず、溢れた分はメインメモリに置かれる。用途ごとにモデルを切り替えるなら、メインメモリの側にも余裕が要る。

【書式】字数・文体の指定を守れるのは Gemma 4

次は、指示どおりに書けるかを見た。「だ・である調で200字ちょうど」のような指定だ。

モデル100字200字300字です・ます150字箇条書き3行箇条書き2行合格
Gemma 4 26B○ 105○ 198○ 301○ 147○○6/6
Gemma 4 12B○ 102○ 204○ 298○ 154○○6/6
Qwen3.8 27B○ 96○ 217○ 302× 132○○5/6
Qwen3.6 35B-A3B× 119○ 207○ 320○ 153○○5/6
Qwen3.6 27B○ 104○ 186× 399× 169○○4/6
Qwen3.5 9B○ 95× 153○ 294× 122○○4/6
gpt-oss 20B○ 110× 229× 236○ 154○× 字数超過3/6
GLM-4.7-Flash× 72× 139× 211× 91○○2/6
Qwen3 14B× 80× 141× 234○ 138× 字数超過× 字数超過1/6
Qwen3-Coder× 57× 84× 109× 106× 番号× 番号0/6
DeepSeek-R1 14B× 87× 370× 552× 224× 字数超過× 字数超過0/6

字数は空白と改行を除いて数え、±10%以内を合格にした。

Gemma 4 は、26B も 12B も6問全部合格した。12B は100字・200字・300字の指定を、102字・204字・298字で書いている。7.6GB で16GBに丸ごと載るので、書かせる用途なら 26B より 12B のほうが扱いやすい。

逆の端は Qwen3-Coder と DeepSeek-R1 だ。Qwen3-Coder は300字の指定に109字しか書かず、「番号を付けないこと」と書いても 1. 2. を付けた。DeepSeek-R1 は300字の指定に552字書き、箇条書きでは「1行40字以内」の指定に71字の行を書いた。

ただし、書式を守れることと、中身が正しいことは別だ。Qwen3.8 は「原付で通学するメリット」の150字で、「天候に左右されにくい点も魅力です」と書いた。原付ほど天候に左右される乗り物は無い。Gemma 4 26B は200字の回答で、数字を全部全角(「16GB」「70B」)で書いた。ブログにそのまま貼ると表記が揃わない。

【両立しない】書くのが一番上手いモデルと、誤りに一番気づくモデルは別

結論の表の上下の端を見ると、はっきり分かれている。

  • 書式 6/6 の Gemma 4 は、26B も 12B も誤り指摘 6/15
  • 書式 0/6 の Qwen3-Coder は、誤り指摘 11/15

GLM-4.7-Flash と Qwen3 14B はどちらも低いので、「書くのが上手いほど気づかない」とまでは言えない。ただ、両方で上位に入るモデルは1つも無かった。

理由は推測になるが、指示どおり滑らかに書くモデルは、渡された文をそのまま受け入れて続ける方向に強いのかもしれない。Qwen3-Coder は、コードのバグを探すように文を疑ってかかる。いずれにしても、「書かせるモデル」と「チェックさせるモデル」は分けたほうがいい。

【検索あり】Web検索を持たせたら、どこまで直るか

ここまでは、モデルが覚えている知識だけで答えさせた。では、Web検索を使っていいことにしたらどうなるか。

11モデルとも、Ollama のツール呼び出しに対応している。そこで DuckDuckGo の検索(上位5件のタイトル・要約・URL)を返すツールを1つ渡して、同じ8問を解かせた。頼み方は同じで、最初に「web_search ツールが使える。自信が無いときは必要に応じて検索してから答えて」と一言添えただけだ。検索するかどうかはモデルに任せた。

結果はこうなった。左が検索なし、右が検索ありである。

モデル1回目(5問)3回ずつ(15回)検索した回数(32回中)
Qwen3.8 27B2 → 58 → 1528
gpt-oss 20B2 → 46 → 1324
Qwen3.6 27B2 → 48 → 1315
Qwen3.5 9B0 → 34 → 1115
Qwen3.6 35B-A3B1 → 36 → 80
Gemma 4 26B2 → 26 → 60
Gemma 4 12B2 → 26 → 60
GLM-4.7-Flash0 → 10 → 416
DeepSeek-R1 14B1 → 04 → 40
Qwen3 14B0 → 10 → 30
Qwen3-Coder4 → 211 → 624

Qwen3.8 は、検索ありで15回全部正解した。検索なしでは5問中3問を「誤りなし」と言っていたモデルが、別物になった。gpt-oss と Qwen3.6 27B も13回まで上がった。一番小さい Qwen3.5 9B でも4回 → 11回で、6.6GB のモデルが検索なしの Qwen3-Coder と並んだ。

面白いのは Qwen3.8 の検索語だ。VRAM の問では「Radeon RX 9070 XT VRAM 16GB」、Ollama の問では「Ollama コンテキスト長 指定 パラメータ num_ctx」と検索している。調べる前から、正しい値を知っていたのである。知っているのに、検索なしで聞くと「誤りなし」と答える。検索ツールは、モデルの中にある知識を引き出すきっかけにもなっているらしい。

ところが、全部のモデルがこうはならなかった。

11モデル中5つは、一度も検索しなかった

「自信が無いときは検索して」と書いたのに、Gemma 4(26B・12B)、Qwen3.6 35B-A3B、DeepSeek-R1、Qwen3 14B の5つは、32回中1回も検索しなかった。

つまり、自信が無いことに気づけないモデルは、検索ツールを渡しても使わない。「誤りなし」と言い切るモデルは、言い切る前に調べようともしない。同じ Qwen3.6 でも、27B は15回検索し、35B-A3B は1回も検索しなかった。世代やメーカーではなく、モデルごとの癖である。

検索結果に答えが出ているのに、「誤りなし」と答える

一番意外だったのは Qwen3-Coder である。24回検索したうえで、検索なしより成績が落ちた(11回 → 6回)。

検索結果を見直すと、答えはちゃんと出ていた。たとえば Ollama の問で、Qwen3-Coder は「Ollama context length parameter」と検索した。上位5件の2つ目には「num_ctx 2048 … Context window size」と書いてある。それでも答えは「誤りなし」だった。

上位5件のどこかに正しい値(「30km」「16GB」「4人まで」「num_ctx」)が出ていた回を数えると、検索したモデル全体で73回あった。そのうちモデルが正しく直せたのは54回で、4回に1回は、答えを目の前にして「誤りなし」と返した。

モデル検索結果に正しい値が出ていた回そのうち正しく直せた回
Qwen3.8 27B1616
Qwen3.6 27B1212
Qwen3.5 9B55
gpt-oss 20B1412
GLM-4.7-Flash103
Qwen3-Coder166

検索は「調べる」ところまでしかやってくれない。読んで、自分の答えと食い違っていると気づけるかは、モデルの力である。Qwen 系の汎用モデル(3.5・3.6・3.8)はそこができて、コード用の Qwen3-Coder はできなかった。

検索ありで新しく出た失敗

Qwen3 14B は検索しなかったうえに、正しい文(東京タワー333m)を「誤り」と言い始めた。4回中4回だ。1回目の中身は「約333メートルの高さは東京スカイツリーの高さです」という同じ文の繰り返しだった(スカイツリーは634m)。

頼み方を変えた(system に一言足し、チャット形式にした)だけで、答えが変わったことになる。逆に Qwen3.6 35B-A3B は、検索を1回もしていないのに点数が上がった(6回 → 8回)。頼み方の違いだけで、±2回くらいは動くと見ておいたほうがいい。

保険の問を正しく答えられたのは、検索した Qwen3.8 の1回だけ

保険の問は、検索ありでは44回中8回が「誤り」と言った。理由まで筋が通っていたのは4回で、Gemma 4 12B の2回(検索はしていない)、gpt-oss の1回、そして Qwen3.8 の1回だ。

その Qwen3.8 の1回は、三井ダイレクトの車種区分を検索で確かめ、「125cc以下と125cc超の2区分なので、250ccと400ccは同じ区分。保険料は基本的に変わらない」と答えた。検索なし・検索ありを合わせた88回の中で、理由まで完全に正しかったのはこの1回だけである。検索結果の1件目には、筆者の見積もり記事が出ていた。

ただし Qwen3.8 は、残りの3回で答えを出せなかった。「125cc超 250cc超 400cc 保険料 同じ区分」のように検索語を変えながら5回以上調べ続け、1問あたりの検索の上限(5回)に達して終わっている。調べすぎて時間切れになったわけだ。上限を上げれば、正解の数は増えたかもしれない。

【使い分け】ローカルLLMで文章を書くなら、こう使う

この結果から、筆者はこう使い分けることにした。

  1. 下書きは Gemma 4 12B に書かせる。字数・文体の指定を一番守り、16GBに丸ごと載る。数字の全角だけは置換で直す
  2. 誤り探しは Qwen3.8 に Web検索を持たせてやらせる。検索ありでは15回全部直した。16GBに収めたいなら gpt-oss 20B に検索を持たせる(15回中13回)
  3. 検索ツールを渡すなら、検索するモデルを選ぶ。Gemma 4・DeepSeek-R1・Qwen3.6 35B-A3B に渡しても使わない
  4. 「誤りなし」は信じない。特に、日付・数値・製品の仕様・法律は、モデルの答えではなく一次情報で確かめる
  5. 指摘の理由も確かめる。「誤りあり」の判定が合っていても、理由が誤っていることがある(「RX 9070 XT は存在しない」)

この使い分けは、全部 RX 9070 XT 1枚の上でやっている。11モデルとも Ollama で呼び出すたびに読み込み直すだけで、GPU を替える必要は無い。

ローカルLLMの環境づくりから始める人は、RadeonでローカルLLMを動かす完全ガイドから読んでほしい。

【計測環境と方法】

項目内容
GPURadeon RX 9070 XT(VRAM 16GB)
実行環境Windows 11 / Ollama 0.35.0 / ROCm ランタイム
コンテキスト長4,096(検索ありは 8,192)
検索DuckDuckGo(ddgs)上位5件のタイトル・要約・URL。1問あたり最大5回まで呼べる
量子化Q4_K_M(gpt-oss だけは配布されている MXFP4)
思考モード切った(gpt-oss は low。DeepSeek-R1 は切れないので考える過程を除いて採点)
1回目temperature 0・seed 42
ばらつき誤り指摘の8問だけ temperature 0.7・seed 1, 2, 3
判定正規表現で機械判定。保険の問だけ人が読んだ(正解は筆者の見積もり結果)
計測日2026年10月1日

【この計測の限界】

  • 誤りを入れた文は5つだけで、分野も筆者のブログに寄っている。医療や歴史の事実では結果が変わる可能性がある
  • 判定は機械なので、「誤りあり」と言っても正しい値を書かなかった回答は不合格にした(「存在しない」と答えた4モデルなど)。逆に、正しい値を書いたうえで余計な誤りを足した回答は合格にしている
  • 思考モードを切っている。思考させれば、誤りに気づく割合は上がるかもしれない(そのぶん遅くなる)
  • 検索ありは Ollama のチャット形式(/api/chat)と system の一言を使ったので、検索なし(/api/generate)と頼み方が少し違う。検索しなかった5モデルのうち3つは点数が同じで、Qwen3.6 35B-A3B は上がり、Qwen3 14B は対照を誤りと言い出した
  • 検索は1問あたり5回までにした。Qwen3.8 は保険の問で3回この上限に達して答えを出せず、GLM-4.7-Flash も1回達した。上限を上げると結果は変わる
  • 検索結果は日によって変わる。今回の上位5件は全部記録してある
  • 11モデルとも、モデルの知識はある時点で止まっている。RX 9070 XT やパルワールドの人数を知らないのは、新しすぎるせいかもしれない。ただ、それでも「知らない」ではなく「誤りなし」や「存在しない」と答えたことは変わらない

【まとめ】

  • 11モデルが、誤りを入れた文の7割を見逃した。55問中、正しく指摘できたのは16問
  • 見逃すときは「誤りなし」と言い切る。39問中30問。原付の30km制限は11モデルとも見逃した
  • 4モデルが、実在する RX 9070 XT を「存在しない」と答えた。判定が合っていても理由が誤っていることがある
  • 同じモデルでも、聞き直すと答えが変わる。1回の「誤りなし」は根拠にならない
  • 書式を守るのは Gemma 4(26B も 12B も6/6)、誤りに気づくのは Qwen3-Coder(11/15)。両方できるモデルは無い
  • Web検索を持たせると Qwen3.8 は全問正解した。ただし11モデル中5つは一度も検索せず、Qwen3-Coder は検索結果に答えがあっても「誤りなし」と返して成績が落ちた。検索ツールは「使えるモデル」に渡して初めて効く

ローカルLLMは、書かせるには十分使える。ただし、確認は人間の仕事のままである。

16GBのまま、用途ごとにモデルを切り替えて使うのが今のところ一番いい。書かせるのは Gemma 4 12B、調べさせるのは検索を持たせた Qwen3.8、というように、ひとつのモデルに全部を頼まない構成のほうが効く。

\VRAM の多い GPU で見積もる/

速度で選ぶなら、27〜30Bのモデルの生成速度を比べた記事にまとめてある。

参考文献

コメント

タイトルとURLをコピーしました