ガイド公開日
AIの答えが正しいか確かめるには。聞き直すより、答えの外側を見る
この記事で分かること
AIに「本当に合っている?」と聞き直しても、間違いはなかなか見つかりません。BenriWorksの開発でAIの誤りが実際に見つかった場面から、文書の中の計算、実物の画面、本番の応答、モデルと別の辞書という4種類の外側の証拠で確かめる方法をまとめます

目次 読みたいところから
AIの答えを信じてよいか迷ったとき、同じAIに「本当に合っている?」と聞き直すのは自然なやり方です。BenriWorksの図面解析ツールも、機器の種類をAIに2回尋ね、答えが一致すれば信頼度を上げる設計にしていました。ところが、図面に「MCCB」と書かれた機器を、AIは2回とも「MOTOR」と答え、信頼度が高いまま自動で確定させていました。聞き直しで見つからなかった誤りは、どこで見つかったのか。BenriWorksの開発で実際に誤りが見つかった4つの場面から、確かめ方をまとめます。
聞き直しで見つからない理由
図面解析ツールは、単線結線図(受電設備の機器とつながりを1本の線で描いた図面)をGoogleのGeminiに読ませ、機器と、機器どうしをつなぐ線を取り出します。線は3回読ませて票を合わせ、票がそろった線ほど信頼度を高くする設計です。
公開されている図面2枚について、保存してあった11回分の実行、合わせて524本の線を正解と突き合わせると、3回の票がそろった線のうち、正しかったのは47%でした。半分以上は、3回とも同じ誤りをしていたことになります。信頼度が基準を超えて「確定」扱いになった線が44本あり、そのうち41本が誤りだった実行もあります。
理由は、聞き直す相手が同じモデルだからです。同じモデルが同じ図面を見れば、読み違えやすい箇所も同じになります。隣の回路の線を取り違える、母線を二重に数える、といった誤りは偶然ではなく癖なので、何回聞いても同じ形で出てきます。票の一致は、答えが安定していることを示すだけで、正しいことは示しません。
外側の証拠になるもの
誤りが見つかった場面には、共通点がありました。どれも、AIの出力とは別の経路で同じことを確かめる外側の証拠を使っています。
| 確かめたいこと | 外側の証拠 | BenriWorksで見つけた例 | 届かない範囲 |
|---|---|---|---|
| 数字の読み取り | 文書の中の計算 | 見積書の検算(設計として組み込み) | 計算に現れない品目名や日付 |
| 操作手順の説明 | 実物の画面 | 講座の記述4か所の訂正 | 画面を開けない環境 |
| 設定があるかどうか | 本番の応答 | 「CSPはなし」という仕様書の誤り | 本番に出す前の変更 |
| 種類の分類 | モデルと別の辞書 | MCCBをMOTORとした分類 | 辞書にない表記 |
文書の中の計算
見積書は、読み取りの正しさを文書自身の数字で確かめられます。各行で数量×単価=金額が成り立ち、明細の金額を足せば小計になるからです。数字を1か所写し間違えると、どこかの計算が合わなくなりやすい。BenriWorksの構造化スタジオでは、この検算をすべて通った読み取り結果だけを確定データとして貯める設計にしています。仕組みは「LLMの読み取り結果を、検算を通ったときだけ信じる」に書きました。
ただし、数量と金額をつじつまの合う形で同時に読み違えれば計算は通りますし、品目名や日付の誤読は計算に現れません。この証拠が届くのは、文書の中で同じ情報が計算の形で重ねて書かれている部分だけです。
実物の画面
Claude CodeとCodexの使い方を解説する講座は、AIが公式ドキュメントをもとに下書きしました。あとから実際の画面を撮影すると、4か所が画面と食い違っていました。Codexの思考の深さを「5つ」と書いていたのに、画面には6つ並んでいた。権限の切り替えで出る3つの選択肢の名前が違っていた。Claude Codeのデスクトップアプリでは、書いたとおりのコマンドが使えなかった。読み込まれた設定ファイルの一覧が出るはずのコマンドで、一覧が出なかった。どれも文章として読む限りは自然で、画面を開くまで誰も気づいていません。
本番の応答
計測タグを16のサイトに入れたとき、作業の仕様書には「CSP(ブラウザが読み込んでよい相手を制限する設定)はどのリポジトリにも設定なし」と書いてありました。この一文を書いたのはAIで、ソースコードの中を文字列で検索し、見つからなかったから「なし」と書いていました。実際には2つのサイトで、CSPが関数やミドルウェアの中で組み立てられていて、計測タグの送信を止めていました。見つけたのは、公開中のサイトのHTTPレスポンスを見た、別のAIの報告書です。報告書には「HTTP 200やHTML内のID存在は、受信成功の代わりにはしていない」とも書かれていました。経緯は「GPT-6 Astra の Codex に、16サイトの疎通確認を任せた記録」にあります。
モデルと別の辞書
冒頭のMCCBの件は、機器の表記と種類の対応を並べた辞書を足すことで扱いました。図面の文字が辞書と完全に一致したのに、モデルの分類が辞書の種類と違えば、信頼度を下げます。辞書が何も言えない表記では、黙って何もしません。辞書はモデルに依存しないので、モデルが2回同じ誤りをしても、辞書の側は引きずられません。
外側の証拠がないとき
4種類のどれも使えない情報もあります。見積書の品目名や日付がそうです。そうした値は、原本のページ画像と読み取り結果を左右に並べて、人が目で確かめる前提にしています。
もう1つは、AIに推測させないことです。構造化スタジオでは、読み取れない値は推測で埋めずに空欄(null)で返すよう、出力の形式として約束させています。空欄なら後段の検査が止めてくれますが、推測でもっともらしく埋められた値は、見た目から区別できません。
正解データを作って点数で測る方法も、外側の証拠の1つです。ただし、正解データの作り方や採点の決まりを間違えると、点数そのものが誤ります。図面解析では、採点の決まりを直しただけで、AIの読み取り結果を1バイトも変えずに点数が0.517から0.787に動いたことがあります。その件は「AIの出力は同じ設定でも毎回違う。1回の結果で判断して間違えた記録」に書きました。

答えの外側を探す順番
振り返ると、誤りを見つけたのはいつも、答えそのものではなく答えの外側でした。見積書なら文書の中の計算、手順なら画面、設定なら本番の応答、分類ならモデルと別の辞書です。AIに答えを確かめさせたくなったら、その前に、答えとは別の経路で同じことを確かめられるものが手元にないかを探すところから始めてみてください。見つからなければ、そこが人が目で見る場所になります。
よくある質問
- AIに「本当に正しい?」と聞き直せば、間違いは見つかりますか
- 見つからないことが多いです。同じモデルは同じ誤り方をしやすく、BenriWorksの図面解析では、3回読ませて票がそろった線でも正しかったのは47%でした。図面にMCCBと書かれた機器を、分類でも確認でもMOTORと答えた例もあります。
- 外側の証拠には、どんなものがありますか
- 文書の中の計算(数量×単価=金額など)、実物の画面、本番の応答(HTTPヘッダーなど)、モデルに依存しない辞書の4種類を使っています。どれもAIの出力とは別の経路で、同じことを確かめます。
- 外側の証拠がない情報は、どう確かめればよいですか
- 原本と読み取り結果を並べて、人が目で確かめる前提にします。あわせて、読み取れない値は推測で埋めずに空欄で返すようAIに約束させると、もっともらしい誤りが混ざりにくくなります。




