AIファクトチェックの判定をどのモデルに任せるか 2026年9月の検証記録から
更新
先に結論 正解率だけで選ばない
判定に使うモデルは、正解を用意したテスト問題での正解率だけで選ばないほうが安全です。Rootpublishの検証では、合成データでは97%以上の正解率だったモデルが、実際のAI記事で見つかった自社サービスの言い過ぎ4件をどれも拾えませんでした。記録には「合成データの成績は、実際の記事での成績を保証しなかった」とあります。
この検証は6サイト・各12記事までの小さな標本で、人による確認も完了していません。そのため、ここで紹介する結果は「このモデルがいつも優れている」という根拠ではなく、モデルを選ぶときに何を確かめるべきかを考える材料として読んでください。
検証で何を確かめたか
ここでいう確認は、一般的な事実の真偽を調べることではありません。公開中のページを段落に分け、社名・サービス名・「当社」「私たち」などを含む段落を選び、会社概要・料金・サービスのページの記載と食い違っていないかを照合するものです。対象は各サイトの新しい記事12本までとし、食い違いの判定はClaude Opusで行い、候補はClaudeが読んで確かめました。人による確認は一部にとどまります。
モデルの比較では、5つのモデルに同じ281問を判定させました。内訳は、正解を用意した合成データ102問と、公開中のページから作った179問です。どの問いに正解が用意されているかは判定役に伝えていません。参加したのはClaude Opus 5.5・Sonnet 5・Haiku 4.5・Fable 5.1と、Codex経由のGPTです。Gemini CLIは認証の設定が足りず参加しませんでした。
合成データでは差が小さかった
合成データ102件での正解率は、Claude Opus 5.5とFable 5.1が100%、Sonnet 5が99%、Codex経由のGPTが97%、判定専用モデルのJevが97%、Haiku 4.5が88%でした。Haiku 4.5を除けば、差は数ポイントにとどまります。
5モデルの多数決では、合成データでの正解率は99%、矛盾の指摘の適合率と再現率はともに100%でした。適合率は「指摘したもののうち本当に食い違いだった割合」、再現率は「実際にある食い違いのうち指摘できた割合」です。
公開ページから作った179問では正解が用意されていないため、Jevの答えと多数決の一致率で比べました。一致は86.6%で、多数決が割れた28問のうち26問は「一致」と「言及なし」のどちらと見るかの違いでした。記事の記載が会社情報と合っているのか、そもそも同じことを述べていないのかの線引きで、モデルの判断が分かれやすいことがうかがえます。
実際の記事で差が出た
実際のAI記事で見つかった自社サービスの言い過ぎ4件は、JevとSonnetがどれも拾えず、Opusは拾えました。合成データでは近い成績だったモデルの間で、実際の記事では結果がはっきり分かれたことになります。
見つかった食い違いは、数値の単純な誤りより、自社サービスの範囲や条件を言い過ぎる記載が多くありました。無料診断で提供する範囲を実際より広く書く、サービス名を別の名前で書く、料金ページでは「最低契約期間なし」なのに最低契約期間を「3か月」と書く、自社の顧客事例の料金が料金ページの最安プランを下回る、といった記載です。合成データのように1文に1つの主張がはっきり書かれた問題とは、性質が違います。
6サイトの監査では、3サイトで会社情報との食い違いが見つかりました。AIで記事を量産している企業ブログでは12記事から4件(うち1件は判断が分かれる)、AI関連のコラムを出している企業1社では12記事から2件でした。手書きの個人ブログと、記事末尾の自社案内が定型文になっていた企業2社では、はっきりした食い違いは見つかっていません。
Rootpublish自身のサイトでも、322段落から2件が見つかりました。WordPress版の見出し「自動運営」「On autopilot」が、公開前に人の承認が必要という製品仕様と食い違うと判定されたため、見出しを「一次情報で育てる」「Grown from what you know」に変えて公開しました。公開後に同じページの129段落を再監査したところ、食い違いは0件でした。
判定専用モデルJevの得意と不得意
Jevは、選択肢ごとの確率を返す判定専用のモデルです。1文に1つの主張がある合成データでは、数値の食い違い、単位の言い換え、過去の料金への言及、二重否定を含む63組をすべて正しく判定しました。短く明確な主張どうしを比べる作業は得意だといえます。
一方で、会社情報の組み合わせをすべて照合すると、「承認」のように語が重なる会社情報どうしで、誤った指摘が出ました。適合率は、1対1で聞く方式で0.91、まとめて聞く方式で0.82です。実際のAI記事12本では、候補に挙げた22組がすべて誤りで、自社サービスの言い過ぎ4件は候補に入りませんでした。語の重なりに反応しやすく、文脈の中で範囲や条件を広げて書いた記載は拾いにくかった、というのがこの検証での傾向です。
指示の一文で答えが変わった
モデルの性能だけでなく、判定の指示の書き方も結果を左右しました。Sonnet 5は、実際のAI記事から選んだ114段落を判定し、矛盾を1件も挙げませんでした。サービス名を別の名前で書いた段落を検討してはいたものの、指示にあった「同じ語でも指す対象が違えば関係を判断しない」という一文を理由に、矛盾から外していました。同じ指示で、Opusは矛盾と判定しています。
この例から言えるのは、あるモデルが見逃したとき、その原因がモデルにあるのか指示にあるのかを切り分けて確かめる必要がある、ということです。誤判定を減らすために入れた一文が、見つけたい食い違いまで除外してしまうことがあります。
安いモデルで絞る設計が見逃した理由
費用を抑える方法として、判定専用モデルJevで確率0.3以上の候補だけを選び、それを多数決で確かめる二段の設計も検証しました。合成データでは適合率・再現率とも100%で、公開ページでは確かめが必要な組み合わせが875組中9組(約1%)に減りました。
しかし実際のAI記事では、この設計でも見逃しが残りました。一段目のJevが自社サービスの言い過ぎを候補に入れなかったため、二段目のモデルがどれだけ正確でも、判定する機会がなかったのです。二段の設計では、一段目で落とした食い違いは後から取り戻せません。
そこでRootpublishは、自社について述べた段落を語句の条件で選び、それをOpusで判定する方式に切り替えました。候補を絞る役を、モデルの判断ではなく語句の条件に任せた形です。
費用の目安
Jevで12記事・1,212段落を全件照合した費用は、公表単価で約0.25ドルでした。ただし、この方法では実際の食い違いを拾えていません。
自社について述べた段落(全体の約1割)だけを選んでOpusで判定する方式は、1記事あたり約0.05ドルと見積もっています。これは見積もりで、思考に使うトークン数は計測していません。実際の費用は、利用するモデルの料金体系や、選ばれる段落の数によって変わります。
この検証の限界
この監査は6サイト・各12記事までの小さな標本です。多くの判定はOpusの判定とClaudeによる確認にとどまり、人による確認は完了していません。実際の記事での比較結果も、人が確定させた正解との比較ではない点に注意してください。
段落を選ぶ語句の条件にも弱点があります。記事と会社情報で製品の呼び名が違うと、自社について述べた段落を取りこぼすことがあります。また、食い違いが見つかっても、会社情報の正本のほうが古ければ、直すべきは記事ではなく正本です。
自社の記事で判定モデルを選ぶ手順
ここからは、上の検証記録をもとにした編集上の提案です。この手順そのものを検証したわけではありません。
1. 照合の土台をそろえる。会社概要・料金・サービスなど照合に使う正本を決め、内容が最新かを先に確かめます。正本が古いままでは、正しい記事を誤りと判定しかねません。
2. 判定する段落を選ぶ条件を決める。社名・サービス名・「当社」「私たち」などを含む段落を対象にし、記事で使われがちな別の呼び名も条件に加えます。
3. 自社の既知の食い違いで試す。公開ベンチマークや合成データの成績ではなく、自社の記事で実際に見つかった範囲や条件の言い過ぎを数件用意し、候補のモデルがそれを拾えるかを確かめます。
4. 指示の文を点検する。見逃しが出たら、モデルの推論を読み、除外の理由が指示の一文にないかを確認します。
5. 候補を絞る段を置くなら、見逃しを確かめる。安いモデルで絞る場合は、3で用意した食い違いが一段目の候補に残るかを必ず確認します。
6. 費用は対象段落の数で見積もる。全段落を照合するか、自社について述べた段落だけにするかで、費用も見逃しの傾向も変わります。
7. 指摘は候補として人が確認する。判定モデルの出力で記事を直接書き換えず、人が本文と出典を見て判断します。Rootpublishでも、生成結果は承認待ちに保存し、公開権限を持つ人が本文と出典を確認して公開を決める設計です。
こうした確認は記載の正確さを保つためのもので、検索順位やAIからの引用の改善を約束するものではありません。