ハルシネーション(幻覚)は大幅に改善されている
AIを業務に活用しようとする際、多くの担当者が最も懸念する問題の一つが「ハルシネーション(幻覚)」である。AIが事実とは異なる情報を、あたかも正確であるかのように生成してしまう現象だ。結論から書けば、ハルシネーションは「大幅に改善されている」。ただしそれは、ある特定の測定条件の下での話である。「何を測った数字か」を言えないまま「0.7%まで下がった」と語ることは、改善を語っているようでいて、実際には何も語っていない。本稿では、流通している数値の出所を一つずつ特定し、その測定条件を明示したうえで、改善が製薬・医療機器のGxP(規制対象業務)にとって何を意味するのか――そして何を意味しないのか――を整理する。
本稿の骨子:ベンチマークの改善は、実務条件での改善を意味しない
- 広く引用される「0.7〜1.5%」は、与えた文書を要約させ、その要約が原文と食い違っていないかだけを測った数字である。事実そのものの正しさを測った数字ではない。
- 同じ運営主体・同じ指標でも、評価に使う文書プールを入れ替えただけで最良値が0.7%から1.8%に変わった(2026年5月時点)。数字は測定条件に強く依存する。
- そして規制の側は、そもそも精度を問題にしていない。EU GMP Annex 22 のドラフトは、LLMを重要なGMP適用業務に使うべきでない理由として、精度ではなく「同じ入力に対して同じ出力を返すとは限らない」ことを挙げている。
- 「精度が上がった」ことと「検証できる」ことは、まったく別の事柄である。本稿の後半はこの一点に費やされる。
ハルシネーションとは何か
問題の本質
ハルシネーションとは、AIが学習データに基づかない情報や、存在しない事実を「創作」してしまう現象を指す。例えば、実在しない論文を引用したり、架空の統計データを提示したりすることがこれに該当する。従来のAIシステムでは、この問題が深刻であった。特に以下のようなケースで頻発していた。
専門的な知識を問われた場合
存在しない専門用語や、誤った技術的説明を自信満々に提示することがあった。医療や法律など、正確性が求められる分野では特に問題となっていた。この点については実証データがある。米国の法律ドメインで汎用LLMの回答を検証した研究では、判例に関する事実を問う質問に対して少なくとも58%の割合でハルシネーションが生じた(Journal of Legal Analysis 第16巻 64〜93頁、2024年。査読付き)。
具体的な数値やデータを求められた場合
売上データや統計情報など、正確な数値が必要な場面で、もっともらしい数字を「でっち上げる」ケースが散見された。本稿がまさにその実例に直面したことは、後述する。
なぜハルシネーションは起こるのか
ハルシネーションが発生する主な理由は、AIが「知識の有無」ではなく「文脈の流れ」を重視して文章を生成する性質にある。AIは膨大なテキストデータから言語のパターンを学習しているが、その情報が正確かどうかを独自に検証する仕組みを持っていなかった。つまり「この文脈では、このような情報が来るのが自然である」という判断に基づいて文章を生成するため、実際には存在しない情報でも、文脈上自然であれば生成してしまうのである。
この仕組みそのものについては、当社の別稿GPTは確率論に基づく次トークン予測技術で詳しく扱っている。
2026年、この現象に査読付きの説明が与えられた
2026年4月に Nature に受理された論文「Evaluating large language models for accuracy incentivizes hallucinations」(OpenAI/ジョージア工科大学)は、ハルシネーションを訓練目的と評価指標が生む構造的な帰結として説明した。要旨は次の2点である。
次単語予測による事前学習は、誤りのない理想的なデータを使ったとしても、ハルシネーションへの統計的圧力を生む。学習データ中に繰り返し現れない事実(一回限りの細部など)は不可避的な誤りをもたらすのに対し、文法のような反復的規則性はそうならない。
そして、正解率(accuracy)のような支配的な指標は、不確実性を認めることよりも当て推量を体系的に報奨する。
出典:Kalai, A. T., Nachum, O., Vempala, S. S., Zhang, E. “Evaluating large language models for accuracy incentivizes hallucinations”, Nature(2026年4月15日受理、DOI: 10.1038/s41586-026-10549-w)要旨より要約この論文が本稿の主題に対して持つ意味
「ベンチマークのスコアが上がった」という事実そのものが、「当て推量を報奨する指標を最適化した結果」でありうるということである。正解率で競わせるリーダーボードは、モデルに対して「わからない」と答えるより「それらしく答える」ことを促す。したがってベンチマークの改善を、そのまま「AIが正直になった」と読み替えてはならない。同じ著者らによる先行研究「Calibrated Language Models Must Hallucinate」は、計算機科学の主要国際会議 STOC 2024 で発表されている。
「大幅に改善された」という数字は、どこから来たのか
ここが本稿の中心である。ハルシネーションの改善を語る文章には、判で押したように数値が並ぶ。その数値の出所を、一つずつ確かめた。
「0.7〜1.5%」の正体――要約タスクの根拠一致度である
この数値レンジは特定できた。Vectara社(米国の検索・RAG基盤ベンダー)が公開している Hallucination Leaderboard の、HHEM-2.1 版(2025年10月16日更新時点)の上位モデルの値である。同リーダーボードでは、Google Gemini-2.0-Flash-001 が0.7%、OpenAI GPT-4o が1.5%と記録されている。
問題は、この「ハルシネーション率」が何を測った数字かである。運営者自身の説明はこうである。
このリーダーボードは、LLMが文書を要約する際にハルシネーションを導入する割合を評価する。モデルには「与えられた情報のみを用いて」文書を要約させ、要約が原文書と事実整合的か(factually consistent)を判定して、100から正解率を引いた値をハルシネーション率とする。
(FAQより)「これは、モデルがハルシネーションを起こしうるあらゆる経路を決定的に測定するものではない」――同意する。我々はハルシネーション検出の問題を解決したと主張していない。/これを単独の指標として用いることは推奨しない。
出典:Vectara, Hallucination Leaderboard(GitHub: vectara/hallucination-leaderboard)README および FAQ より要約・抄訳つまりこの数字は、「手元に渡した文書に書いてあることから逸脱しなかった割合」である。渡していない知識を問われたときに正しく答えられるか、という一般的な意味での正確性は測っていない。判定を行うのも人間ではなく、Vectara社が開発した商用の判定モデル(HHEM)である。評価に用いる文書プールは、過学習を防ぐという理由で非公開とされており、第三者が同じ条件で再現することはできない。
「0.7%」を自社の業務に持ち込めない理由
GxPの現場でLLMに期待される作業――逸脱報告の起案、SOPの改訂案作成、査察指摘への回答案、規制文書の要約――のうち、「渡した文書の範囲内に留まればよい」という構造を持つものは、要約だけである。それ以外は、渡していない知識(規制要件、社内の過去事例、製品固有の背景)を参照させることが前提になる。0.7%という数字は、その場面の性能について何も語っていない。
「2021年に21.8%であった」――出所を特定できなかった
この記事の初出稿は「2021年に21.8%であったハルシネーション率が、2025年には0.7〜1.5%まで低下し、約96%の削減を達成した」と書いていた。この「21.8%」および「96%削減」の出所は、特定できなかった。
確認した内容は次のとおりである。
- 「0.7〜1.5%」の出所である Vectara の Hallucination Leaderboard は、HHEM-1.0 版の記録が2024年7月25日更新分まで遡れるにとどまる。2021年時点の測定値は存在しない。
- 同リーダーボードの全バージョン(HHEM-1.0/HHEM-2.1/HHEM-2.3)の掲載値を確認したが、21.8% という値は存在しない。HHEM-1.0 版(2024年7月)の最悪値は22.4%、上位は GPT-4 Turbo の2.5%であった。
- 「21.8% → 0.7%、96%削減」という言い回しは、AI関連の解説記事・統計まとめサイトに複数見られるが、いずれも一次の測定報告を示していない。
なお当社は過去に、「AIのIQは136」という単一ソースの数値をそのまま紹介して事故を起こしたことがある(出所は一般公開版のテストで、同じ提供元の非公開版では同じモデルが116であった)。単一ソースの数値を一般化しないという方針は、この経験から来ている。
同じ運営主体・同じ指標でも、文書プールを替えれば数字は変わる
「測定条件が数字を決める」ことを最もよく示すのは、Vectara 自身の更新履歴である。同社は2026年、判定モデルを HHEM-2.3 に更新し、評価用の文書プールを法務・医療・金融・教育・技術など多分野の7,700件超に拡大した。その結果が次である。
| 版・更新時点 | 最良モデルの値 | 主要モデルの値 | 最悪値 |
|---|---|---|---|
| HHEM-2.1 (2025年10月16日更新/旧文書プール) | 0.6%(AntGroup Finix-S1-32B) 0.7%(Google Gemini-2.0-Flash-001) | GPT-4o 1.5%/GPT-5-high 1.4%/OpenAI o1-mini 1.4% | 29.9% |
| HHEM-2.3 (2026年5月11日更新/新文書プール7,700件超) | 1.8%(antgroup/finix_s1_32b) | gpt-5.4-nano 3.1%/gpt-5.4 7.0%/gemini-2.5-pro 7.0%/o3-pro 23.3% | 24.2% |
同じ運営主体が、同じ「要約の根拠一致度」という指標で測って、最良値が0.6%から1.8%に変わった。モデルが劣化したのではない。測る対象の文書を替えただけである。
さらに注目すべきは、推論に長い時間をかける上位モデルが、この指標では下位に沈んでいる点である。o3-pro は23.3%、gpt-5.4-pro は8.3%であるのに対し、小型で安価な gpt-5.4-nano は3.1%である。「最新かつ高性能なモデルを選べば安全」という直感は、この指標に関する限り成り立たない。
「ベンチマークで1.5%、実務では45%、最大30倍の乖離」は書かない
初出稿にあったこの記述も、本稿では採用していない。「45%」の出所が特定できず、かつ「1.5%」と同一の測定条件で得られた値でないため、両者を割って倍率を出すことができないからである。異なる調査の数字を割り算して倍率を作る操作は、それ自体がハルシネーションと同じ構造を持つ。
乖離が存在することは事実であり、それは同一条件どうしを比べても示せる。上表のとおり、同一の運営主体(Vectara)が同一モデル(antgroup/finix_s1_32b)を評価しても、文書プールを旧データセット(CNN/Daily Mail由来の831文書)から現行データセット(7,700件超の記事)へ替えるだけで最良値は0.6%から1.8%へ、約3倍になる。ただし旧版と現行版では評価モデルの版(HHEM-2.1系/HHEM-2.3)も異なる点には留意が必要である。また後述の法律ドメインの研究は、同一の研究グループが同一の手法で、汎用LLM(58%以上)と法律専用RAGツール(17〜33%)を測っている。倍率を語るなら、この種の比較に基づいて語るべきである。
「測定条件 × 報告値 × 調査主体・時点」の一覧
本稿が裏取りできた測定結果を、数値を裸で並べず、必ず測定条件とセットで示す。自社の用途がどの行に近いのかを見定めることが、導入判断の出発点になる。
| 何を測ったか(測定条件) | 報告されている値 | 測定・公表主体 | 時点・母集団 | 査読 |
|---|---|---|---|---|
| 要約の根拠一致度。与えた文書を「その情報のみで」要約させ、要約が原文と事実整合的かを判定モデルで採点 | 最良0.6〜0.7%/GPT-4o 1.5%/最悪29.9% | Vectara(商用ベンダー)。判定も同社の商用モデル | HHEM-2.1/2025年10月16日更新/文書プール非公開 | なし(自社評価) |
| 同上の後継版。判定モデルと文書プールを更新 | 最良1.8%/gpt-5.4 7.0%/o3-pro 23.3%/最悪24.2% | 同上 | HHEM-2.3/2026年5月11日更新/7,700件超の多分野文書 | なし(自社評価) |
| 法律実務の調査質問。RAGを搭載した法律専用AIツールに米国法の調査質問を投げ、法律家が回答を手作業で採点 | 17〜33%(正確な回答率は Lexis+ AI 65%、Westlaw AI-AR 42%) | スタンフォード大学 RegLab/HAI ほか | 202問・事前登録(プレレジ)済み設計/2024年実施 | あり Journal of Empirical Legal Studies 22巻 216〜242頁(2025年) |
| 汎用LLMへの法律質問。米国判例の事実を汎用チャットボットに問う | 58%以上 | 同一研究グループ | 2024年 | あり Journal of Legal Analysis 16巻 64〜93頁(2024年) |
| 臨床ノート生成。診察のやり取りから臨床ノートを生成させ、臨床医が文単位で誤りを注記 | ハルシネーション 1.47%/記載漏れ 3.45% | 英国の研究グループ(CREOLA 枠組み) | 18の実験構成・臨床医が注記した12,999文 | あり npj Digital Medicine(2025年5月13日) |
| 公衆衛生QAでのRAG。PubMed・WHO IRIS 由来の設問に対し、多証拠誘導型RAG枠組みを適用 | 基準モデル比で 40%超のハルシネーション低減 | 復旦大学 公衆衛生学院ほか | HealthQuestDB 890問/2025年10月8日公表 | あり Frontiers in Public Health 13巻 |
| 臨床試験QAへの検証層付加。構造化臨床DBと情報理論に基づく分類器(CHECK)で出力を検証 | 31% → 0.3%(Llama3.3-70B-Instruct) | Moffitt Cancer Center/カリフォルニア大学サンフランシスコ校 | 主要臨床試験100件からの1,500問/2025年6月 | なし(arXivプレプリント・査読前) |
タスクの複雑さによる性能差
初出稿は、タスクの複雑さ別に5段階の数値レンジを掲げていた。本稿では、裏取りできた行のみを残し、出所を特定できなかった値(オープンドメイン長文QAの「最大45%程度」「実ユーザー対話で31〜60%」、医療の「平均3%、最大18.7%」、専門分野の「平均4〜6%程度」)は採用していない。ただし、「タスクの複雑さに強く依存する」という論旨そのものは、上表によって支持される。
| タスクの型 | 裏取りできた実測レンジ | 根拠 |
|---|---|---|
| 与えた文書の要約(根拠内に留まればよい) | 1.8〜24.2%(モデル差が大きい) | Vectara HHEM-2.3/2026年5月 |
| 専門文書に基づく構造化生成(臨床ノート) | ハルシネーション1.47%/記載漏れ3.45% | npj Digital Medicine/2025年 |
| 専門知識ベースへのRAG検索を伴う調査(法律) | 17〜33% | JELS 22巻/2025年 |
| 外部知識に依存する自由回答(汎用チャットボット・法律) | 58%以上 | JLA 16巻/2024年 |
この4行を並べると、初出稿が言いたかったことがむしろ鮮明になる。「根拠を渡す」構造から離れるほど、ハルシネーション率は桁で悪化する。自社の用途がどの行に該当するかを正確に評価することが、導入の成否を左右する。
ハルシネーション改善の主要アプローチ
- 不確実性の明示化
最新のAIモデルでは、自身の知識に対する「確信度」を評価する技術の開発が進んでいる。確信度が低い情報について「この情報は不確実である」と明示する、複数の可能性を提示して断定を避ける、情報源の確認を推奨する、といった対応である。
ただしこれらの技術の多くは現在も研究段階であり、商用モデルへの完全な実装は限定的である。前掲の Nature 論文は、この機能が普及しない理由を指摘している。正解率で順位づけるリーダーボードの下では、「わからない」と答えるモデルは不利になるからである。同論文は対策として、誤答にどの程度の罰則が課されるかを評価側が明示する「オープンルーブリック」型の評価を提案している。
例えば「2024年の世界GDP成長率は何パーセントか」という質問に対して、望ましい応答は具体的な数値を断定することではなく、「最新の正確な数値はIMFや世界銀行などの公式統計を参照されたい」と誘導することである。そのような応答を「不正解」と採点する評価方式が続く限り、この方向の改善は進みにくい。 - 検索機能との統合(RAG)
AIが自身の知識だけに頼らず、外部情報を検索・参照して回答を生成する技術がRAG(Retrieval-Augmented Generation)である。従来は学習時点までの情報のみに基づいて回答していたため、最新情報や学習していない詳細を問われるとハルシネーションのリスクが高まった。RAGでは、質問内容に応じて信頼性の高い情報源から情報を取得し、それに基づいて回答を生成する。
効果は実証されている。公衆衛生QAを対象とした査読付き研究(Frontiers in Public Health、2025年10月)では、多証拠誘導型のRAG枠組みにより基準モデル比で40%超のハルシネーション低減が報告された。
ただし「RAGでハルシネーションはなくなる」は誤りである。後述のとおり、これは規制対応上きわめて重要な論点である。 - 引用と根拠の明示 情報の出典を明示する機能が強化され、ユーザーが情報の信頼性を自ら判断できるようになった。AIの回答に不正確な部分があっても、元の情報源を確認・検証することが容易になっている。これは「AIが正しくなった」のではなく「人間が検証しやすくなった」という改善である。この区別は、次章のGxP要件を考えるうえで決定的な意味を持つ。
「RAGでハルシネーションは解消した」という主張は、査読付き研究によって否定されている
スタンフォード大学 RegLab/HAI らの研究は、法律AIツールのベンダーが自社製品について「ハルシネーションを排除した」「ハルシネーションを回避する」「100%ハルシネーションのない法的引用」と広告していたことを引用したうえで、事前登録した202問で実測し、これらのRAG搭載ツールが17〜33%の割合でハルシネーションを起こすことを示した。論文の結論は「提供者の主張は誇張されている(the providers’ claims are overstated)」である。
ベンダーが「RAGだから安全」と言うとき、その主張は検証済みではないと考えるのが妥当である。これは当社の別稿#QuitGPTで扱ったベンダーリスクと同じ構図である。
▲【動画】【ワンポイントAI】第2回 Human-in-the-Loop とは(株式会社イーコンプライアンス)
GxPから見たハルシネーション――「精度が上がった」ことと「検証できる」ことは別である
ここまでの議論は、AI一般の話であった。しかし製薬・医療機器の品質保証/CSVを担当する読者にとって、本当の論点は別のところにある。仮にハルシネーション率が0%になったとしても、生成AIは現行の規制要件を満たさない可能性がある。規制が要求しているのは精度ではなく、再現性と検証可能性だからである。
21 CFR §11.10(a) は「一貫した意図された性能」を要求している
米国 21 CFR Part 11 の §11.10(a) は、クローズドシステムに対する第一の要求として次を掲げる。
(a) Validation of systems to ensure accuracy, reliability, consistent intended performance, and the ability to discern invalid or altered records.
(システムのバリデーション。正確性、信頼性、一貫した意図された性能、および無効または改変された記録を識別する能力を確保するため。)
出典:21 CFR §11.10(a)(eCFR)ここで要求されているのは accuracy(正確性)だけではない。consistent intended performance――一貫して、意図したとおりに動くこと――が並列に置かれている。バリデーションとは、あらかじめ定めた仕様どおりに動作することを文書化された証拠によって示す行為である。したがって、同じ入力に対して毎回異なる出力を返しうるシステムは、そもそもバリデーションの対象として扱いにくい。精度が99.3%であっても、その0.7%が「毎回どこに現れるかわからない」性質のものであれば、consistent intended performance を示したことにはならない。
この論点は、当社のExcelを使用する場合の管理留意点で扱った「§11.10各号をExcelで満たせるか」という検討と地続きである。
EU GMP Annex 22(AI)のドラフトは、LLMを重要なGMP適用業務から明示的に外している
欧州委員会は2025年7月7日から10月7日まで、EudraLex Volume 4(GMPガイドライン)について、第4章(文書化)の改訂、Annex 11(コンピュータ化システム)の改訂、および新設の Annex 22(人工知能)を同時に意見募集にかけた。この Annex 22 ドラフトの第1章「Scope」に、本稿の主題に対する規制側の回答が書かれている。
本文書は、決定論的な出力を持つモデル――同一の入力を与えられたときに同一の出力を返すモデル――に適用される。同一の入力を与えられても同一の出力を返さないことがある確率論的な出力を持つモデルは本文書の対象外であり、重要なGMP適用業務に使用すべきではない。
以上より、本文書は生成AIおよび大規模言語モデル(LLM)には適用されず、これらのモデルは重要なGMP適用業務に使用すべきではない。患者安全・製品品質・データインテグリティに直接影響しない非重要なGMP適用業務で使用する場合は、適切な資格と訓練を有する要員が、当該モデルの出力が意図された使用に適していることを確保する責任を常に負うべきである。すなわち human-in-the-loop(HITL)である。
出典:European Commission, EudraLex Volume 4, Draft Annex 22: Artificial Intelligence, Section 1 Scope(意見募集稿、2025年7月7日〜10月7日)より抄訳この一文が、本稿のタイトルに対する規制側の回答である
Annex 22 のドラフトが LLM を排除する理由は、「精度が足りないから」ではない。「同じ入力に対して同じ出力を返すとは限らないから」である。
つまりハルシネーション率が0.7%になろうが0.07%になろうが、この基準は満たされない。改善の方向がそもそも噛み合っていない。この点を理解せずに「もう精度は十分だから規制対象業務にも使える」と考えることが、現時点で最も危険な誤解である。
なお同ドラフトは、静的(frozen)なモデルのみを対象とし、運用中に継続的に学習・適応する動的モデルも重要なGMP適用業務に使用すべきでないとしている。また §5.6 は、生成AIによるテストデータやラベルの生成を「推奨しない」と明記している。
Annex 22 ドラフトが LLM に唯一認めているのは、非重要業務における human-in-the-loop 運用である。しかもその場合でも、出力の適切性を担保する責任は要員の側にある。「AIが下書きし、人が確認する」という運用は、確認する人の力量と、確認したという記録が問われる運用である。承認者はレビューをしてはいけないで扱った照査と承認の分離は、AI出力の確認プロセスにもそのまま当てはまる。
ベンダー自身が同じことを言っている――Excel の COPILOT 関数
「同じ入力で同じ出力が返らない」という性質は、規制当局が外側から指摘しているだけではない。製品を提供している側が、自ら公式ドキュメントに書いている。Excel のセルに自然言語のプロンプトを書いてAI処理を行う COPILOT 関数について、マイクロソフトは次の点を明記している。
| マイクロソフト公式ドキュメントの記載 | GxP上の意味 |
|---|---|
| COPILOT関数のモデルは将来的に進化・改善されるため、同じ引数であっても数式の結果が時間の経過とともに変わることがある。それが許容できる場面でのみ使用すること | §11.10(a) の consistent intended performance を、提供元自身が保証していない。過去の計算結果を再現できない |
| 法的・規制上・コンプライアンス上の意味を持つタスクには使用を避けること。財務報告その他のハイステークスな場面でAI生成出力を使用しないこと | GxP記録の作成は、まさにここで名指しされている用途に該当する |
| 正確性または再現性が必要なタスクには、ネイティブのExcel数式(SUM、AVERAGE、IF等)を使用すること | 「再現性(reproducibility)」という語を、提供元が明示的に区別して用いている |
| COPILOTはAIを使用しており、誤った応答を返すことがある | 提供元が正確性を保証していない |
| 2026年9月14日以降、COPILOT関数は利用できなくなる(Copilot in Excel への移行が案内されている) | この関数を組み込んだブックは、その時点で動かなくなる。長期保存記録の再現性が失われる |
この論点は当社のExcelの10の問題点でも扱っている。重要なのは、「AIは規制業務に使えない」という主張が、規制当局・研究者・ベンダーの三者から独立に出ているという点である。ベンダーが自社製品について不利な注意書きを載せているという事実は、それ自体が強い証拠である。
FDA の現在地――CSAガイダンスとAIクレディビリティ評価
米国FDAは、生成AIを名指しで禁じてはいない。むしろリスクベースで枠に取り込む方向を採っている。ただしその枠は、精度の議論ではなく「意図された使用(intended use / context of use)を定義し、それに見合う証拠を集めよ」という構造をしている。
1. CSAガイダンス(2026年2月3日 最終版)
FDAは2026年2月3日、”Computer Software Assurance for Production and Quality Management System Software” の最終版を発出した。これは2025年9月24日発出の “…Quality System Software”(”Management” が入っていない旧名称)を置き換えたものである。同ガイダンスは、リスクベースの保証フレームワークの適用範囲について次のように述べる。
ここに示すアプローチは、製造または品質マネジメントシステムの一部として使用される、自動化ツール(BOTSや自動ワークフロー等)、データ分析ツール、人工知能/機械学習ツール、およびクラウドコンピューティングに適用できる(ただしこれらに限られない)。
出典:FDA, Computer Software Assurance for Production and Quality Management System Software(2026年2月3日発出)Section IV.A より抄訳。ドケット番号 FDA-2022-D-0795すなわちAI/MLツールは、CSAの枠組みの適用対象として明示的に想定されている。「AIだからバリデーションの外」ではなく、「AIもCSAでリスクベースに保証せよ」という位置づけである。CSAの考え方については当社のER/ES実践講座 続報(CSV・GAMP 5・CSA・データインテグリティ)で詳しく扱っている。
2. AIによる規制判断支援に関するドラフトガイダンス(2025年1月/2026年8月時点で最終化されていない)
FDAは2025年1月、”Considerations for the Use of Artificial Intelligence to Support Regulatory Decision-Making for Drug and Biological Products”(医薬品・生物学的製剤の規制判断を支援するAIの使用に関する考慮事項)のドラフトガイダンスを発出した。CDER・CBER・CDRH・CVM・OCE・OCP・OII の連名である。ここで提示されているのが、7ステップのリスクベース・クレディビリティ(信頼性)評価フレームワークである。
| ステップ | 内容 |
|---|---|
| Step 1 | AIモデルが取り組む関心のある問い(question of interest)を定義する |
| Step 2 | その問いに対するAIモデルの使用文脈(context of use, COU)を定義する |
| Step 3 | AIモデルのリスクを評価する |
| Step 4 | COUの範囲内でモデル出力の信頼性を確立する計画を策定する |
| Step 5 | 計画を実行する |
| Step 6 | 信頼性評価計画の結果を文書化し、計画からの逸脱を議論する |
| Step 7 | 当該COUに対するAIモデルの妥当性を判定する |
ここでの「信頼性(credibility)」は、「特定の使用文脈におけるAIモデルの性能に対する、信頼性証拠の収集を通じて確立された信用」と定義されている。注目すべきは、この枠組みが医療機器の計算モデル検証規格 ASME V&V 40 の概念(関心のある問い/使用文脈/モデルリスク)を土台にしていることである。すなわちFDAは、AIモデルを「賢いソフトウェア」としてではなく、「妥当性確認が必要な計算モデル」として扱おうとしている。
この構造の含意は明快である。「このAIはハルシネーション率が0.7%です」という説明は、Step 1〜3 に何も答えていない。当局が求めているのは、「どの問いに」「どの文脈で」「どのリスクで」使うのかの定義であり、その定義に見合う証拠である。汎用ベンチマークのスコアは、その証拠にならない。
3. AI搭載医療機器に関するガイダンス
| 文書 | 状態(2026年8月時点) | 要点 |
|---|---|---|
| Marketing Submission Recommendations for a Predetermined Change Control Plan for AI-Enabled Device Software Functions(PCCP) | 最終版。2024年12月4日に最初に発出され、2025年8月18日付で再発出されている | 上市後のモデル更新をあらかじめ計画として提出し、再申請なしに実施できるようにする枠組み |
| Artificial Intelligence-Enabled Device Software Functions: Lifecycle Management and Marketing Submission Recommendations | ドラフトのまま。2025年1月7日付。2026年8月時点で最終化を確認できない | AI搭載機器の製品ライフサイクル全体(TPLC)にわたるリスク管理と申請資料の推奨 |
| Considerations for the Use of AI to Support Regulatory Decision-Making for Drug and Biological Products | ドラフトのまま。2025年1月付 | 上記の7ステップ信頼性評価フレームワーク |
検証可能な事実で置き換えると、FDAは米国で販売許可を得たAI搭載医療機器の一覧(AI-Enabled Medical Devices)を公開しており、FDA自身は1,000件を超える機器を市販前経路で許可済みとしている。ただしFDA自身が「本一覧は網羅的な資料ではない」と注記している点に留意されたい。
また「2025年度には新入社員へのAI研修実施率が前年比17ポイント以上上昇」も、調査主体・母集団を特定できなかったため採用していない。
EU AI Act――医療機器に組み込まれたAIはハイリスクに分類される
欧州では、GMPとは別の系統からも規制が及ぶ。規則(EU) 2024/1689(人工知能法、AI Act)である。2024年6月13日採択、2024年7月12日に官報(OJ L)公示。第113条により原則として2026年8月2日から適用されるが、後述の第6条(1)については適用開始が異なる。
第6条 ハイリスクAIシステムの分類規則
1. AIシステムが(a)および(b)に掲げる製品と独立して上市または供用されるか否かにかかわらず、次の両方の条件が満たされる場合、当該AIシステムはハイリスクとみなされる。
(a) 当該AIシステムが、附属書Iに列挙された連合整合化法令の対象となる製品の安全構成要素として使用されることが意図されているか、または当該AIシステム自体がそのような製品であること。
(b) (a)にいう安全構成要素であるAIシステムを有する製品、または製品としてのAIシステム自体が、附属書Iに列挙された連合整合化法令に基づき、上市または供用にあたって第三者適合性評価を受けることが要求されていること。
附属書I セクションA の第11号は、医療機器規則(EU)2017/745(MDR)である。したがって、MDRの下でノーティファイドボディ(第三者認証機関)による適合性評価を要する医療機器の安全構成要素としてAIが使われる場合、そのAIシステムはAI Actのハイリスクに該当する。第113条(c)により、第6条(1)およびそれに対応する義務の適用開始は2027年8月2日である。
規制文書の現在地(2026年8月時点)
| 規制・文書 | 発出/適用 | 生成AIに対する立場 |
|---|---|---|
| 21 CFR §11.10(a) | 施行済み | 正確性に加え「一貫した意図された性能」のバリデーションを要求。非決定的な出力との整合が課題 |
| EU GMP Annex 22(AI)ドラフト | 意見募集 2025年7月7日〜10月7日 | 生成AI・LLMは重要なGMP適用業務に使用すべきでない。非重要業務でもHITLが前提 |
| EU GMP Annex 11 改訂ドラフト/第4章 改訂ドラフト | 同上(同時に意見募集) | コンピュータ化システム全般と文書化要件の見直し |
| FDA CSAガイダンス | 最終版 2026年2月3日(2025年9月24日版を置換) | AI/MLツールをリスクベース保証の適用対象として明示 |
| FDA AI規制判断支援ガイダンス | ドラフト 2025年1月(未最終化) | 7ステップの信頼性評価。ASME V&V 40 の概念を援用 |
| FDA PCCPガイダンス | 最終版 2024年12月4日発出/2025年8月18日再発出 | 上市後のモデル更新を事前計画として承認 |
| FDA AI搭載機器ライフサイクル管理ガイダンス | ドラフト 2025年1月7日(未最終化) | TPLC全体でのリスク管理と申請資料 |
| EU AI Act(規則(EU) 2024/1689) | 公示 2024年7月12日/原則適用 2026年8月2日/第6条(1)は2027年8月2日 | MDR対象機器の安全構成要素としてのAIはハイリスク |
実務への影響と活用のポイント
ハルシネーション改善がもたらす変化
意思決定への活用が現実的に
標準的なタスクや適切なRAGを組み合わせた場合、AIの出力を意思決定の参考にすることが、以前より現実的になってきている。ただし、タスクの複雑度とリスクを適切に評価し、段階的に導入することが重要である。戦略立案や経営判断の補助ツールとして活用する場合でも、最終的な判断は必ず人間が行うという前提は維持されている。Annex 22 ドラフトの HITL 要求は、この前提を規制文書として明文化したものと読める。
専門分野での活用範囲の拡大
医療、法律、金融など、高い正確性が求められる分野でも、AIの活用は進んでいる。前掲のとおりFDAは1,000件を超えるAI搭載医療機器の販売を許可しており、日本でも薬機法に基づくプログラム医療機器の承認が進んでいる。ただしここで許可されているのは、意図された使用が明確に定義され、性能が事前に評価された特定用途のAIであって、汎用の対話型LLMではない。この区別は決定的である。専門分野であっても、最終的な判断は専門家が行うという原則は、すべての事例で維持されている。
依然として注意すべきポイント
改善が進んだとはいえ、ハルシネーションが完全に消失したわけではない。実務でAIを活用する際は、以下の点に注意が必要である。
| 注意点 | なぜそうすべきか(本稿で確認した根拠) |
|---|---|
| タスクの複雑度を正確に評価する | 要約(1.8〜24.2%)、臨床ノート生成(1.47%)、専門RAG調査(17〜33%)、自由回答(58%以上)と、タスクの型が変わればハルシネーション率は桁で変わる。「根拠を渡す」構造から離れるほど悪化する |
| ベンチマーク性能を過信しない | 同一の運営主体・同一指標でも、評価用文書プールを替えただけで最良値が0.6%から1.8%に変化した。さらに Nature 論文は、正解率型のベンチマークが当て推量を報奨する構造にあることを示した。必ず自社の実際のデータで検証すること |
| モデル選択の慎重な判断 | 最新・高性能が最適とは限らない。Vectara の2026年5月時点の一覧では、推論志向の o3-pro が23.3%、gpt-5.4-pro が8.3%であるのに対し、小型の gpt-5.4-nano は3.1%であった。用途に応じた選択が必要である |
| クリティカルな情報は必ず検証する | 契約内容、医療情報、法律解釈など重要な判断に関わる情報は、必ず人間が最終確認を行う。GxP文脈では、確認したこと自体が記録として残るプロセス設計が要る |
| 情報源の確認習慣 | AIが提示する情報は可能な限り出典を確認する。特に数値データや統計は、元のデータソースまで遡る。本稿の「21.8%」がまさにその実例であり、遡ったところで出所は存在しなかった |
| 複数の情報源との照合 | 一つのAIシステムの回答だけに依存せず、複数の情報源や異なるシステムの回答と照合する。データインテグリティ保証の3要素の考え方が、そのまま適用できる |
| ベンダーの「ハルシネーションはありません」を信じない | 査読付き研究が、まさにその広告文言を掲げていたRAG製品を実測して17〜33%のハルシネーションを検出している。ベンダー主張は検証対象であって、根拠ではない |
今後の展望
技術的進化の方向性
リアルタイム検証システム
AIが生成した情報を、別のシステムが自動的に検証する「二重チェック機構」の研究が進んでいる。代表例が CHECK と呼ばれる枠組みで、構造化された臨床データベースと情報理論に基づく分類器を組み合わせ、事実誤りと推論誤りの双方を検出する。主要な臨床試験100件から作成した1,500問での評価において、Llama3.3-70B-Instruct のハルシネーション率を31%から0.3%へ低下させたと報告されている。
また、この研究は arXiv に公開されたプレプリントであり、査読を経ていない(arXiv:2506.11129、2025年6月10日投稿)。数値を引用する際は、この点を併記すべきである。
こうしたシステムの広範な商用実装時期については、現時点では未確定である。
この方向性がGxPにとって持つ意味は、精度の向上とは別のところにある。検証層を挟むということは、AIの出力を「そのまま使う」のではなく「判定を経て使う」構造に変えるということである。判定基準を事前に定義し、判定結果を記録し、閾値を下回った出力を「未決」として人間に回す――これは Annex 22 ドラフトの第9章「Confidence」(信頼度スコアの記録と閾値設定、低信頼時の “undecided” フラグ)が求めている設計と、ほぼ一致する。規制適合の道筋は、モデルを賢くすることではなく、モデルの周囲に検証と記録の仕組みを組むことにある。
専門知識データベースとの連携強化
医学論文データベースや法律条文データベースなど、信頼性の高い専門情報源との直接連携が進んでいる。これにより、専門分野におけるハルシネーションリスクがさらに低減することが期待される。ただし、前掲のスタンフォード大学の研究が示したとおり、専門データベースとの連携(RAG)は低減であって解消ではない。17〜33%という数字は、まさに「専門情報源と直接連携した商用ツール」を実測した結果である。
組織としての対応
AIリテラシー教育の重要性
ハルシネーションのリスクを理解し、適切に対処できる人材の育成が急務である。全社員が基本的なAIリテラシーを身につけることで、より安全で効果的なAI活用が可能になる。GxP組織においては、これは「望ましい取り組み」ではなく要件である。Annex 22 ドラフト §2.1 は、AIモデルの意図された使用と関連リスクを適切に理解するために、プロセスSME・QA・データサイエンティスト・IT・コンサルタントを含む関係者の緊密な協働を求め、すべての要員が適切な力量、定義された責任、適切なレベルのアクセス権限を持つべきであるとしている。
段階的導入とリスク評価
AI導入にあたっては、以下のアプローチが推奨される。GxP環境では、これを「推奨」ではなく文書化された手順として整備する必要がある。
- 低リスクタスクから開始する単純なデータ要約など、ハルシネーションの影響が限定的なタスクから着手する。Annex 22 ドラフトの用語でいえば、「患者安全・製品品質・データインテグリティに直接影響しない非重要業務」から始めるということである。ここでもHITLは外せない。
- 意図された使用を先に定義するFDAの信頼性評価フレームワークの Step 1〜2 に相当する。「何の問いに、どの文脈で使うのか」を書いてから、性能を測る。順序を逆にすると、ベンチマークの数字だけが残る。
- 実データで十分に検証するベンチマーク性能ではなく、実際の業務データで評価する。Annex 22 ドラフト第6章は、テストデータの独立性(開発・訓練に使ったデータをテストに使わない)を技術的・手続的統制で確保すること、テストデータへのアクセス制御と監査証跡を求めている。
- 置き換える前のプロセス性能を把握しておくAnnex 22 ドラフト §4.3 は、モデルの受入基準は「それが置き換えるプロセスの性能以上」でなければならないとする。裏を返せば、現行の人手プロセスの誤り率を知らないまま、AIの誤り率を評価することはできない。
- 段階的に権限を付与する実績に基づいて徐々に適用範囲を拡大する。範囲の拡大は変更管理の対象であり、Annex 22 ドラフト §10.1 は、モデル・システム・対象プロセスのいずれの変更も文書化し、再テストの要否を評価することを求めている。
- 継続的にモニタリングする定期的に精度を評価し、問題があれば即座に対応する。同 §10.3・§10.4 は、モデル性能の定期監視に加えて、入力データがモデルの想定するサンプル空間に留まっているか(ドリフトが起きていないか)の監視を求めている。
ガイドラインの整備
各組織において、AI活用に関する明確なガイドラインを策定することが推奨される。どのような場面でAIを活用できるか、どのような検証プロセスが必要かを明文化することで、リスクを最小化できる。GxP組織の場合、この「ガイドライン」は社内規程・手順書として整備し、変更管理と教育訓練の対象に含める必要がある。汎用LLMをどの業務に使ってよいか(そしてどの業務に使ってはならないか)を、Annex 22 ドラフトの重要/非重要の区分に照らして定義しておくことが、当面もっとも実践的な備えとなる。
まとめ
ハルシネーションは、確かに大幅に改善されている。ただしそれは「与えた文書を要約させ、原文から逸脱しなかった割合」という特定の測定条件の下での話である。この条件を言わずに「0.7%まで下がった」と語ることは、改善を語っているようで何も語っていない。
- 「0.7〜1.5%」の出所は特定できた。Vectara社の Hallucination Leaderboard(HHEM-2.1版、2025年10月時点)の上位モデルの値である。要約タスクの根拠一致度であり、判定も同社の商用モデル、評価文書は非公開である。運営者自身が「単独の指標として用いることは推奨しない」と明記している。
- 「2021年に21.8%」「約96%削減」の出所は特定できなかった。Vectaraのリーダーボードは2024年7月までしか遡れず、全バージョンに21.8%という値は存在しない。本稿では採用していない。
- 数字は測定条件に強く依存する。同じ運営主体が同じ指標で、評価用文書プールを替えただけで最良値は0.6%から1.8%に変わった。推論志向の上位モデルほど成績が良いわけでもない(o3-pro 23.3%)。
- 「根拠を渡す」構造から離れるほど、率は桁で悪化する。要約1.8〜24.2%、臨床ノート生成1.47%、専門RAG調査17〜33%、汎用チャットボットの自由回答58%以上。いずれも査読付きまたは公開の実測である。
- そして規制は、精度を問題にしていない。EU GMP Annex 22 ドラフトがLLMを重要なGMP適用業務から外す理由は「同じ入力で同じ出力を返すとは限らないから」であり、精度がいくら上がってもこの基準は満たされない。21 CFR §11.10(a) が求める “consistent intended performance” も同じ構造である。マイクロソフトはCOPILOT関数について「同じ引数でも結果が変わり得る」「法的・規制上の意味を持つタスクには使うな」と自ら案内している。
- したがって進むべき道は、モデルの精度を待つことではない。意図された使用を定義し(FDAの7ステップ Step 1〜2)、置き換える前のプロセス性能を測り(Annex 22 §4.3)、独立したテストデータで検証し(同第6章)、信頼度と閾値を記録し(同第9章)、変更管理とドリフト監視の下に置く(同第10章)――この設計を組めるかどうかが分かれ目である。
技術の進化を正しく理解し、賢く活用していくことが、これからのビジネスにおいて競争優位を築く鍵となるであろう。ハルシネーション改善は、AIをより信頼できるパートナーへと進化させる重要なマイルストーンである。この進化を味方につけ、人間の判断力とAIの情報処理能力を適切に組み合わせることで、より質の高い意思決定と価値創造が実現できる時代が到来しつつある。ただしその実現には、技術の可能性だけでなく限界も正しく認識し、慎重かつ戦略的にアプローチすることが不可欠である。そして規制対象業務においては、「限界の正しい認識」とは、精度の議論ではなく再現性と検証可能性の議論である。
出典・参考
- Vectara, Hallucination Leaderboard(HHEM-2.3版・2026年5月11日更新/HHEM-2.1版・2025年10月16日更新/HHEM-1.0版・2024年7月25日更新)。要約タスクにおける原文との事実整合性を、同社の判定モデルで採点したもの
- Kalai, A. T., Nachum, O., Vempala, S. S., Zhang, E., “Evaluating large language models for accuracy incentivizes hallucinations”, Nature(2025年7月1日受領/2026年4月15日受理、DOI: 10.1038/s41586-026-10549-w)。査読付き
- Magesh, V., Surani, F., Dahl, M., Suzgun, M., Manning, C. D., Ho, D. E., “Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools”, Journal of Empirical Legal Studies 22巻 216〜242頁(2025年、DOI: 10.1111/jels.12413)。査読付き。事前登録202問。スタンフォード大学 RegLab の紹介ページ/プレプリント版 arXiv:2405.20362
- Dahl, M., Magesh, V., Suzgun, M., Ho, D. E., “Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models”, Journal of Legal Analysis 16巻 64〜93頁(2024年)。査読付き
- Asgari, E. ほか, “A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation”, npj Digital Medicine(2025年5月13日)。臨床医が注記した12,999文。査読付き
- Xu, S. ほか, “MEGA-RAG: a retrieval-augmented generation framework with multi-evidence guided answer refinement for mitigating hallucinations of LLMs in public health”, Frontiers in Public Health 13巻(2025年10月8日)。査読付き
- Garcia-Fernandez, C. ほか, “Trustworthy AI for Medicine: Continuous Hallucination Detection and Elimination with CHECK”, arXiv:2506.11129(2025年6月10日)。査読前のプレプリント
- 米国 21 CFR Part 11 – Electronic Records; Electronic Signatures(eCFR)。§11.10(a)
- European Commission, Stakeholders’ Consultation on EudraLex Volume 4 — Chapter 4, Annex 11 and New Annex 22(意見募集 2025年7月7日〜10月7日)。Draft Annex 22: Artificial Intelligence
- FDA, Computer Software Assurance for Production and Quality Management System Software(最終版、2026年2月3日発出。2025年9月24日版を置換。ドケット FDA-2022-D-0795)
- FDA, Considerations for the Use of Artificial Intelligence to Support Regulatory Decision-Making for Drug and Biological Products(ドラフト、2025年1月。2026年8月時点で未最終化)
- FDA, Marketing Submission Recommendations for a Predetermined Change Control Plan for Artificial Intelligence-Enabled Device Software Functions(最終版。2024年12月4日発出、2025年8月18日再発出)
- FDA, Artificial Intelligence-Enabled Device Software Functions: Lifecycle Management and Marketing Submission Recommendations(ドラフト、2025年1月7日。2026年8月時点で未最終化)
- FDA, AI-Enabled Medical Devices(米国で販売許可を得たAI搭載医療機器の一覧)
- Regulation (EU) 2024/1689(AI Act)(2024年6月13日採択、OJ L, 12.7.2024)。第6条(1)、附属書I セクションA 第11号、第113条
- Microsoft, COPILOT function(Microsoft サポート)
- 当社関連記事:GPTは確率論に基づく次トークン予測技術/#QuitGPT/27年間誰も見つけられなかったバグ/Excelの10の問題点/Excelを使用する場合の管理留意点/ER/ES実践講座 続報/データインテグリティ保証の3要素/承認者はレビューをしてはいけない
この記事は参考になりましたか?

この記事へのコメントはありません。