岐阜薬科大学

本研究は、実践薬学大講座 病院薬学研究室 野口 義紘 准教授とEwha Womans University(韓国)、Jeonbuk National University(韓国)の研究グループより実施され、研究成果は、Journal of Medical Internet Research (JMIR)(掲載時Impact Factor: 8.0)に掲載されました。

研究背景と研究成果のまとめ

医薬品の副作用報告では、「薬剤が本当に副作用の原因である可能性が高いか」を専門家が評価します。しかし、この評価には高度な専門知識と多くの時間を要することから、近年では生成AIによる支援が期待されています。
本研究では、FDA有害事象自発報告データベース(FAERS)を用いて、大規模言語モデル(Large Language Models; LLM)がWHO-UMC因果関係評価をどの程度再現できるかを比較検証しました。
専門家3名が独立して評価した337件の薬剤-有害事象ペアをゴールドスタンダードとして、GPT-5.4、GPT-5.4 mini、Gemini 2.5 Pro、Gemini 2.5 Flashを対象に比較し、Chain-of-Thought(CoT)、Few-shot、ReActなど6種類のプロンプト手法についても検証しました。
その結果、GPT-5.4は専門家評価との一致率が最も高く、複数回実行した場合でも安定した判定を示しました。一方で、モデル間やプロンプト手法によって性能差が認められ、AIを医療に応用する際にはモデル選択やプロンプト設計が重要であることも明らかとなりました。本研究成果が、AIを活用した次世代のファーマコビジランスの実現につながることを期待されます。

20260717-1.png

論文情報

雑誌名:Journal of Medical Internet Research (JMIR) (掲載時Impact Factor: 8.0)

論文名:Large Language Models for World Health Organization-Uppsala Monitoring Centre Drug-Adverse Event Causality Assessment Using Food and Drug Administration Adverse Event Reporting System Cases: Comparative Performance Study.

著者: Young Mi Ha, Minjung Kim, YoungIn Bang, Daejin Choi, Jae Hyun Kim, Sandy Jeong Rhie, Yoshihiro Noguchi, Myeong Gyu Kim

論文URL:https://www.jmir.org/2026/1/e93237

DOI番号:https://doi.org/10.2196/93237

オンライン掲載日:202678

研究室HP(URL)
病院薬学研究室:https://www.gifu-pu.ac.jp/lab/byoyaku/