薬学教育
Online ISSN : 2433-4774
Print ISSN : 2432-4124
ISSN-L : 2433-4774
原著
生成AIによる薬剤師国家試験問題の解答分析と教育的示唆
栗坂 知里, 小林 秀昭, 秋山 晴代
著者情報
ジャーナル フリー HTML

2026 年 10 巻 論文ID: e10041

詳細
抄録

薬剤師国家試験では,知識に加え技能・態度を含む総合力が求められるものの,その実体については漠然としていた.生成AIは知識問題に対しては高い正答率,技能・態度を含む問題に対しては正答率の低下が予想された.そこで本研究では技能・態度を含む総合力について考察することを目的に,Microsoft Copilotを用いて第110回薬剤師国家試験のうち病態・薬物治療科目および実務科目との複合問題を分析した.その結果,全体の正答率は78%(39/50問),必須と理論問題は100%(各15/15問),実践問題では病態・薬物治療科目60%(6/10問),実務科目30%(3/10問)であった.誤答要因として,①リード文や設問文中の制約条件,②知識の運用,③ガイドラインや添付文書における運用上の取り決めなど,が見いだされた.生成AIの誤答分析が技能・態度を含む総合力について理解するための目安となる可能性を示した.

Abstract

The Japanese National Pharmacist Examination requires candidates to demonstrate comprehensive competencies encompassing not only knowledge, but also skills and professional attitudes. However, the specific nature of the comprehensive competencies assessed by the examination has not been clearly defined. Because generative artificial intelligence (AI) performs better on knowledge-based questions than on those requiring skills and attitudes, this study aimed to explore the characteristics of the examination in assessing comprehensive competencies by analyzing the performance of Microsoft Copilot on the 110th National Pharmacist Examination. Fifty examination items in pathophysiology and pharmacotherapy were evaluated, including 10 integrated items that incorporated practical pharmacy content. Copilot achieved an overall accuracy of 78%. While Copilot achieved 100% accuracy on both the mandatory and theoretical items (15 items each), the accuracy of practice-oriented items declined to 60% in pathophysiology and pharmacotherapy (6/10 items) and 30% in practical pharmacy (3/10 items). Analysis of incorrect responses revealed recurring errors related to failure to recognize constraints presented in the lead text or question stem, inadequate application of knowledge, and misinterpretation of practice rules derived from clinical guidelines and package inserts. These findings suggest that error analysis of generative AI may serve as a useful indicator for identifying the key elements of comprehensive competencies, particularly those involving the application of skills and professional judgment.

 目的

令和4年度に改訂された薬学教育モデル・コア・カリキュラムの教育目的は,「医療現場での実習で実践的な臨床能力を高める」こと,「6年制薬学教育で卒業時までに学ぶ基礎薬学,医療薬学,衛生薬学,臨床薬学等の知識や技能を修める」こと,「薬剤師として社会で活躍できる能力」を修得することとされている1).卒業生は,本教育により「薬剤師として求められる基本的な資質・能力を生涯にわたって研鑽し獲得する」ことができるようになることが期待されている.すなわち,薬学教育においては,薬剤師に求められる知識・技能・臨床能力をバランスよく修得させることが重要となっている.

これらの学修成果は,卒業後に薬剤師国家試験(以下,国家試験)を通じて,「薬剤師資格を有する者として必要とされる倫理観・使命感や基本的な知識等のほか,薬学の全領域に及ぶ一般的な理論や,医療を中心とした実践の場において必要とされる知識・技能・態度等」が確認されることとなる2).加えて,「薬学に関する基本的な知識等と実践に関する総合的能力が体系的に修得されているか否か」も確認される.試験では,「必須問題」,「薬学理論問題(以下,理論問題)」,「薬学実践問題(以下,実践問題)」として区分して出題されている.「必須問題」においては,「各科目における基礎的な内容を問うもの」,「理論問題」においては,「各科目における技能・態度を含む薬学の理論に基づいた問題」,「実践問題」においては,「医療や公衆衛生等の実務において直面する一般的な課題を解決するための基礎力,実践力及び総合力を確認するため,症例,事例を挙げる等,実践に則した問題」が出題される.このように,国家試験は単なる知識のみならず,技能や態度も含む総合力についても評価する構成となっている.しかし,マークシート形式で出題される国家試験において,どのような形で総合力が問われているかを分析することは容易でなかった.

近年,人工知能(Artificial Intelligence; AI),特に生成AIが急速に進歩している.生成AIとは,文章・画像・音声などのデータを自律的に生成する技術の総称であり,その中核を担う大規模言語モデル(Large Language Models; LLM)は,自然言語処理に特化し,大量のテキストを学習して文脈を理解し,文章生成・要約・翻訳を可能とするものである.近年の生成AIは2017年に発表されたTransformerアーキテクチャ3) を基盤としている.生成AIの代表例として,米国OpenAI社が開発したChat Generative Pre-trained Transformer(ChatGPT,以下GPT)が挙げられる4).GPT-3.5は2022年11月30日に,GPT-45) は2023年3月14日に公開されるなど,生成AIは短期間で急速に発展してきた.

生成AIの教育現場への普及は急速に進んでおり,薬学領域も例外ではなく,学部教育6) や臨床薬学の分野7) などに普及しつつある.文部科学省においても2021年度より「数理・データサイエンス・AI教育プログラム認定制度」が開始されている8).

この生成AIの性能を測定するため,これまでに薬剤師国家試験9,10) や他の国家試験において生成AIによる問題の正答率が調べられ,正答率の低さや解説の不完全性が指摘されてきた11–19).しかしながら生成AIを国家試験問題の中から知識以外の側面を見つけるためのツールとして捉え,技能や態度に関わる点を明らかにして教育の改善に活用しようとする研究は少なくとも国内では殆ど見当たらない.

生成AIツールの一つであるMicrosoft社のCopilotは,教育現場において利用が拡大している.本学においてもMicrosoft社と包括契約を締結しており,Word,Excel,PowerPoint 等の使用頻度の高いアプリケーションの利用拡大に伴い,Copilotも浸透しつつある.教育機関を含む組織向けにはエンタープライズデータ保護が適用されており,プロンプトやユーザーデータがAIの再学習に利用されないなどの厳格なセキュリティ管理が講じられている20).このため,授業資料や個人情報を扱う場面においても,比較的安全に導入できる点が利点と考えられる.さらに,クラウド及び学内環境の双方で利用可能であることから,教員・学生ともに導入負担が小さく,教育現場において運用しやすい生成AIツールといえる.

そこで本研究では,Copilotに国家試験問題を解答させ,その解答傾向を分析することで,薬学教育における技能や態度を含む総合力に関わる問題の特徴を明らかにし,今後の教育に資する知見を得ることを目的とした.

 方法

本研究では,生成AIとして Copilotを用いた.各設問を1問ずつ独立して入力し,設問文以外の補足情報や誘導的な指示は与えなかった.また,同一設問に対する複数回の試行は行わず,初回出力のみを評価対象とした.解答の正誤判定は,薬剤師国家試験の公式正答に基づき,単一選択問題では選択肢の一致を,複数選択問題では全ての正答選択肢が一致した場合のみを正答と判定した.Copilotの挙動は実行時点のシステム構成や外部情報へのアクセス可否により変動する可能性があるため,本研究の結果は,特定時点の実行環境に基づく限定的評価である.

1. 研究対象

2025年2月22日・23日に施行された第110回薬剤師国家試験の問題のうち,著者らが授業で担当している病態・薬物治療科目の問題を対象とした.薬剤師国家試験の問題は必須問題90問,理論問題105問,実践問題150問に区分される2).このうち病態・薬物治療科目の問題数は必須問題15問,理論問題15問,一般問題10問(実務科目との複合問題として出題される)であり,一般問題の実務科目10問と合わせ合計50問を研究対象とした.

2. Copilotを用いた解析

解析は,インターネット上に流布する解答や解説の影響を可能な限り排除するため,試験翌日の2025年2月24日に実施した.以下のようなプロンプトを用いて国家試験問題を順次入力し,解答および解説を生成させた.

「薬学部6年生に国家試験の問題解説を予定しています.問題の解説にあたり,取り上げられている疾患や薬物,検査値とその基準値について詳しく説明した後,問題を解説し,選択肢の正誤も含めた解説を行います.これから1つずつ問題を提示するので,上記の意図を汲んで説明資料を作成してください.」

正答は,薬剤師国家試験の合格発表時(2025年3月25日)に公表された公式解答を基準とした21).

3. 倫理的配慮

本研究は,人を対象としない研究のため,研究倫理審査を受ける必要のない研究に該当すると考える.

 結果

1. 必須問題および理論問題の解答状況

必須問題においては,「各科目における基礎的な内容」が問われているため,知識に関する出題と考えられている.Copilotは,15問中15問を正解した(表1).各設問は「どれか」を選択する以外に,「最も適切なのはどれか」「主なものはどれか」「最も期待できるのはどれか」といった相対比較で選択する設問もあったが,これらについてもCopilotは十分に対応していた(表2).

表1

Copilotによる第110回薬剤師国家試験の解答結果

問題区分 科目 問題数 正答数 誤答数 正答率(%)
必須 病態・薬物治療 15 15 0 100%
理論 病態・薬物治療 15 15 0 100%
実践 病態・薬物治療 10 6 4 60%
実務 10 3 7 30%
計 50 39 11 78%

厚生労働省から開示された解答(2025年3月25日)を用いてCopilotに作成させた解答(2025年2月24日)の正誤を確認した.

 

表2

必須問題の設問内容と選択肢の項目

問題番号 設問内容 選択肢の項目
問56 どれか 薬物
問57 どれか 薬物
問58 どれか 症候群
問59 どれか 薬物
問60 どれか 症状
問61 どれか 疾患
問62 最も適切なのはどれか 薬物
問63 どれか 検査項目
問64 どれか 疾患
問65 主なものはどれか 疾患
問66 どれか 検査所見
問67 どれか 薬物
問68 最も適切なのはどれか 薬物
問69 どれか 資料
問70 最も期待できるのはどれか 薬物

必須問題は設問に対して正答を1つ選ぶ問題である.各設問における設問内容と選択肢の項目を記載した.選択肢の項目は薬物や症状,検査項目などとした.

理論問題においては,「各科目における技能・態度を含む薬学の理論に基づいた問題」が出題されるため,解答にあたっては知識のほか,技能・態度の修得も影響すると考えられた.Copilotは,15問中15問を正解した(表1).理論問題では必須問題と異なりリード文を有する設問も6問あったが,リード文を正しく読み取り正答を導いていた(表3).選択肢の内容も単語だけではなく記述も含まれていたが,いずれも正しく正答を選択していた.また,選択肢の選択数も2つの場合と1つの場合もあったが全てにおいて正しい正答数を解答していた.理論問題においても,Copilotは十分に対応可能であると考えられた.

表3

理論問題の設問内容や選択肢の項目・選択数

問題番号 リード文 設問内容 選択肢の項目 選択数
問157 あり 正しいのはどれか 記述 2
問162 あり どれか 疾患 2
問165 あり 正しいのはどれか 記述 2
問184 なし 正しいのはどれか 記述 2
問185 あり 適切なのはどれか 薬物 2
問186 あり 適切なのはどれか 薬物 2
問187 なし 正しいのはどれか 記述 2
問188 なし 正しいのはどれか 記述 2
問189 なし 正しいのはどれか 記述 2
問190 なし 正しいのはどれか 記述 2
問191 なし 正しいのはどれか 記述 2
問192 なし 正しいのはどれか 薬物と副作用の組み合わせ 2
問193 なし 正しいのはどれか 記述 2
問194 あり 最も近い値はどれか 数値 1
問195 なし 正しいのはどれか 記述 2

理論問題の一部はリード文の内容を読み取り解答する.選択肢の項目は単語ではなく文で記述されているものもある.また選択数は1もしくは2である.

2. 実践問題の解答状況

実践問題においては,「医療や公衆衛生等の実務において直面する一般的な課題を解決するための基礎力,実践力及び総合力を確認するため,症例,事例を挙げる等,実践に則した問題」が出題される.出題形式も,1つのリード文の下に病態・薬物治療科目と実務科目の複合問題として構成されている.実践問題は,疾患や薬物に関する知識に加え,症例・事例に示された条件を読み取り,実務上の判断に結びつける力が求められる出題形式である.そのため,これらの問題の分析は,知識の理解と実務的判断との接点を検討するうえで有用であると考えられた.Copilotは,病態・薬物治療科目では10問中6問,実務科目では10問中3問を正解し,必須問題や理論問題に比べ正答率は大きく低下した(表1).

誤答の中には,リード文の内容を考慮せずに解答数を増加させたり,設問文の制約条件を考慮せずに解答数を増加させた例が認められた(表4).また,知識の運用不足やガイドライン等の推奨を考慮せずに解答数を増加させた例が認められた.具体例を図1に示す.問287では,骨粗鬆症治療におけるリード文の状況に対し,服薬順守状況が不良であることを踏まえた治療法の選択が求められたが,Copilotは骨粗鬆症治療における選択肢の正しさのみで判断し,リード文の状況や設問に書かれている制約条件を考慮せずに全選択肢を適切であると誤答した.問288では,リード文に書かれている季節を考慮して季節性アレルギー性鼻炎を推定し,病態に関する記述の正誤を判断する必要があったが,季節の理解ができず,一部の選択肢を誤って正答とした.問297では,重篤な臓器障害時のステロイドパルス療法に関する投与量・日数まで判断する必要があったが,Copilotは1クールの日数については考慮できず選択肢の一部を誤答した.以上のことから,実践問題の解答にあたっては,①リード文や設問文中の制約条件,②知識の運用,③ガイドラインや添付文書における運用上の取り決めなど,といった技能・態度も含めた総合力については対応が十分ではないと考えられた.

表4

実践問題におけるリード文や設問文中の制約条件など

問題番号 出題科目 正解 Copilotによる解答 リード文の制約条件を考慮しない 設問文の制約条件を考慮しない 知識の運用不足 ガイドライン等を考慮しない 備考
問286 病態・薬物治療 45 45
問287 実務 35 12345 ○ ○ 「患者の服薬遵守状況が良好でない」ことを考慮していない
問288 病態・薬物治療 14 145 ○ 「毎年2月から6月頃にかけて」を通年性と理解
問289 実務 1 12 ○(添付文書) エピナスチン錠20「AL」添付文書(48錠は48日分に相当→症状の改善が見られても2週間(他のエピナスチン塩酸塩を含有する医薬品の服用期間を含む)を超えて服用する場合は,医師,薬剤師又は登録販売者に相談してください)
問290 実務 2 2
問291 病態・薬物治療 2 25 ○ 「処方3追加時とその2ヵ月後受診時の検査値」の変化を読み取っていない
問292 病態・薬物治療 35 35
問293 実務 23 23
問294 病態・薬物治療 12 12
問295 実務 15 5 ○ 「禁忌ではなく,用いることができる」薬物を選択できない
問296 病態・薬物治療 45 45
問297 実務 24 124 ○(ガイドライン) 全身性エリテマトーデス診療ガイドライン2019(1クール7日間→1クール3日間)
問298 実務 12 124 ○(ガイドライン) 成人家族性高コレステロール血症診療ガイドライン2022「半年に一度」→「1~2週間に一度」
問299 病態・薬物治療 24 124 ○ 副作用が出ているのに同種・同効薬を選択している
問300 病態・薬物治療 45 45
問301 実務 4 4
問302 病態・薬物治療 13 13
問303 実務 34 345 ○ 活性のある薬物がCYPによって代謝阻害されると,薬物の活性は減弱ではなく増強する
問304 病態・薬物治療 23 2 ○ ○ ○ 腰椎にがん細胞の転移があるため,新たに検査をしなくても脊髄圧迫が考えられる
問305 実務 14 124 ○ ○(添付文書) ゾレドロン酸点滴静注4 mg/5 mL[NK](重篤な腎障害のある患者には,状態を観察しながら慎重に投与すること,とされていることから適切さを欠く)

緑がけは誤答した設問を示す.誤答の内容について「リード文の制約条件を考慮しない」「設問文の制約条件を考慮しない」「知識の運用不足」「ガイドライン等を考慮しない」で分類した.

図1

実践問題のCopilotによる解答例.体裁についてはCopilotによる解答例の意図を変更しないように注意して著者らで整えた.Copilotが作成した誤答解説に赤字で修正を加えた.下線部はCopilotが読み飛ばしたと考えられる部分.(a)問287と(b)問288には,リード文が理解できず誤答した例を示す.(c)問297には,設問の一部を読み飛ばして誤答した例を示す.

 考察

近年の国家試験では,単なる知識の再生ではなく,与えられた状況を踏まえて最も適切な選択肢を選ぶといった総合力を問われる出題が増加している.しかし,マークシート形式の試験において,どの部分が「技能」や「態度」に相当するのかを明確に説明することは容易ではなく,教育現場における指導上の課題となってきた.

本研究では,生成AIであるCopilotに2025年に実施された国家試験問題を解答させ,その誤答を分析することで,この「総合力」の実体を可視化することを試みた.CopilotはWeb 検索機能を用いて一般公開されている最新情報を参照することで,応答の品質が向上するとされている22).このため,本研究ではインターネット上の解説や解答の参照機会を極力排除する目的で,国家試験翌日に実施した.また,著者らによる解答のヒントとなる情報提供を可能な限り避けるため,Copilotの初回解答のみを評価対象とした.

その結果,必須問題および理論問題では全問正答であった一方,実践問題では正答率が大きく低下し,特に実務科目では30%にとどまった.これは,生成AIが個別の医学・薬学的知識の想起には優れている一方で,それらを文脈に応じて適切に運用する過程に課題を抱えていることを示唆している.誤答の内容を詳細に検討したところ,主な要因として,①リード文や設問文中に示された制約条件の見落とし,②知識を状況に応じて使い分ける運用の不足,③ガイドラインや添付文書に基づく実務上の取り決めへの配慮不足,の三点が抽出された.Copilotの誤答は,正答に必要な知識そのものではなく,以上の三点をどのように解答判断へ結びつけるかという過程で生じていた.学生に対して単に正答を提示するだけではなく,「どの情報を根拠として採用し,どの選択肢を除外するのか」を明示する教材として利用し得る.すなわち,AIの誤答分析は,知識の想起から臨床的・実務的判断へ至る過程を説明するための補助的教材として教育的意義を有すると考えられる.これらはいずれも,単なる知識量ではなく,「与えられた条件下で何を優先すべきかを判断する力」に関わる要素であり,まさに技能・態度を含む総合力の中核を成すものと考えられる.すなわち,生成AIが誤った理由を検討する過程そのものが,学習者にとって「なぜその選択肢が不適切なのか」を説明する有効な教材となる可能性がある.

生成AIの性能は年々上昇してきている.国家試験についてのこれまでの報告を見ると,GPT-3を用いた2022年国家試験での正答率は43.5%10) であったものが,GPT-4を用いると80%10),78.2%9),2023年国家試験では75.3%9) であった.今回の調査ではCopilotを用い,2025年の病態・薬物治療科目と実務科目との複合問題の合計50問に限ったものであったが全体としての正答率は78%であり,既報のGPT-4を用いた報告と同程度の正答率を出しており,国家試験合格レベルには到達していると考えられる.生成AIの正答率の向上についてはほぼ頭打ちの状態にあることから,生成AIは知識面では十分に成熟しており,技能・態度に関わる総合力について課題があると考えられる.

また,他職種の国家試験における正答率の報告を見ると,GPT-4を用いた場合,医師,歯科医師,看護師,臨床検査技師等の国家試験においても概ね80%前後の正答率を示しており11,12,14,16–19),生成AIは知識面では既に国家試験合格水準に達していると考えられる.一方で,誤答要因としては,日本独自の医療システムやガイドライン,計算過程や臨床現場での判断要素など,実践的要素が繰り返し指摘されている16,23).本研究の結果も他職種国家試験における報告と整合しており,薬剤師国家試験においても同様の傾向が認められた.

以上より,生成AIを臨床現場や国家試験対策にそのまま適用することには慎重さが求められるものの,誤答分析を通じて技能・態度を含む総合力を言語化するツールとしては,十分に活用可能であると考えられる.誤答分析を活用した教育実践として,誤答例を授業資料として取り入れた反転授業やアクティブ・ラーニング型授業の展開が想定される.さらに,試験問題の作成においても,誤答例を踏まえることで,学生に誤りへの気づきを促す設問設計が可能となると考えられる.実践問題に対するCopilotの解答分析により,文中の制約条件,知識の運用,ガイドラインや添付文書に基づく実務上の取り決めなどが技能・態度も含めた総合力の実態であることが明らかとなった.これらの点を教育に活用する際には,疾患・薬物治療に関する知識の確認に加え,症例情報の読み取り,患者背景に応じた優先順位づけ,ガイドラインや添付文書に基づく実務上の判断をどのように結びつけるかを明示することが重要である.したがって,医療薬学系教員と実務家教員が上記の知見を踏まえて解説を補完することにより,学生が「どの条件を読み取るべきか」「なぜその知識を適用するのか」を理解しやすくなる可能性がある.生成AIの誤答を題材として解説することで,国家試験対策のみならず,日常の薬学教育の質向上にも寄与する可能性が高いと考えられた.

本研究にはいくつかの限界がある.第一に,Copilotをはじめとした生成AIには,同一の質問をしてもその都度出力内容が全く同じとはならない点である.その一方で,複数回の施行はCopilotに学習の機会を与えることにもなりかねない.第二に,分析対象が第110回薬剤師国家試験の病態・薬物治療領域の問題に限定されており,出題傾向や設問構成が特定年度に依存している可能性がある.今後は,複数年度にわたる問題や他領域を対象とした検証が必要である.第三に,本研究ではCopilotのみを用いた特定時期での評価であり,今後の生成AIの性能向上により,結果が変わってくる可能性がある.将来的には,文脈理解や総合判断力に関する限界が克服される可能性も考えられる.第四に,本研究はAIの誤答分析から教育上注目すべき要素を抽出した探索的研究であり,これらを授業設計や学習支援に応用した場合の教育効果については,今後,実践研究として検証する必要がある.第五に,本研究で対象とした実践問題は,病態・薬物治療領域の問題と実務問題から構成される複合問題に限定されている.実践問題は基礎科目と実務科目の統合的な出題形式をとるが,各基礎科目領域における対応する実務科目との結果の一般化可能性については,各科目の特性を踏まえた上で個別に検討する必要がある.

本研究は,Copilotの性能評価そのものを目的とするのものではなく,Copilotの示す解答傾向を分析し教育に活かす知見を得ることを目的とした探索的研究である.すなわち,Copilotが「つまずいた点」を通して,薬剤師に求められる総合力の内実を浮き彫りにする試みである.今後,生成AIの性能がさらに向上したとしても,本研究で行ったような誤答分析の視点は,薬学教育における技能・態度教育を充実させる上で,引き続き重要な示唆を与えるものと考えられる.

発表内容に関連し,開示すべき利益相反はない.

文献
 
© 2026 日本薬学教育学会
feedback
Top