2026 年 75 巻 3 号 p. 503-512
医療現場における機械学習モデルの普及を阻むデータセット依存性や個別最適の壁を克服するため,単一施設で開発した予測アルゴリズムを追加学習により他施設へ展開する手法の有効性を検証した。A病院のリアルワールドデータを用い,XGBoostによる「日次採血患者数」「時間帯別受付数」「待ち人数・時間」の3種類の基盤モデルを構築した。次に,このモデルをB病院のデータで追加学習し,その精度を検証した。評価には2025年の遡及的データと,2025年11月の前向きデータを用いた。A病院のモデルは高い予測精度を示したが,B病院に直接適用すると精度は著しく低下した(日次予測R2 = −14.074)。一方,B病院データで追加学習を行ったモデルは劇的に改善し,遡及的検証において時間帯別受付数でR2 = 0.963,待ち人数でR2 = 0.892を達成した。前向き検証でも高い精度が維持され,特に待ち人数予測ではR2 = 0.884と実用的なロバスト性が確認された。基盤モデルの共有と追加学習による適応は,施設ごとの運用差を効率的に吸収し,高精度な予測モデルを他施設へ展開するための実践的なフレームワークとなる。
To overcome “dataset dependency” and the barrier of individual optimization in medical machine learning, we verified a practical framework for deploying prediction models across facilities using incremental learning, focusing on outpatient blood collection congestion. Using XGBoost, we constructed three base models (daily patient count, time-slot reception count, and waiting queue/time) using real-world data from Hospital A. These models were then adapted via incremental learning using data from Hospital B. Performance was evaluated using retrospective data (Jan–Aug 2025) and prospective data (Nov 2025). The base models performed well at Hospital A. However, direct application of Hospital A’s models to Hospital B resulted in poor accuracy (Daily count R2 = −14.074), highlighting the difficulty of simple model transfer. In contrast, the incrementally trained models showed dramatic improvement, achieving an R2 of 0.963 for time-slot reception counts in retrospective validation. In prospective validation, the incrementally trained models maintained high robustness, with the waiting queue prediction achieving an R2 of 0.884 and accurately capturing dynamic congestion peaks. Sharing foundation models and adapting them via incremental learning is an effective strategy to overcome institutional differences in scale and operational flows. This approach provides a scalable framework for implementing data-driven management in various medical departments.
多くの産業においてデータに基づき業務プロセスを最適化し,意思決定を支援するデータサイエンスの活用が不可欠となっている。医療分野も例外ではなく,患者満足度の向上,医療の質の担保,そして職員の業務負担軽減といった日常直面する運用上の課題を解決するための実践的な手法としてその重要性は増している。特に,多くの患者が利用し業務が集中する中央診療部門ではリソースの配分や人員配置の最適化が急務であり,データ駆動型のアプローチが有効な解決策となる可能性がある。しかしながら,機械学習を用いた予測モデルのような仕組みを各施設が個別にゼロから開発するには,いくつかの大きな障壁が存在する。まず,データサイエンスに関する専門知識が不可欠であり,多くの施設にとって専門人材の確保は容易ではない。また,その開発プロセスは多大な時間と計算コストを要する。さらに本質的な課題として,ある施設で成功したモデルが必ずしも他施設で機能するとは限らないという汎化性能と展開可能性の問題が挙げられる。各施設には固有の患者層,診療科構成,運用フローがあり,個別最適化されたモデルは他施設への展開が困難となる。この個別最適化の課題こそがデータサイエンスによる成功事例が組織内に留まり,業界全体への広範的な普及を妨げる大きな要因となっている1)。そこで本稿では,この個別最適化の課題を乗り越え,単一の施設で開発したアルゴリズムを知的資産として,他施設で効率的に再利用・展開するための一連の手法を実証することを主目的とした。本研究では,単一施設(A病院)で構築した外来採血業務の予測モデルを,別施設(B病院)へ効率的に適応させる枠組みとして,A病院で学習済みのXGBoostモデルを初期値としてB病院データで再学習する追加学習(incremental training)を採用する。これは深層学習分野で用いられるfine-tuningとは概念的に異なり,勾配ブースティングツリーモデルに対してツリーを追加することで学習を継続する手法である。本論文では以後,この手続きを「追加学習」として統一して記載する。
この目的を検証するにあたり,多くの病院で共通してみられる運用上の課題の典型例として,外来採血室の混雑を題材とした。外来採血室は外来診療全体のワークフローにおける主要なボトルネックのひとつである。ここで発生する混雑とそれに伴う待ち時間の増加は患者満足度の低下に直結するだけでなく,業務負荷の増大にもつながる2)~4)。特に,診療前検査の結果報告遅延は外来診療自体の遅延を招き,後続の患者の診察にも影響する。したがって,外来採血室業務の効率化は病院全体のスループットを向上させる上で極めて重要な意味を持つ。
本研究の目的は,A病院で構築した外来採血室業務の予測モデルを,B病院データによる追加学習により効率的に適応させ,性能・汎用性および実装上の有用性を検証することである。加えて本取り組みは,外来採血室業務の効率化という多施設共通課題をモデルケースとして,データサイエンスを現場の課題解決へ展開するための実践的フレームワークを提示することを最終目的とする。
本取り組みはA病院(病床数614床,一日平均外来患者数約1,300名)のデータを用いて予測の基盤モデルを構築し,その学習済みモデルをB病院(病床数1,208床,一日平均外来患者数約2,600名)のデータで追加学習させることで,他施設へ効率的に展開する手法を検証するものである。対象とする予測モデルは,1)日次採血患者数予測モデル,2)時間帯別採血患者受付数予測モデル,3)時間帯別採血待ち行列予測モデル(待ち人数および平均待ち時間の2出力)の3種類とし,A病院とB病院の双方のデータに対して同様のデータ処理,モデル構築・評価プロセスを適用した(Figure 1)。なお,性能評価は出力ごとに実施するため,結果は合計4項目として提示した。

*追加学習時のパラメータ:learning rate = 0.05,added trees = 100,hyperparameters were fixed from Hospital A models.
A病院およびB病院それぞれにおいて,(1)採血ログデータ(採血システムから抽出し,ローカル環境にて匿名化処理を実施),(2)外来患者数データ(医事会計システムから抽出),(3)気象データ(気象庁「過去の気象データ・ダウンロード」より取得5))の3種類のデータを収集した。気象データは降水量,気温(平均・最高・最低),湿度・風速(平均湿度・平均風速)を用い,加えて天気概況から雨フラグ・雪フラグを作成した。
データ期間は2024年1月1日から2024年12月31日までを学習用,2025年1月1日から2025年8月31日までを遡及的な性能評価用として分割した。さらに,モデルの実運用を想定した性能を評価するため,2025年11月の1ヶ月間を前向き検証用のデータとして別途収集した。学習,遡及的検証,および前向き検証の各フェーズにおける具体的なサンプル数(N)はTable 1に示した。
| 施設 | 予測対象(モデル単位) | サンプル数(N)の単位 | 学習期間 (2024年) |
遡及的検証 (2025年1–8月) |
前向き検証 (2025年11月) |
|---|---|---|---|---|---|
| A病院 | 日次モデル | 稼働日数(日) | 246 | 161 | 18 |
| 時間帯別モデル* | 30分単位の枠数 | 7,623 | 5,057 | 522 | |
| B病院 | 日次モデル | 稼働日数(日) | 246 | 162 | 18 |
| 時間帯別モデル* | 30分単位の枠数 | 7,677 | 5,059 | 522 |
*時間帯別モデルには「受付数予測」および「待ち人数・待ち時間予測」の両モデルが含まれる
本研究は,各施設の倫理審査委員会の承認(岐阜大学大学院医学系研究科医学研究等倫理審査委員会:承認番号2022-086,東京大学大学院医学系研究科・医学部倫理委員会:承認番号3683)を得て実施した。本研究の対象データは,各施設の外来採血室業務の運用ログおよび公開されている気象データである。採血ログは,各施設内のローカル環境にて患者個人を識別し得る情報(氏名,患者IDなど)を完全に削除・匿名化した後,日次または30分単位の集計値へと変換して解析に用いた。施設間で共有したのは統計的に処理された集計データおよび学習済みモデルのみであり,個票レベルの情報は施設外へ持ち出さない運用を徹底した。また,本研究は既存情報の解析のみを行う研究であり,各施設のウェブサイトなどにおいて研究情報の公開(オプトアウト)を行い,拒否の機会を保障した。
4. 予測モデルの構築手法 1) 特徴量エンジニアリング収集した生データから予測に有効と考えられる特徴量を生成した。カレンダー情報はPythonライブラリであるjpholidayを用いて祝日情報を取得した。気象情報は平均気温,降水量に加え,天気概況の1文字目でカテゴリ化を行い,加えて天気概況に「雨」,「雪」が含まれているかをフラグ化した。また,時系列予測のため,30分前および60分前の受付数をラグ特徴量とし,併せて直近の移動平均値を算出した。待ち人数・待ち時間予測では時間帯ごとの受付数と採血実施数の差分から理論上の待ち人数を算出し,直近の混雑状況を反映する時系列特徴量として用いた(Table 2)。
| データ種別 | 特徴量 |
|---|---|
| カレンダー情報 | 予測対象日の月,曜日,週回数(月の第何週か),祝日,前日が祝日か |
| 採血ログ | 受付日時,処理結果(終了or保留) |
| 外来患者数 | 日付,外来患者数 |
| 気象情報 | 平均気温,降水量,天気概況 |
| 時系列特徴量(時間帯別モデルのみ) | 30分前の受付数,60分前の受付数,直近の移動平均値 |
| 待ち行列(待ち人数・待ち時間モデルのみ) | 時間帯ごとの受付数と採血実施数の差分から算出した理論上の待ち人数 |
機械学習アルゴリズムには高い予測精度と計算効率から広く用いられている勾配ブースティング決定木の一種であるextreme gradient boosting(XGBoost)を採用した。3種類の予測モデルそれぞれについて,A病院の学習用データ(2024年分)を用いて学習を行った。日次予測モデルの学習においては10回分割交差検証によりハイパーパラメータの最適化を実施した。全モデル共通の学習条件として,学習率(learning rate)は0.01,決定木の最大深度(max_depth)は6,決定木の本数(n_estimators)は1,000本とし,過学習防止のため検証データによる精度の改善が50回連続で停滞した場合に学習を打ち切る早期終了(early stopping)を適用した。
3) B病院における追加学習B病院専用のモデルを構築するため,A病院で学習させた基盤モデルを初期値として利用し,B病院の学習用データ(2024年分)を用いて追加学習を行った。これはXGBoostの機能を用いることでゼロから学習するよりも効率的にB病院のデータ特性をモデルに反映させることを目的とした。追加学習の際,決定木の最大深度などのモデル構造に関するハイパーパラメータはA病院の最適化結果を固定して継承した。学習条件は,A病院のモデルを初期値としてB病院のデータを用いて100本の決定木を増分学習(incremental training)させる形で行い,学習率は0.05とした。なお,追加学習時は固定エポックでの更新とし,早期終了は適用しなかった。
5. モデルの性能評価構築した各モデルの予測精度について,2段階の評価を実施した。まず,学習に用いていない過去データ(2025年1~8月分)を使用し,モデルの基本的な予測性能を評価する遡及的検証を行った。次に,モデル構築時点では存在しなかった未来データ(2025年11月分)を使用し,実運用を想定した環境下での汎化性能と頑健性を評価する前向き検証を実施した。各検証フェーズにおける具体的なサンプル数(N)はTable 1に示した。評価指標には,決定係数(R2)および平均平方二乗誤差(root mean squared error; RMSE)を用いた。RMSEを採用した理由は,誤差の単位が実測値(人,分)と一致しており,臨床現場での直感的な解釈が容易であるためである。また,平均絶対誤差(mean absolute error; MAE)と比較して大きな誤差(外れ値)に対して大きなペナルティを与える特性を持つため,運用上の混乱を招くリスクが高い大幅な予測外れを厳密に評価・抑制する目的で本指標を主指標とした。さらに,時間帯別の予測特性を評価するため,予測誤差(予測値-実測値)の平均および95%信頼区間(confidence interval; CI)を算出した。本指標を用いることで,各時間帯における過大予測(正の誤差)および過小予測(負の誤差)の傾向を定量的に評価した。加えて,各モデル間における予測精度の統計的な有意性を検証するため,実測値と予測値の絶対誤差(absolute error)を用いた比較検定を実施した。具体的には,A病院モデル直接適用と追加学習モデル,およびB病院スクラッチ学習モデルと追加学習モデルのそれぞれの絶対誤差に対し,対応のあるノンパラメトリック検定であるWilcoxon符号順位検定を適用した。すべての統計学的解析において有意水準はp < 0.05とした。解析にはJMP® Student Edition 18.2.2およびPythonのscipyライブラリを使用した。
6. 予測アプリケーションと開発環境本取り組みで構築したモデルを臨床現場で活用するため,対話型の予測アプリケーションを開発した。ユーザーが予測したい日付や外来患者数の見込み値を入力すると,対応する予測結果(日次採血患者数,時間帯別の混雑状況など)がグラフや表形式で表示されるよう設計した。
開発にはプログラミング言語Python 3.11を使用した。主なライブラリとして,データ処理にpandas,モデル構築にscikit-learnおよびxgboost,アプリケーションのユーザーインターフェイス(user interface; UI)構築にipywidgetsを用いた。開発・実行環境はGoogle Colaboratory(Colab)を利用した。
なお,本研究の開発コードはhttps://github.com/HidekazuISHIDA/multi-hospital_blood-collection-patients_forecast.git(SHA: 36544ad51983ee1c51e4f4a8561ee47414276c64)において公開している。
A病院の学習データ(2024年1月~12月)を用いて構築された3種類の基盤モデル(日次採血患者数,時間帯別 採血患者受付数,時間帯別採血待ち人数・待ち時間)の基礎性能を評価した(Table 3)。A病院の遡及的検証データ(2025年1月~8月)における日次採血患者数についてはR2 = 0.764,RMSE = 35.0人となり,運用計画の基礎となる日ごとの総患者数を概ね正確に予測できた。加えて,運用の微調整に不可欠な時間帯別モデルにおいてはさらに顕著な精度が確認された。採血患者受付数,採血待ち人数予測のR2はともに0.95を超え(それぞれR2 = 0.955,0.984),採血待ち時間予測においてもR2 = 0.957,RMSE = 1.9分となった。これは30分単位での混雑の波を誤差数分以内で予測可能であることを意味しており,実運用における信頼性の高さを示している。
| 予測モデル | 遡及的検証 | 前向き検証 | ||
|---|---|---|---|---|
| RMSE | R2 | RMSE | R2 | |
| 日次採血患者数 | 35.0人 | 0.764 | 19.2人 | 0.768 |
| 時間帯別採血患者受付数 | 4.8人 | 0.955 | 4.2人 | 0.965 |
| 時間帯別採血待ち人数 | 2.5人 | 0.984 | 2.3人 | 0.990 |
| 時間帯別採血待ち時間 | 1.9分 | 0.957 | 2.6分 | 0.939 |
さらに,モデルの実運用時の頑健性を評価するため,学習および検証期間に含まれない未来のデータ(2025年11月)を用いた前向き検証を行った。その結果,日次採血患者数モデルのRMSEは19.2人(R2 = 0.768)へとさらに改善し,高い汎化性能が示された。時間帯別モデル群において採血受付患者数(R2 = 0.965),待ち人数(R2 = 0.990)といずれも遡及的検証時と同等かそれ以上の精度を維持しており,長期的な運用においても十分な頑健性を有していることが確認された。
2. B病院における追加学習の効果次に,他施設展開の有効性を検証するため,B病院の検証データ(遡及的検証:日次予測モデルN = 162,時間帯別予測モデルN = 5,059)を用い,(1)A病院モデル直接適用,(2)B病院スクラッチ学習,(3)追加学習モデル(提案手法)の3条件の性能を比較した(Table 4)。A病院モデルをそのまま適用した場合,日次採血患者数予測におけるRMSEは409.9人(R2 = −14.074)と極めて大きく,時間帯別待ち人数(R2 = −0.884)や待ち時間(R2 = −0.078)においても負の決定係数を示し,施設間での単純なモデル転用は実用的ではないことが明らかとなった。これに対し,追加学習モデルでは劇的な性能向上が確認された。日次採血患者数のRMSEは53.3人(R2 = 0.745)まで大幅に改善した。また,時間帯別モデルでも高い予測能を達成し,採血患者受付数ではR2 = 0.963,待ち人数でR2 = 0.892,待ち時間でR2 = 0.849となった。本手法は,単なるモデル転用と比較して全項目で統計的に極めて有意な改善を認め(p < 0.001),施設独自の運用特性を効率的にモデルに適応できることが実証された。
| 予測対象モデル | 検証数 (N) |
(1)A病院モデル直接適用 | (2)B病院モデルスクラッチ学習 | (3)追加学習(提案手法) | |||||
|---|---|---|---|---|---|---|---|---|---|
| RMSE | R2 | RMSE | R2 | RMSE | R2 | p値(vs 1) | p値(vs 2) | ||
| 日次採血患者数 | 162 | 409.9 | −14.074 | 51.5 | 0.762 | 53.3 | 0.745 | < 0.001 | 0.539 |
| 時間帯別受付数 | 5,059 | 19.3 | 0.698 | 6.62 | 0.965 | 6.73 | 0.963 | < 0.001 | < 0.001 |
| 時間帯別待ち人数 | 5,059 | 17.33 | −0.884 | 4.16 | 0.891 | 4.14 | 0.892 | < 0.001 | 0.041 |
| 時間帯別待ち時間 | 5,059 | 4.42 | −0.078 | 1.57 | 0.864 | 1.65 | 0.849 | < 0.001 | < 0.001 |
提案手法と,B病院のデータのみでゼロから学習したスクラッチ学習モデルとの比較検証を行った。その結果,日次予測(R2 = 0.762 vs 0.745, p = 0.539)および時間帯別受付数予測において両者は統計的に同等の精度を示し,特に時間帯別待ち人数予測においては,追加学習モデルがスクラッチ学習を上回る精度を示した(p = 0.041)。また,時間帯別モデルにおける高精度の要因を検証するため,30分・60分前の受付数などのラグ特徴量を除外したアブレーション解析を実施した。その結果,R2スコアの低下率はA病院で0.22%(0.952から0.950),B病院では変化なし(0.963から0.963)と極めて限定的であった。これにより,本モデルが単なる短期自己回帰的な補完に依存しているのではなく,外来予約スケジュールやカレンダー属性などの構造的因子を適切に捉えていることが実証された。
4. 追加学習モデルの前向き検証追加学習によって構築されたB病院用モデルの実用性と頑健性を評価するため,モデル構築時には存在しなかった未来のデータ(2025年11月,日次N = 18,時間帯別N = 522)を用いた前向き検証を行った。日次採血患者数予測においては,RMSE 33.7人,R2 = 0.807となった。回帰式はy = 1.07x − 65.7であり,実測値と予測値の間に高い適合度が確認された。時間帯別モデル群においても高い精度が維持されており,採血患者受付数ではR2 = 0.966(RMSE = 6.5人),待ち人数でR2 = 0.884(RMSE = 3.6人),待ち時間でR2 = 0.888(RMSE = 1.2分)であった(Table 5)。
| 予測モデル | RMSE | R2 | 回帰式 |
|---|---|---|---|
| 日次採血患者数 | 33.7人 | 0.807 | y = 1.07x − 65.7 |
| 時間帯別採血患者受付数 | 6.5人 | 0.966 | y = 0.98x + 0.66 |
| 時間帯別採血待ち人数 | 3.6人 | 0.884 | y = 1.03x + 0.09 |
| 時間帯別採血待ち時間 | 1.2分 | 0.888 | y = 1.03x + 0.52 |
また,時間帯別の誤差(予測値-実測値)の分布を確認したところ,いずれの指標においても平均値は終日ゼロ付近を推移しており,特定の時間帯における構造的なバイアスは認められなかった(Figure 2)。平均誤差の95%CIはすべての時間帯でゼロを包含する範囲に収まっており,統計学的にも実測値からの有意な乖離がないことが示された。なお,待ち人数および待ち時間の誤差プロットにおける負の値は,実測値が予測値を上回った「過小予測」の状態を反映したものであり,一日を通したモデルの予測特性を客観的に示す指標となっている。これらの結果から,追加学習モデルは未知の将来データに対しても高い汎化性能を発揮し,実運用において信頼に足るものであることが実証された。

(a)予測日次採血患者数と実測値の相関
(b)時間帯別採血患者受付数の誤差(平均および95%信頼区間)
(c)時間帯別採血待ち人数の誤差(平均および95%信頼区間)
(d)時間帯別採血待ち時間の誤差(平均および95%信頼区間)
(b)~(d)は時間帯別の予測誤差(予測値-実測値)の分布を示す。エラーバーは平均値の95%信頼区間を示す。誤差の正の値は過大予測,負の値は過小予測を意味する。なお,実務上の不整合を避けるため,予測システムから出力される予測値そのものは0以上の値をとるよう制限されている。
本取り組みで構築した一連の予測モデルを臨床現場のスタッフが容易に利用できるように,対話型の予測アプリケーションとして実装した(Figure 3)。本アプリケーションではColab上で動作し,予測した日付,延べ外来患者数の見込み,天気予報などの基本情報を入力するだけで,指定日の日次採血患者数,ならびに30分ごとの受付数,待ち人数,平均待ち時間の推移をグラフおよび表形式で出力する。これにより,採血室の管理者は予測される混雑ピークに基づいた事前の人員配置計画や休憩時間の調整が可能となる。

(a)A病院:30分単位の採血患者受付数の予測結果
(b)A病院:30分単位の予測待ち人数(棒グラフ,単位:人)および予測平均待ち時間(折れ線グラフ,単位:分)
(c)B病院:30分単位の採血患者受付数の予測結果
(d)B病院:30分単位の予測待ち人数(棒グラフ,単位:人)および予測平均待ち時間(折れ線グラフ,単位:分)
本研究により,単一施設で開発された予測アルゴリズムは必ずしもその施設のみではなく,適切な追加学習を経ることで,他施設においても汎用可能な知的資産となり得ることが実証された。
機械学習モデルの医療応用における障壁のひとつは,学習データの特性がモデル性能を強く規定してしまうデータセット依存性である。我々は以前LDLコレステロール値の推定において,学習データセットの違いが予測精度に無視できない影響を与えることを報告し,ある環境で最適化されたモデルが他環境では機能しない可能性を指摘している1)。このデータセット依存性の問題は施設ごとに運用ルールや患者層が異なる外来採血室において顕著に現れる。国内における先行事例において,中島ら2)は予約時間に合わせた採血順の制御という運用ルールの変更によって待ち時間を短縮し,藤田医科大学では自施設データに特化したAIシステムを構築して高精度な予測を実現している6)。これらは優れた成果である一方,あくまで各施設の事情に合わせた個別最適化のアプローチであり,その成果をそのまま他施設へ展開することは困難である。
実際に本研究において,A病院のモデルをB病院に直接適用した結果,精度は著しく低下した。これは以前我々が指摘したデータセット依存性の問題が採血予測の分野にも厳然として存在すること,そして単純なモデル転用が実用的ではないことを定量的に裏付けている。これに対し,B病院のデータを用いて追加学習を行った追加学習モデルは劇的な改善を達成した。既報においても患者フロー予測におけるアルゴリズム他施設移転の重要性が指摘されているが4),本研究結果は追加学習を用いることで,基盤モデルが持つ特徴抽出能力(曜日や天候の影響の捉え方など)を活かしつつ,B病院固有のスケールや運用特性モデルを適合できることを実証している。これは,施設ごとにゼロからアルゴリズムを設計・検証するコストを削減し,モデルという知的資産を共有・再利用するための有効なアプローチである。
本研究の時間帯別モデル,特に待ち人数予測においては,R2 = 0.990に近い極めて高い精度が確認された。Guoら3)は小児病院における検査待ち時間予測に機械学習が有効であることを示しているが,本研究の結果もまた極めて高い適合度を示した。この背景には,外来診療の特性上,患者数が構造的にゼロまたは極めて少なくなる時間帯が存在することが挙げられる。一般的にこうしたゼロ過剰のデータはモデル評価を歪める可能性があるが,本研究においてはこのゼロの予測が追加学習の有効性を示す重要な証左としても解釈できる。施設ごとに異なる診療スケジュールをモデルが再学習していなければ,他施設のパターンを引きずり,誤った来院予測を出力してしまう可能性がある。モデルがB病院においていつ患者が途切れるかといった静的な運用フローを正確に捉え,かつ誤差分布が示すように動的な混雑ピークに対しても追従できている点は,追加学習によってモデルがB病院の時空間的な特性に完全に適応したことが示唆される。
データサイエンスを現場の課題解決に繋げるためには予測精度だけではなく,その情報を現場スタッフが活用できる形で提供することが不可欠である。本研究で実装した対話型アプリケーションはスタッフが直感的に理解できる「混雑予報」として可視化した点に実践的意義がある。従来,採血室の管理者は事前に知覚可能な指標や経験から直感的に,あるいは当日の混雑状況を見てから事後的に対応せざるを得なかったが,本システムにより「明日の10時に混雑ピークが来る」といった予見的かつ客観的な情報に基づき,事前に休憩時間をずらす,応援スタッフを要請するといった先回りしたマネジメントが可能となる。これは,経験と勘に頼っていた業務運営をデータ駆動型の意思決定へと転換させる重要な一歩である。
本研究には,検証が2施設間に留まる点や現状のアプリケーションでは外来患者数の見込み値を手動入力する必要がある点など,いくつかの限界が存在する。加えて,本モデルの学習データは2024年の1年間に限定されている点も留意が必要である。単年度のデータでは,季節ごとの基本的な変動傾向は捉えられるが,数年単位で発生する長期的な気象変動や感染症流行の年次推移までは十分に反映できていない可能性がある。データの蓄積に伴い学習期間を拡張することで,モデルの頑健性はさらに向上すると考えられる。また,構築したモデルは学習データの期間における運用体制を暗黙の前提としている。将来的に採血ブースの増減などの構造的な運用変更が生じた場合,過去のデータに基づく予測ルールが適合しなくなる可能性がある。そのような場合には直近のデータを用いてモデルを再学習させる運用フローの確立が必要であり,より多様な施設間での汎化性能の検証や電子カルテシステムとの連携による自動化は今後の課題である。しかしながら,本研究で提示した基盤モデルの構築・共有・追加学習という一連のプロセスはデータセット依存性の壁を乗り越える有効な手段であり,外来採血室に限らず,CT/MRI検査や外来化学療法室など,リソース制約のある多くの部門に応用可能な汎用的フレームワークであると考えられる。
本研究では外来採血室の混雑予測をモデルケースとし,単一施設で開発された機械学習アルゴリズムを他施設へ展開するための実践的フレームワークを検証した。異なる施設間での単純なモデル転用は困難であるが,基盤モデルに対して自施設データを用いた追加学習を行うことで,ゼロから開発する場合と同等以上の高精度な予測モデルを効率的に獲得できることが明らかとなった。特に,施設固有の診療スケジュールや動的な混雑変動への高い適応能力が確認された点は本手法の実用性を強く支持すると考えられる。
本稿で提示した「基盤モデルの共有と適応」というアプローチは医療現場におけるデータサイエンス普及の課題となる個別最適化やデータセット依存性を克服する有効な手段であると考えられる。本研究が外来採血室に留まらず,多くの医療機関におけるデータ駆動型の課題解決と業務改革を加速させる一助となることを期待する。
本論文に関連して,著者が開示すべき利益相反(COI)はありません。
本研究にあたりご協力いただいた東京大学医学部附属病院検査部および岐阜大学医学部附属病院検査部の皆様に心より御礼申し上げます。