2025 年 29 巻 1 号 p. 89-96
従来,学生の活動状況は教務情報に基づいて把握されてきたが,教務情報は修学に付随して発生することから,課外活動やキャンパス内での日常的な行動を捉えるには不十分であるという課題がある.そこで本研究では,大学の情報基盤に記録される無線LANアクセスポイント(AP)の認証ログを用いることで,学生の活動傾向を補足することが可能か検証を行う.分析のために,APの認証成功ログに対してWord2Vecによる分散表現を適用し,APを実数空間に埋め込むことで,キャンパス内の構造に対応した位置関係を構成した.さらに,この埋め込み空間を用いて学生の移動履歴を時系列的に分析し,逸脱度の推移に基づいてクラスタリングを行った.その結果,特定の認証情報と学生の属性・行動傾向との関連が確認された.
近年,大学におけるエンロールメント・マネジメントの高度化が求められ,学生の学習継続や離脱予兆の早期発見に注目が集まっている.従来の学習継続予測は,主に教務システム上の成績や履修登録情報,アンケート回答などの,学習に起因して発生するデータを活用してきた.例えば嶌田[1]は,GPAや履修登録情報に基づいて「留年しそうな学生」を検出する方法を複数適用し,比較検討を行っている.しかし,これらの学務データは授業参加やレポート提出など学修活動に限定された情報であり,学生の日常的な行動パターンやキャンパス内での移動経路,修学以外の非公式な活動状況などを把握するには不十分という課題がある.また,学習関連のデータは学生・教員の主観によって構成されることも多く,情報の信頼性を担保するためには大規模な情報の収集が必要となる.ただし,講義出欠や教務システムのアクセスログ,試験成績や任意回答のアンケートなどは教員の授業方法や学生の状態によりしばしば欠損する上,これらのデータ取得を高頻度に行うと,学生や教員の負担になる.そのため,大学内の活動において継続的,かつ教育サービスの需給を阻害せず透過的に取得可能なデータを活用することが望ましい.
一方,Bring Your Own Device(BYOD)の導入と,大学のネットワーク環境の整備が進んできた.2016年の時点で国立大学のBYOD導入率は8割近くに達しており[2],茨城大学は新型コロナウイルス感染症の流行が始まった2020年度からBYOD完全実施体制に移行している.また,多くの大学では無線LAN基盤がほぼ学内全域で整備され,学生や教職員のスマートフォンやPC端末が常時ネットワークに接続されている.特に,IEEE802.1x認証を伴う無線LAN環境では,APの認証ログとして「いつ・誰が・どのAPへ接続したか」が詳細に記録され,教室・図書館・自由学習スペースなどキャンパス内各所での滞在や移動履歴を取得可能である.したがって,このような認証ログは,学習ログでは捉えきれない日常的な学生の行動を把握する手段として期待される.Yamano et al.[3]は,無線LAN認証ログを用いてユーザの位置を推定する手法を提案しており,屋内での位置情報取得や,それに基づく移動経路の復元に有効であることを示している.しかし,これらの技術はネットワーク最適化や行動追跡を主目的としており,講義参加や課外活動,学生の離脱傾向といった大学特有の課題を直接扱えるように設計されてはいない.学生の属性やイベントの影響を把握する場合,必ずしも高精度な位置計測は必要ではなく,キャンパス内における大まかな位置把握や,クラス内における相対的な行動の違いを捉えることの方が重要となる場合も多い.
本研究では,大学内に設置された無線LANの認証ログを用いて,学生の行動傾向を分析することを目的とする.特に,教育支援への応用に繋がる知見が,認証ログの分析により得られるかどうかを検証する.IEEE802.1x認証では,APへ接続するたびに認証ログが出力されるため,APへの接続ログとして認証ログを使用する.キャンパス内におけるAPへの接続ログを用い,各APをWord2Vecによって実数空間上に埋め込むことで,AP間の距離を定量化する.次に,学部・学科・学年ごとに,その時間帯における学生の平均的な位置を定義し,それとの距離を指標として学生の「逸脱度」を定量化する.この逸脱度系列をもとに階層的クラスタリングを行い,学生の活動傾向の分類と,学外活動や離脱の傾向との関係性を明らかにする.本論文では,まず2章にて関連研究として,認証ログの利活用に関する先行事例や時系列データ処理の手法について述べる.3章では,無線LAN認証ログの構造と,Word2Vecを用いたAPのベクトル化,および逸脱度の定義とクラスタリング手法について述べる.4章では,実際に茨城大学の認証ログを用いた分析結果を提示し,分類結果の特徴や離脱傾向との関連について考察する.最後に第5章では,本研究のまとめと今後の展望について述べる.
本研究は,大学の無線LAN認証ログを用いて学生の活動傾向を分析するものであり,いくつかの研究分野に関連する.ここでは,認証ログを用いた移動経路推定,無線LAN接続情報の利活用,時系列データの分析手法について取り上げる.
無線LANの認証ログに基づく研究として,Yamano et al.[3]は無線LANコントローラのローミングログを用い,建物構造と組み合わせてユーザの移動経路を復元する手法を提案している.また,Talaveraら[4]は,接続ログからAPの地理的分類とユーザの遷移確率を階層的にモデル化し,行動パターンの再構成に利用している.これらの研究は個人の移動軌跡や滞在パターンの解析に焦点を当てているのに対し,本研究では集団内の相対的位置関係や逸脱傾向の検出に着目している.
学内ネットワークに関する研究では,無線LAN接続情報を用いたシステム運用改善が行われている.田島ら[5]はローミングに伴う接続障害の分析と制御手法を提案し,冨重ら[6]はAP接続ログから学内の混雑度を可視化し,リアルタイムな人流把握に活用した.これらはネットワークの安定運用や混雑緩和を目的とした実用的な応用であり,ユーザの行動ログの動的解析において重要な知見を提供する.本研究においても時間帯や学生属性に基づく混雑傾向を捉えるが,本研究では学内の教育的支援や離脱傾向の検出に着目している.
無線LAN認証ログは時系列的特徴を持つため,時系列データとしての分析が可能である.時系列データの分析には,隠れマルコフモデル(Hidden Markov Model; HMM)や長・短期記憶 (Long Short-Term Memory; LSTM) といったモデルが活用されている.HMMは状態推定に有効であるが,系列長に対する計算量の問題があり,大規模データには不向きである.LSTMは高い性能を持つが,学習の安定性や解釈性に課題がある.
以上のように,無線LAN認証ログの活用は位置推定やネットワーク運用,異常検知などの分野で研究されているが,多くは個別行動の追跡などを目的としており,集団的な行動傾向や教育支援での応用に対しては十分に検討されていない.そこで本研究では,学生の集団的行動パターンとその逸脱に注目し,教育支援に無線LAN認証ログを活用可能か検証する.
本研究では,大学におけるIEEE802.1x準拠の無線LAN認証ログを用いて,学生の行動傾向を分析する.具体的には,AP接続系列をベクトル空間に埋め込み,その時系列的な変動から学生の「逸脱度」を定義し,これをもとにクラスタリングを行うことで,学生集団内での行動的な違いや離脱傾向を抽出する.
3.1 無線LANネットワークの認証ログ無線LANネットワークの認証には,IEEE802.1xに基づく拡張認証プロトコル(EAP over LAN)が用いられており,ユーザIDとパスワードによる認証が行われる.そのため,キャンパス内の移動に応じてローミングが可能であり,ユーザの移動に伴うAPの切り替え時にも認証ログが記録される.
この仕組みにより,ユーザが「いつ」「どこで」「どの端末で」APに接続したかという情報が,高精度かつ継続的に記録される.このログは,無線LANコントローラを経由して収集されている.本研究においても同様の収集基盤を用いており,以下のような属性を含むログを対象とした.
・認証日時
・接続したAPの識別子
・ユーザID
・デバイスのMACアドレス
・SSID
・所属学科
・認証の成否
なお,本学の無線LANは全キャンパス共通のSSIDを用いている.このとき,学生がデバイスのランダムMACアドレス機能を有効化している場合が考えられ,これにより単一のデバイスに対して複数のMACアドレスが対応付けられる可能性がある.ただし,ランダムMACについて一般的な設定を行ったデバイスで同一SSIDに接続する限りは,固定されたMACアドレスが使用されると考えられる.
また,接続セッション中にローミングが発生する場合,端末は自身のアルゴリズムに従って最適なAPを選択する.多くの端末は現在のセッションを維持しようとするため,信号強度が閾値を下回るまではAPを切り替えないという傾向がある.このような特性により,AP認証ログのシーケンス(本研究では,可変長のベクトルもしくは行列として表現される時系列データを指す)からユーザの大まかな移動パターンを抽出することが可能となる[3].
3.2 認証ログ情報の匿名化本研究では,ユーザIDやMACアドレスなどの個人を特定可能な情報については,ハッシュ化等の手法を用いて匿名化を行う.その際,ユーザIDについては,入学年度と所属学部・学科をIDから切り出した後にハッシュ化を行っている.これらのデータは,研究用のデータベースとして管理される.これにより,個人のプライバシー保護と研究の再現性の両立を図っている.なお,認証ログを含むログデータの分析については“茨城大学情報戦略機構が主管するデータの利用ガイドライン”を遵守して実施しており,データ利用についても入学時に学生に通知している.
3.3 APのベクトル化AP接続ログから学生の移動パターンを計測するためには,APの位置情報が計算可能な形式で保存されている必要がある.ただし,APの正確な座標を計測するのは困難であり,一般的にこれらの情報は管理されていない.この点について,Wangら[7]はWord2Vecを用いた「LogEvent2vec」を用いることで,ログイベントの異常検知を行っている.Word2Vecは自然言語処理に用いられ,例えば山本ら[8]は問い合わせ文書をベクトル化し,クラスタリングに応用している.そこで本研究では,APの位置情報を計測する手間を回避するために,認証ログを時系列データとして扱い,Word2VecによりAPを実数ベクトル空間に埋め込む.
具体的には,ユーザごとのAP接続順を文脈とみなして,Word2Vecの学習アルゴリズムのひとつであるskip-gramを用い,各APが周辺に出現する他のAPとどのような関係性を持つかを学習する.これにより,APは
本研究におけるskip-gramでは,ある時点に接続されたAPの識別子を入力とし,図1のようにその前後のAP接続履歴を文脈として予測する形で学習が行われる.各APは埋め込み層にて


本研究では,学生の行動傾向を分類する.ただし,無線LAN認証ログに基づくAP接続履歴はシーケンスデータとしての構造を持つため,例えば単純に各学生の位置情報を平均ベクトル化して入力するような場合,時間構造が失われて解釈が困難となる.そこで本研究では,学生ごとの行動を集団内での空間的な逸脱度として求め,逸脱度の時間変化をクラスタリングの入力特徴量とする.
この逸脱度は,ある時間
| (1) |
この逸脱度のベクトルに対して時間方向にガウスカーネルを適用して平滑化を行い,クラスタリングのためのデータを作成する.
3.5 逸脱度のクラスタリング前節で定義した学生ごとの逸脱度ベクトル
| (2) |
Ward法は,各クラスタの分散の増加量を最小に抑えながら統合を繰り返す手法であり,鎖効果と呼ばれる解釈性に悪影響を与える現象が,他の階層分類法よりも少ないという利点がある.
本章では,前章で述べた分析方法及びデータについて,詳細を述べる.また,分析結果に対して考察を行い,無線LAN認証ログを用いた学生支援の方法論に関する示唆を得る.
4.1 分析概要分析する期間は,2022年4月1日0時0分0秒から2023年3月31日23時59分59秒までのデータとした.この期間は,新型コロナウイルス感染症の流行開始から2年が経過しており,対面講義がある程度従来通りに行われるようになった時期である.そのため,従来の学生の挙動が見えやすいと考えた.データの概要を表1に示す.なお,記録されている接続試行は認証の成否に関わらないが,今回は認証に成功したレコードに分析対象を限定する.
| レコード数 | 128,777,451 |
| 接続したAPの識別子 | 475 |
| ユーザID | 14,438 |
| デバイスのMACアドレス | 47,071 |
| 学部・研究科 | 31 |
| 学科・専攻 | 74 |
| 入学年度 | 10 |
分析の手順として,まずはAPシーケンスに対してWord2Vecを適用し,APを高次元ベクトル空間に埋め込む.得られた空間におけるAPの位置関係と,学生の活動重心が,現実のキャンパス構造と整合しているかを確認する.確認について,茨城大学ではAPの識別子名にキャンパス情報が付与されているため,その情報を用いた.各学生の逸脱度を算出し,時間ごとの逸脱度にクラスタリングを実施した後に,得られたクラスタの特徴を考察する.なお,本研究では大学の授業時間が1~2時間程度であることから,
考察のために,期末試験期間にあたる2023年1月中に認証記録が存在しない学生を便宜上「離脱者」と定義し,この離脱者に共通の特徴が存在するか確認する.ここで,ある1つのクラスタに多くの離脱者が集約されていれば,離脱者の逸脱行動には共通の特徴が存在すると考えられる.そこで,離脱者を最も多く含むクラスタに,すべての離脱者のうちの何%が含まれるかを「再現率」として評価する.また,当該クラスタに属する学生に対する離脱者の割合を「適合率」として求める.これらの指標はクラスタに数によって変動し,クラスタの数は閾値によって決定される.このとき,閾値を低い値に設定するとクラスタ数が増加し,過分割により解釈が困難となる.一方,高い値に設定すると各クラスタ内の分散が大きくなり,クラスタ内に共通する特徴を発見することが困難になる.本研究では学生の活動傾向を把握することが目的であるため,全学部・学科においてクラスタ数が3~4程度に収まる閾値を採用し,解釈性を重視して分析を行う.
分析はPython 3.8.10で行った.Word2Vecはgensim 4.3.3を用いた.Word2Vecのパラメータは,本研究では実験的に,隠れ層の出力
図3に,APシーケンスにWord2Vecを適用した結果を示す.可視化のために,主成分分析で2次元に圧縮している.各点の色は接続した学生の所属を意味する.

APの識別子を見ると,APは主に茨城大学の主要3キャンパスである水戸・日立・阿見キャンパスと,その他のキャンパスに分かれて分布していることが確認できた.したがって,Word2Vecにより形成された空間は,現実のAPの設置位置を大域的に再現していると考えられる.図3では位置関係の一部に誤差が確認されたが,Word2Vecの空間はすでに無相関な基底によって構成されており,第1~2主成分の累積寄与率が約17%と限定的であったためと考えられる.そのため,元の高次元空間ではより正確な幾何構造が保持されていると推測される.
各点の色は,そのAPに接続した学生のうち,最も多かった学部に基づいて割り当てられている.この結果から,日立は工学部,阿見には農学部の学生が集まっていることが確認できる.水戸は人文社会学部・教育学部・理学部に加え,工学部と農学部の1年生が混在していることを表している.なお,理工学研究科は大まかに日立キャンパスに常駐する工学専攻,水戸キャンパスに常駐する理学専攻,東海キャンパスに常駐する量子線科学専攻で構成される.そのため,理工学研究科に関しては複数のキャンパスに存在している.これらの結果から,クラスの平均的な位置は,大域的には学部と研究科・専攻及び入学年度(学年)で決定されていることになり,実環境と矛盾ない結果となった.
以上の結果から,Word2Vecにより得られたAP空間と学生の平均的な位置は,実際のキャンパス構造とある程度整合しており,逸脱度の計算における前提として妥当であると判断した.そのため,次節にて学生のクラスタリングを行う.
4.3 学生のクラスタリング逸脱度の推移を基に,学生のクラスタリングを行う.クラスタ数を決定する閾値については,40~60の範囲で変更しても再現率に顕著な変動は見られなかった.そのため,以降の分析では閾値50を採用した.
4.3.1 クラスタリングの結果表2に,離脱者数と再現率・適合率について,離脱者が複数名存在した学部・学科を抜粋して示す.所属は,例えば「工学A」は,工学部のある学科(A学科)を意味する.どの学科についても離脱者は1つのクラスタに集約される傾向がみられ,4つの学科は再現率が100%であった.なお,(1-再現率)
| 所属 | 学年 | 離脱者数 | クラスタ数 | 再現率 | 適合率 |
|---|---|---|---|---|---|
| 教育A | 1 | 6 | 7 | 100% | 20% |
| 工学A | 3 | 9 | 3 | 89% | 23% |
| 人文A | 1 | 6 | 2 | 100% | 11% |
| 人文B | 3 | 7 | 3 | 100% | 21% |
| 理工A | 2 | 6 | 5 | 100% | 12% |
| 理工B | 1 | 9 | 5 | 89% | 21% |
| 理工B | 2 | 7 | 4 | 86% | 16% |
評価対象クラスタの性質を明らかにするために,各所属におけるデンドログラムを確認する.図4に,工学部A学科3年生における分類の結果を示す.図にはデンドログラムの他に,学生のAP接続場所や所有デバイスに関する情報,最終認証成功日に類する情報も掲載している.データラベルには,接続したAPの設置キャンパス(日立・水戸・阿見・その他),デバイスのMACアドレスの数(

クラスタリングの基となる逸脱度の推移について,期間を2022年10月に限定し,各クラスタごとに逸脱度の平均値を図5に示す.なお,10月1日は土曜日になる.クラスタ1と3は逸脱度の平均が大きく,時間帯によってやや値が異なる.また,休日にも逸脱度が計測されている.クラスタ2は前述のクラスタよりも値が小さく,休日の逸脱度は他クラスタよりも低い.そのため,クラスタ1と2, 3は逸脱のタイミングに沿って分割され,2と3は逸脱度の疎性とノルムに基づいて分割されたと考えられる.

各クラスタにおける接続先APの傾向は,3クラスタ全てにおいて日立キャンパスに存在する工学部のある実験棟(工学部棟)に設置されたAPが最も多かった.次に,各クラスタに特有の接続傾向を調べるために,TF-IDF(Term Frequency-Inverse Document Frequency)を適用した.ここでのTF-IDFは,各クラスタ内での各APの出現頻度を表すTF項と,全クラスタの中で各APが出現するクラスタの出現頻度の逆数 (APの希少性) であるIDF項からなり,クラスタの中からそのクラスタを特徴付けるAPを抽出するために用いた.表3に示すこの結果を見ると,クラスタ2は日立キャンパスに集中しているのに対し,その他は水戸キャンパスが多いということがわかる.クラスタ1・3に頻出する「講堂」や「会館」は,いずれも課外活動の場として利用される施設である.一方,クラスタ2はほとんどが工学部棟などの頻出APであり,表3には教室に設置されたAPのみがみられた.
| クラスタ1 | クラスタ2 | クラスタ3 |
|---|---|---|
| 水戸 講堂 A | 日立 工学部棟 | 水戸 教育学部棟 |
| 水戸 講堂 B | 水戸 共通教育棟 | 水戸 講堂 E |
| 水戸 講堂 C | 水戸 教育学部棟 | 水戸 講堂 F |
| 水戸 理学部棟 | 水戸 会館 | |
| 水戸 講堂 D | 水戸 講堂 A |
クラスタ2のMAC数が他よりも少ない原因について考察を行う.学生の持つデバイスの数は認証の頻度に影響を及ぼす.MAC数はランダムMACアドレス機能によって増加する可能性はあるが,3.1節で述べた通りSSIDは大学内で統一されているため,基本的には1つのMACアドレスに対して1つのデバイスが対応すると考えられる.このとき,MAC数が少ない学生は接続試行回数も少ないため,活動が平準化され,重心からの逸脱が生じにくい傾向がみられた.そのため,想定する逸脱度とは無関係に距離計算が行われ,クラスタリングに反映された可能性がある.ただし接続先APの調査より,工学部棟への接続が多いことから,講義や実験科目がこの棟の周辺で開講されており,クラスタ2はその学生集合の重心に沿って活動していたと考えられる,対して,表3を見ると,クラス1と3は工学部の存在する日立キャンパス以外にも滞在しており,図5から休日にも登校している.
これらの結果と同様の傾向は,表2に示す学科すべてに見られた.例えば,図6に人文社会学部1年生の分類を示す.図4と同様に,ラベルには設置キャンパス,MACアドレス数,最終認証成功日と離脱の有無を示す.この結果を見ると,クラスタ2に離脱者が集約されており,キャンパスやMACの数が少ない学生に離脱の傾向がみられたことから,クラスタ1は理系学生におけるクラスタ2と対応していると考えられる.特に,クラスタが他よりも低く,また鎖効果が発生する傾向にあること,鎖の端に離脱者がみられることから,逸脱度の大きさと休日登校の頻度,離脱日などに基づいてクラスタリングされていたことがわかった.このことから,工学部3年生とは分野や学年が全く異なるにも関わらず,離脱者に同様の傾向がみられることが確認できた.MACアドレス数及びキャンパス数と離脱者の関係は,茨城大学においてはある程度の一般性を持つと考えられる.加えて,このクラスタに属する非離脱者は離脱者と同様の傾向がみられることから,潜在的な離脱者と考えることができる.

以上の結果から,デバイスを複数所有もしくは交換をしており,かつ課外活動を行っている学生は,離脱の傾向が少ないという結果が得られたと言える.逸脱度と離脱度が反比例するという,設計時の想定に反する結果となったが,課外活動を行っている学生は継続的に登校しているという現象は教育の現場で観測される傾向と一致していた.また,所有デバイスの数や常駐キャンパス外への移動は,学生の経済的な性質を表しているとも考えられる.これらの結果は,無線LAN認証ログが学生の行動状態を動的かつ透過的に捉える手段として有用である可能性を示している.ただし,本論文における離脱者は,あくまで対象年度の期末試験周辺に認証記録が存在しなかった学生を意味する.そのため,これら離脱者が嶌田[1]の言う「留年してしまう学生」に該当するかどうかは不明であり,デバイスやキャンパスと離脱との関係性についてはあくまで傾向の示唆にとどまる点に注意する必要がある.実際には,本研究の結果に加えて教務情報に属する休退学のデータを活用することにより,実用的なドロップアウト予測モデルを構築できる可能性がある.
本研究では,大学の無線LAN認証ログを用いて,学生の活動傾向を分析することが可能か検証した.具体的には,各学生におけるAPの接続シーケンスに対してWord2Vecを適用し,APを実数ベクトル空間に埋め込んだ.この結果,得られた空間構造はAPの物理的な配置と概ね対応しており,空間的な特徴量の抽出が可能であることが確認された.さらに,学生ごとの逸脱度を定義し,その時間変化をもとにクラスタリングを行うことで,離脱傾向のある学生が共通して示す行動パターンを抽出した.特に,MACアドレス数やキャンパスの利用範囲が限定されている学生が,期末試験の期間を含む学期末における認証ログの有無と関連している傾向が観察され,認証ログが修学以外の学生行動や社会的関与の指標として有効である可能性が示唆された.
今後は,シーケンシャルパターンマイニングや隠れマルコフモデルを用いて行動状態をより精緻に分析すると共に,LSTMなどを用いた離脱予測の実装を行い,学生の状態をリアルタイムに把握可能なシステムの開発を行う.また,認証ログと学習データを統合し,行動と修学の関連性を定量的に検証することで,より信頼性の高い離脱予測手法を開発し,学生への支援・介入をするための方法論について検討を行う.この場合,学生支援を担当する部署との連携により,ドロップアウト傾向がみられる学生に対する面談等の早期実施などが期待できるが,部署を横断して機密情報を取り扱うことにあるため,取り扱いについては運用規定の整備が必要となる.そのため,個人情報の取り扱いに関する倫理的配慮や,匿名化に関する処理方法を精査し,より信頼性の高いデータ流通モデルの構築に取り組む.
本研究はJSPS科研費 25K06512, 25K06342, 22K13761の助成を受けた.