抄録
化合物の発見や合成経路探索の機械学習を用いた効率化が注目されており,その中で文書データから科学知識を抽出する作業の自動化が求められている.文書データから化合物名などを抽出するタスクである固有表現抽出は初歩的かつ重要な処理である.固有表現抽出ではBiLSTM-CRFと呼ばれる確率モデルが用いられることが多く,BiLSTM-CRFでは単語列を入力とするが,その単語列は分散表現と呼ばれるベクトル列にモデル内で変換される.近年文脈を考慮した分散表現を用いることで固有表現抽出の精度が向上することが知られている.そこで本稿ではこれらの手法を化学情報分野にも応用し,文脈情報を考慮した分散表現とBiLSTM-CRFモデルを組み合わせることで従来の手法と比較して化学固有表現抽出の精度向上に寄与することを明らかにした.