主催: 社団法人 人工知能学会
会議名: 2011年度人工知能学会全国大会(第25回)
回次: 25
開催地: 岩手県岩手市 アイーナ
開催日: 2011/06/01 - 2011/06/03
ウェブページは広告などページの主題以外の情報を含み,それらは例えば検索エンジンの検索精度低下を引き起こす。そのため本文抽出技術は重要視されている.本稿ではHTML中で本文(主題が記述されている部分)は1つもしくは複数のノード配下の全てのノードとして抽出できるという仮説のもと,CRFを用いた本文判定結果を階層構造を考慮して上位ノードの結果と下位ノードの結果の多数決で再判定する手法を提案する.