人工知能学会全国大会論文集
Online ISSN : 2758-7347
第36回 (2022)
セッションID: 1O5-GS-7-05
会議情報

Space-Time Attentionを用いた動画理解機構に基づくEnd-to-Endマルチモーダル対話応答生成
*山﨑 善啓折橋 翔太増村 亮内田 美尋高島 瑛彦
著者情報
会議録・要旨集 フリー

詳細
抄録

マルチモーダル対話システムの研究タスクとして、Audio Visual Scene-aware Dialog (AVSD)と呼ばれる与えられた音響・動画像情報に関する質問応答を行うタスクが挙げられる。AVSDに関する従来のモデルの多くは、動画像内容の理解のためにConvolutional Neural Network (CNN)に基づく動画像表現を用いて応答を生成している。CNNは時空間方向に局所的な特徴抽出を行う傾向にあるといわれている一方で、時間的に広い依存性や空間的に大域的な特徴もAVSDのモデルには必要であると考えられる。本研究では、時空間方向に大域的な表現を獲得しやすいといわれているTransformerに基づく動画像表現を用いたニューラル応答生成モデルを提案する。応答性能を評価した結果、本手法はCNNに基づく動画像表現を用いた従来法に比べて、より高い客観評価値が得られることを示した。

著者関連情報
© 2022 人工知能学会
前の記事 次の記事
feedback
Top