人工知能学会全国大会論文集
Online ISSN : 2758-7347
第39回 (2025)
セッションID: 4I1-GS-11-05
会議情報

動画キャプション生成を用いた動作認識データセットの拡張
*後藤 颯志チャクラボルティ シュデシナ森田 武史吉川 友也山本 泰智江上 周作鵜飼 孝典福田 賢一郎
著者情報
会議録・要旨集 フリー

詳細
抄録

既存の動作認識データセットは,各動画に対して代表的な一つの動作ラベルが付与されることが多く,動画内に含まれる複数の動作に対応する動作ラベルが網羅的に付与されていない.各動画に対して複数の動作ラベルを付与できれば,既存の動作認識データセットを拡張し,動作認識器の精度向上に活用できる可能性がある.本研究では,大規模視覚言語モデル(LVLM)に基づく動画キャプション生成を用いた動作認識データセットの拡張を目的とする.提案手法は,まずLVLMを用いて対象動画からキャプションを生成する.次に,大規模言語モデルを用いて,生成されたキャプションの内容に即した動作ラベルを,メタ動画データセットMetaVDに含まれる全動作ラベルから抽出し,対象動画に付与する.さらに,抽出された動作ラベルとMetaVD上でequal関係にある動作ラベルも抽出し,対象動画に付与する.評価実験では,HMDB51データセットを対象として,提案手法により対象動画に付与された動作ラベルについて,HMDB51の動作ラベルの復元率を算出する.また,提案手法により付与された動作ラベルの妥当性を人手により評価し,提案手法の有効性を示す.

著者関連情報
© 2025 人工知能学会
前の記事 次の記事
feedback
Top