自然言語処理
Online ISSN : 2185-8314
Print ISSN : 1340-7619
ISSN-L : 1340-7619
一般論文(査読有)
大規模視覚言語モデルにおける芸術作品の多言語説明生成能力の評価
尾崎 慎太郎林 和樹坂井 優介上垣外 英剛林 克彦渡辺 太郎
著者情報
ジャーナル フリー

2026 年 33 巻 2 号 p. 760-808

詳細
抄録

画像と文章の両方を処理する大規模視覚言語モデル (VLMs) の性能向上に伴い,モデルの多言語能力を対象とした発展が期待されている.一方で,VLMsを構成する画像エンコーダの事前学習や,大規模言語モデル (LLMs) と画像エンコーダの統合学習は,主に英語の学習データを用いて行われており,英語以外の言語で説明生成をする際に,VLMsが潜在能力を十分に発揮できているかは明らかにされていない.また,機械翻訳を利用してデータセットを作成した多言語QAベンチマークは,言語の細かなニュアンスを的確に捉えられておらず,言語本来の性能を評価するに際しての課題が残る.これらの課題を解決するため,本研究では機械翻訳に頼らない多言語画像理解データセットを提案する.このデータセットを用いて,VLMsの説明生成能力を評価するだけでなく,資源が豊富な英語での指示学習が他の言語での性能を向上させるかどうかについても検証する.多様なモデルを対象とした複数の設定による実験の結果,VLMsは英語以外の言語を対象とした際に性能が低下することを確認した.また,英語のデータから学習した知識を効果的に利用する上での課題が存在することを確認し,画像エンコーダの学習や統合学習時においても多言語で学習を行うことの必要性を強調する結果となった.

著者関連情報
© 2026 一般社団法人 言語処理学会
前の記事 次の記事
feedback
Top