自然言語処理
Online ISSN : 2185-8314
Print ISSN : 1340-7619
ISSN-L : 1340-7619
最新号
選択された号の論文の30件中1~30を表示しています
巻頭言(査読無)
一般論文(査読有)
  • Zhengdong Yang, Sheng Li, Chenhui Chu
    2026 年33 巻2 号 p. 452-472
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    We study emotion-aware speech-to-text translation (ST) through the lens of generative error correction (GER) with large language models (LLMs). First, we enhance the translation of emotional speech by adopting the GER paradigm: Finetune an LLM to generate the translation based on the decoded N-best hypotheses. Next, we combine the emotion and sentiment labels into the LLM finetuning process to enable the model to consider the emotion content. Moreover, we introduce Describe-then-Translate (DtT), a simple yet effective rationale-style supervision that makes the GER model first predict the emotion with a brief natural-language sentence and then generate the translation, which aligns with the LLM’s language-modeling objective. We conducted experiments on the English-Chinese BMELD dataset with different N-best generation strategies and GER models. The results show the effectiveness of the combination of GER and emotion/sentiment labels, and DtT improves over label-only emotion supervision.

  • 武並 佳輝, Yin Jou Huang, 村脇 有吾, 竹内 孝, Chenhui Chu
    2026 年33 巻2 号 p. 473-508
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    人間を対象に広く研究されてきた認知バイアスは,LLMにおいても確認されており,その実社会応用における信頼性に影響を及ぼす.本研究では売り手と買い手の二つのLLMによる価格交渉シミュレーションにおいて認知バイアスの一種であるアンカリング効果を検証する.具体的には売り手LLMにアンカリング効果を用いるように指示し,客観的・主観的指標を用いて交渉結果を評価した.実験結果は,LLMが人間と同様にアンカリング効果の影響を受けることを示した.また,買い手LLMに推論モデルを使うことや,売り手の交渉戦略を買い手に知らせることがアンカリング効果を軽減できることが明らかになった.一方でLLMに付与した性格特性とアンカリング効果への脆弱性の間には相関が認められなかった.さらに,シミュレーションで得られた対話履歴をLLMにプロンプトとして与え,各文を処理する時のアテンションを分析した.買い手LLMは自身の目標価格より売り手が提示したアンカーに強く注目していることが分かり,これがアンカリング効果を引き起こしている可能性が示唆された.

  • 前田 航希, 杉浦 一瑳, 小田 悠介, 栗田 修平, 岡崎 直観
    2026 年33 巻2 号 p. 509-536
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    視覚言語モデル (Vision–Language Model; VLM) は急速に発展しているが,日本語における評価はタスクや領域ごとに散在しており,能力の全体像と妥当な比較を一貫して捉えにくい. 本研究は,日本語に対応するVLMの能力を総合的・体系的に測る評価基盤を構築し,タスク横断の実証評価を示す. 提案する評価基盤llm-jp-eval-mmは,日本語10種・英語9種の既存データセットを統合し,定義した能力軸に沿って一貫したプロトコルで評価できるツールキットである. 本稿では能力軸の定義,評価基盤の設計,データセット選定と実装を述べ,公開済みの国内外32種のVLMを同一条件で評価して,国内で開発されたVLMが相対的に弱い能力領域を明らかにし,英日間の性能相関の構造を報告する. 本評価基盤は,VLMの包括的理解と信頼できる比較を可能にし,今後のモデル改良とベンチマーク設計の指針を与える.

  • Yuanyuan Cai, Satoshi Kosugi, Kotaro Funakoshi, Manabu Okumura
    2026 年33 巻2 号 p. 537-569
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    Traditional image clustering is constrained by its reliance on single-modal image representations, which limits its ability to capture complex semantic relationships and diminishes the interpretability of clustering results. This study proposes a methodology that initially generates captions directly from images and then integrates the image and caption embeddings to enhance image clustering. This approach leverages automatically generated captions, circumventing the dependency on manually labeled annotations. Experiments on eight datasets demonstrate that multimodal fusion consistently outperforms unimodal baselines: CLIP improves by approximately 5%, whereas BLIP and BLIP2 yield smaller gains. Incorporating image and caption embeddings consistently enhances clustering accuracy. Our comparative analysis further revealed that the effectiveness of textual features varies across models, depending on their multimodal training strategies and encoder architectures. Furthermore, we enhance the interpretability of the clusters by employing language models to generate summaries as explanations for each identified cluster. We evaluate these explanations through quantitative and human assessments. The results demonstrate that the GPT-4 summaries best align with the ground-truth labels and outperform the others in terms of accuracy, coverage, and readability. These findings highlight the effectiveness of sentence-type explanations and the impact of the model architecture and input strategy on explanation quality. Overall, this study establishes a novel image-clustering approach using multimodal representations that combines images and generated captions.

  • 夏見 昂樹, 出口 祥之, 坂井 優介, 上垣外 英剛, 渡辺 太郎
    2026 年33 巻2 号 p. 570-590
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    最小ベイズリスク (Minimum Bayes Risk; MBR) 復号は,出力候補の期待効用を最大化することで高品質な翻訳を生成する手法であるが,候補集合内の全組み合わせに対してスコア(効用)を算出する必要があるため,候補数に対して二乗の計算時間を要する.この計算コストを削減するため,確率的最小ベイズリスク (Probabilistic MBR; PMBR) 復号では,候補文の一部ペアに対してのみ評価指標によるスコアを計算し,残りの欠損スコアは行列補完アルゴリズムによって補完する.しかし,PMBR復号にはこのように評価指標の呼び出し回数を減らすと,翻訳品質が低下してしまう問題がある.そこで本研究では,知識蒸留モデルを用いてスコア行列の補完を誘導する合意制約付きPMBR (Agreement-constrained PMBR; AC-PMBR) 復号を提案し,品質と計算コストのトレードオフを改善する.提案手法であるAC-PMBR復号は,行列補完における近似誤差を最大3倍改善し,WMT’23英↔独翻訳タスクにおいて,PMBR復号と同程度の計算コストでより高い翻訳品質を達成した.

  • 塚越 駿, 笹野 遼平
    2026 年33 巻2 号 p. 591-629
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    近年,英語や多言語の汎用的なテキスト埋め込みモデルの開発が盛んに行われている.しかし,日本語を対象としたモデル開発の取り組みは限定的であり,その理由としてはデータセットの不足やモデル開発のための知見が少ないことが挙げられる.本稿では,日本語汎用テキスト埋め込みモデルRuriを開発し,その過程について述べる.具体的には,訓練データの不足を補うための大規模言語モデルによる合成データセット構築,対照事前学習によるベースモデルの訓練,そして高品質データを用いた微調整について説明する.構築したテキスト埋め込みモデルRuriは,日本語テキスト埋め込みのベンチマークにおいて既存のモデルを上回る性能を達成した.

  • Jundai Suzuki, Ryoma Ishigaki, Eisaku Maeda
    2026 年33 巻2 号 p. 630-657
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    Evaluating Theory of Mind (ToM) in Large Language Models (LLMs) is an important area of research for understanding the social intelligence of artificial intelligence. Recent ToM benchmarks have significantly enhanced the complexity, comprehensiveness, and practicality of evaluations.However, while the focus has been on constructing “more difficult” or “more comprehensive” tasks, systematic analysis of structural factors that inherently determine the difficulty of ToM reasoning, i.e., “what” makes reasoning difficult, is insufficient.Hence, we propose a new dataset generation framework for ToM evaluation, named AnaToM.To realize an “anatomy of difficulty” in ToM reasoning, AnaToM strictly controls structural parameters such as the number of entities and the timeline in a story.This parameter control enables the isolation and identification of factors affecting ToM in LLMs, thereby enabling a more precise examination of their reasoning mechanisms.The proposed framework provides a systematic methodology for diagnosing the structural limits of LLM reasoning abilities, thus offering a foundational diagnostic baseline that complements the evaluation of broader sociocognitive capabilities in future benchmark designs.

  • 大北 剛, 勝又 智, 鎌田 啓輔, 清丸 寛一, 児玉 貴志, 鈴木 潤, 鈴木 久美, 中山 功太, Namgi Han, 宮尾 祐介
    2026 年33 巻2 号 p. 658-690
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    日本語大規模言語モデル (LLM) の性能向上を目的とし,ファインチューニングを含む多様な手法を体系的に検証するためのチューニングコンペティションを開催した.本コンペティションでは,数理推論能力を評価する数学タスクと,安全性と有用性の両立を評価する安全性タスクの二種類のベンチマークを設定し,参加チームが日本語 LLM をベースに独自に開発したモデルを競わせる.数学タスクでは,高校レベルのベンチマークを用いて日本語 LLM の推論能力を測定し,強力な外部モデル出力の活用や大規模合成データによる教師あり学習が有効であることを確認した.一方で,既存の日本語 LLM の数学的基盤知識の不足により,軽量なファインチューニングや強化学習のみでは十分な改善が得られないことも明らかとなった.安全性タスクでは,日本語で構築した安全性・有用性データセットを用いて評価を行い,Direct Preference Optimizationやモデルマージなどの手法が安全性向上に寄与する一方,一見有害に見えるが実際には回答可能な曖昧事例に対する適切な応答は依然として課題であることを示した.本開催は,日本語 LLM を対象とする初の大規模チューニングコンペティションであり,その設計・運営・結果分析を通じて,日本語 LLM の性能向上および今後のコンペティション設計に資する知見を提示する.

  • Xinger Fu, Masaaki Nagata, Chenhui Chu
    2026 年33 巻2 号 p. 691-721
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    Large language model (LLM) based machine translation (MT) has gained increasing attention. However, most LLM-based MT models are primarily designed for dominant-language pairs and perform poorly on translation between non-dominant language pairs. We define a dominant-language pair as one where at least one language is dominant in the model’s pre-training corpus. In contrast, non-dominant pairs consist of two languages that are underrepresented or unseen during pre-training. To address this limitation, we propose a generalizable recipe, LlmMT+1. LlmMT+1 enhances non-dominant language translation by adding a new language pair to an existing LLM-based MT model, adapting the training strategy, including continual pre-training, supervised fine-tuning, and direct preference optimization based on the pre-training status of the involved languages. We apply this recipe to two types of LLM-based MT models: (1) an English-dominant model (TowerBase-13B), whose training corpus is predominantly English, and (2) a multilingual model (Aya-expanse-8B), which supports 23 languages with a more balanced multilingual training strategy. We evaluate six non-dominant language pairs based on the pre-training status of the involved languages across these two model types and demonstrate that LlmMT+1 consistently improves translation performance. Our ablation studies highlight the effectiveness of preference optimization in adapting multilingual models to new translation pairs.

  • 長谷川 遼, 坂井 優介, 上垣外 英剛, 渡辺 太郎
    2026 年33 巻2 号 p. 722-759
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    言語モデルの大規模化に伴い,モデル全体を再学習せずに知識の更新を行う手法である,知識編集に関する研究が盛んに行われている.しかし既存の知識編集手法はモデルが事前学習で獲得したトークン予測確率を直接変更してしまうため,モデルの予測確率と学習データからモデルが獲得したトークン分布情報が一致しなくなる.このような不一致は,モデルの回答の尤もらしさを表す確信度の正解率との乖離を招くことが知られている.例えばRLHF (Reinforcement Learning from Human Feedback) などの強化学習手法を用いた言語モデルの事後学習においては,確信度が正解率と比べて過度に高くなる確信度過剰となる.本研究では,確信度と正解率の乖離度合いを測る確信度較正を知識編集前後の言語モデルに対して適用し,知識編集が言語モデルの確信度に与える影響を調査した.合計10種類の言語モデルに対して3種類の知識編集手法を適用して分析した結果,特に文章の意味理解が必要なタスクでは,編集に成功した場合,実際の正解率の上昇幅と比較し知識編集後のトークン予測確率の上昇幅が小さいことが明らかとなった.このことから知識編集手法は事後学習と異なり,編集に成功した時に正解率よりもモデルの確信度が低い確信度不足となる傾向がわかった.またRLHF後のモデルに対して知識編集を行い成功した場合,両者の傾向が相殺され,確信度較正が良化する可能性を示唆する結果が得られた.

  • 尾崎 慎太郎, 林 和樹, 坂井 優介, 上垣外 英剛, 林 克彦, 渡辺 太郎
    2026 年33 巻2 号 p. 760-808
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    画像と文章の両方を処理する大規模視覚言語モデル (VLMs) の性能向上に伴い,モデルの多言語能力を対象とした発展が期待されている.一方で,VLMsを構成する画像エンコーダの事前学習や,大規模言語モデル (LLMs) と画像エンコーダの統合学習は,主に英語の学習データを用いて行われており,英語以外の言語で説明生成をする際に,VLMsが潜在能力を十分に発揮できているかは明らかにされていない.また,機械翻訳を利用してデータセットを作成した多言語QAベンチマークは,言語の細かなニュアンスを的確に捉えられておらず,言語本来の性能を評価するに際しての課題が残る.これらの課題を解決するため,本研究では機械翻訳に頼らない多言語画像理解データセットを提案する.このデータセットを用いて,VLMsの説明生成能力を評価するだけでなく,資源が豊富な英語での指示学習が他の言語での性能を向上させるかどうかについても検証する.多様なモデルを対象とした複数の設定による実験の結果,VLMsは英語以外の言語を対象とした際に性能が低下することを確認した.また,英語のデータから学習した知識を効果的に利用する上での課題が存在することを確認し,画像エンコーダの学習や統合学習時においても多言語で学習を行うことの必要性を強調する結果となった.

  • Zhi Qu, Yiran Wang, Jiannan Mao, Jin Tei, Hideki Tanaka, Masao Utiyama ...
    2026 年33 巻2 号 p. 809-847
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    Multilingual neural machine translation (MNMT) aims to support arbitrary translations across multiple languages.MNMT has recently seen dramatic improvements with large language models (LLMs), yet LLMs often require substantial computational resources and may be insufficient for MNMT in terms of quality. In this work, we present MITRE (multilingual translation with registers), a series of pre-trained MNMT-specific models trained on 9.3 billion sentence pairs across 24 languages collected from public corpora to compete with commercial LLMs. Built on the decoder-only architecture, MITRE integrates a novel mechanism called registering, which inserts a sequence of artificial tokens, namely registers, between source and target tokens and modifies the attention mask such that generation pays attention exclusively to the activated registers. Through experiments on EC-40, a large-scale training set that enables fair methodological comparison, we first demonstrate that registering advances the state-of-the-art in MNMT-specific methods. Second, we show that one of our models, MITRE-913M, outperforms NLLB-3.3B in most cases, and achieves performance close to GPT-4o mini with less than 1 billion parameters measured by spBLEU, chrF++, and COMET. Third, fine-tuning experiments in various scenarios show that our models have strong fine-tuning adaptability compared to NLLB series. Finally, based on analysis, we show that registers reflect the semantics of corresponding source tokens in the target language space.

  • Youyuan Lin, Masaaki Nagata, Chenhui Chu
    2026 年33 巻2 号 p. 848-879
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    Fine-grained word-level Quality Estimation (QE), such as Multidimensional Quality Metrics (MQM), provides error annotations that can enhance Automatic Post-Editing (APE) and APE evaluation. We studied a two-stage QE-assisted APE pipeline: a QE model tags error spans and a post-editor refines the translation conditioned on these annotations. We improved QE decoding using Minimum Bayes Risk (MBR) decoding. In addition, we introduce Edit Agreement Test-F1, a novel metric that measures over- or undercorrection by comparing QE predictions against gold annotations.We expanded two MQM datasets with post-edited translations generated using GPT-4.Experiments in four translation directions show that accurate word-level QE improves translation quality and that our MBR-enhanced QE models outperform state-of-the-art baselines.

  • 佐藤 拓真, 河野 誠也, 吉野 幸一郎
    2026 年33 巻2 号 p. 880-919
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    言外の意味を正確に解釈する能力は,人間のコミュニケーションや言語使用において重要な役割を果たしており,言語モデルにも同様の能力が求められている.本研究は,語用論の理論をプロンプトとして大規模言語モデルに与えることが,言外の意味理解タスクに対する有効な手法であることを示す.具体的には,グライス語用論や関連性理論といった語用論理論の概要をプロンプトとして提示し,最終的な解釈に至るまでの中間的な推論過程を出力するようモデルに促す手法を提案する.提案手法の有効性を検証するため,発話の言外の意味を4~5択の多肢選択式問題として問うベンチマーク上で実験を行った.実験の結果,語用論理論を提示せずに中間的な推論を促すベースライン手法 (0-shot Chain-of-Thought) と比較して,提案手法はベンチマークにおいて最大9.6%の正解率向上を達成した.また,語用論理論を詳細に説明しなくても,その名前をプロンプト内で言及するだけで,大規模モデルにおいては1~3%程度の性能向上が得られることも確認した.

  • 松田 寛, 馬 春鵬, 浅原 正幸
    2026 年33 巻2 号 p. 920-956
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    大規模言語モデル (LLM) は多様なタスクで高い性能を示しているが,自然言語処理の基礎タスクである依存構造解析では,構造的に妥当かつ高精度な解析結果を得ることが難しい.本研究では,LLMを用いた依存構造解析において,UD品詞推定,主辞判定,依存関係ラベル推定の各処理をステップ化した段階的指示プロンプトと,Universal Dependencies (UD) の標準フォーマットのCoNLL-Uを簡略化した表形式出力を組み合わせた依存構造解析手法を提案する.提案手法をUDの17言語のデータセットを用いて正解単語分割を入力で与える設定で評価した結果,提案手法はLabeled Attachment Score (LAS) においてベースラインを15言語で上回り,17言語のマクロ平均ではLASでベースラインを0.4ポイント上回った.多言語学習実験の結果から,言語間の一般化の作用の存在が示唆された.一方,段階的指示で対話文脈が長くなることにより,スループットは低下した.一般に,LLMを用いた手法の性能評価では,事前学習過程でのテストデータの混入が性能に影響を与えることが懸念されるが,本研究の実験で用いるベースモデルについては,テストデータの混入による解析精度への明確な影響は確認されなかった.これらの結果は,LLMによる依存構造解析で段階的指示と表形式出力を用いることの有効性を示すものである.また,関連研究で取り上げたU-DepPLLaMAの公開実装は,精度指標として(暗黙的に)適合率を用いており,他の手法のF1値による評価結果と正当な比較ができないと判断し,U-DepPLLaMAと同等の表現形式を用いた実験を提案手法の動作環境で実施することで代替した.これらの変更は,本研究の実験結果の客観性をより高めるためのものである.

  • 田尻 愛斗, 稲葉 通将
    2026 年33 巻2 号 p. 957-988
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    推薦対話システム (Conversational Recommender Systems; CRS) は,対話を通じてユーザの嗜好を引き出し,適切なアイテム推薦を提供することを目的とする.しかし,既存の推薦対話データセットは少ないターン数で推薦を行うため,旅行代理店における旅行相談のように,推薦に先立ちユーザの嗜好や要望を詳細に聞き取る対話とは異なる.本研究はこの問題に対処するため,大規模言語モデル (LLM) を活用し,対話履歴からの対話要約文,アイテム情報からアイテム推薦文の生成を行う.これにより,ユーザの明示的な発話だけでなく,対話文脈から推測される暗黙的嗜好の抽出も可能になる.さらに,推薦性能を基準として対話要約文とアイテム推薦文の生成を最適化するため,Direct Preference Optimization (DPO) を用いる手法を提案する.2つの公開データセットを用いた実験により,本手法がユーザの嗜好を段階的に把握した上で推薦を行う推薦対話プロセスに対して有効であることを確認した.実装は以下で公開している: https://github.com/UEC-InabaLab/Refining-LLM-Text

  • 出口 祥之, 永田 昌明
    2026 年33 巻2 号 p. 989-1026
    発行日: 2026年
    公開日: 2026/06/15
    ジャーナル フリー

    最小Bayesリスク復号は,仮説選択に対する効用の期待値(期待効用)を最大化するテキスト生成法であり,従来の最大事後確率復号よりも高品質なテキストを生成する.しかし,期待効用はテキスト生成モデルからのサンプリングによって推定されるため,モデルの知識が不足しているドメインなどにおいては期待効用の推定値が真の値と乖離しやすく,ドメイン特有の知識や情報を反映したテキストを生成することは難しい.この問題に対処するため,ドメインの事例データを用いて期待効用を推定する,事例ベース意思決定理論に基づく復号を提案する.また,事例ベース意思決定理論に基づく復号と最小Bayesリスク復号を線形補間により組み合わせることで,さらなる品質改善を狙う.7ドメインの独英・日英・英日翻訳実験およびMSCOCOとnocapsデータセットを用いた画像キャプション生成実験より,提案法が最小Bayesリスク復号を上回る品質で生成することを確認した.

学会記事(査読無)
後付記事(査読無)
feedback
Top