トーク

English | 日本語

今後の講演予定や、過去に行った招待講演の一覧を掲載しています。講演依頼は、ayamaguchi1@sheffield.ac.uk までご連絡ください。

LLMのアクセシビリティ向上を目指す言語適応技術:低資源下における語彙拡張と破滅的忘却の軽減

  • 概要: ウェブデータの約4割を英語が占める現状において、それをベースに学習された大規模言語モデル(LLM)は必然的に英語偏重の傾向を示します。このようなモデルは英語以外の言語において下流タスク性能が低下しやすいだけでなく、非ラテン文字体系の言語等ではトークン化の過断片化(over-fragmentation)を引き起こします。これはトークナイザの語彙偏重に起因するものであり、テキストをエンコードする際により多くのトークン数を要し、推論コストや処理効率の悪化を招きます。この課題に対する有効なアプローチとして語彙拡張(Vocabulary Expansion)が知られていますが、利用可能なテキストが限られた低資源環境では埋め込みの学習不足(underfitting)が生じやすく、デコード時に新規追加トークンが適切に生成・利用されないという問題が生じます。さらに、対象言語への適応において必須となる追加学習のプロセスでは、モデルが既存知識を喪失する破滅的忘却(Catastrophic Forgetting)のリスクが伴います。本トークでは、こうした言語適応における効率性と堅牢性の両立を目指し、低資源下での語彙拡張手法(Computational Linguistics 2026)および、元言語の知識を保持しつつ適応を行う Source-Shielded Updates(ACL 2026)の2つのアプローチについて紹介します。
  • 日付: 2026/9/9
  • 会場: NLPコロキウム(オンライン)
  • リンク: 📽️ スライド 📝 論文1 (Computational Linguistics 2026) 📝 論文2 (ACL 2026) 🎤 講演ページ
最終更新日: 2026年08月19日