| Item type |
SIG Technical Reports(1) |
| 公開日 |
2026-02-28 |
| タイトル |
|
|
言語 |
ja |
|
タイトル |
大規模言語モデルとの対話におけるユーザの自己矛盾検知に関するベンチマーク |
| 言語 |
|
|
言語 |
jpn |
| キーワード |
|
|
主題Scheme |
Other |
|
主題 |
LLMの信頼性 |
| 資源タイプ |
|
|
資源タイプ識別子 |
http://purl.org/coar/resource_type/c_18gh |
|
資源タイプ |
technical report |
| 著者所属 |
|
|
|
同志社大学 |
| 著者所属 |
|
|
|
トランスコスモス株式会社 |
| 著者所属 |
|
|
|
同志社大学 |
| 著者所属 |
|
|
|
トランスコスモス株式会社 |
| 著者所属 |
|
|
|
同志社大学 |
| 著者所属(英) |
|
|
|
en |
|
|
Doshisha University |
| 著者所属(英) |
|
|
|
en |
|
|
transcosmos inc. |
| 著者所属(英) |
|
|
|
en |
|
|
Doshisha University |
| 著者所属(英) |
|
|
|
en |
|
|
transcosmos inc. |
| 著者所属(英) |
|
|
|
en |
|
|
Doshisha University |
| 著者名 |
大東,陸人
大林,弘明
田村,晃裕
濱田,充男
加藤,恒夫
|
| 論文抄録 |
|
|
内容記述タイプ |
Other |
|
内容記述 |
ユーザの指示に基づいて応答する大規模言語モデル(LLM)では,自己矛盾を含む指示文が入力された場合,ユーザの意図とは異なる応答を出力する場合がある.一方で,LLMの応答性能の向上を目的として指示文を自動補完するなどの先行研究は存在するが,指示文内の矛盾を検出する研究は行われていない.そこで本研究では,ユーザ指示文における自己矛盾検出技術の開発を検討するために,自己矛盾を含むユーザ発話の評価データセットを構築した.具体的には,実業務を想定して要約などのタスクを対象とし,自己矛盾を含むユーザ指示文を複数のLLMを用いて生成した後,日本語として不適切なものおよび自己矛盾を含まないものを人手で除外することで,データセットを構築した.さらに,構築した評価データセットを用いて,複数の既存LLMの自己矛盾検出性能を評価した.実験結果より,既存の上位モデルは高い適合率を示す一方で再現率が低く,矛盾判定において慎重な傾向が見られた.これに対し,下位モデルは過剰に矛盾と判断する傾向があり適合率が低いことが分かった.以上の結果から,既存のLLMによる自己矛盾検出には改善の余地があり,自己矛盾検出に特化したモデルの開発の必要性が示唆された. |
| 書誌レコードID |
|
|
収録物識別子タイプ |
NCID |
|
収録物識別子 |
AN10115061 |
| 書誌情報 |
研究報告自然言語処理(NL)
巻 2026-NL-267,
号 32,
p. 1-7,
発行日 2026-02-28
|
| ISSN |
|
|
収録物識別子タイプ |
ISSN |
|
収録物識別子 |
2188-8779 |
| Notice |
|
|
|
SIG Technical Reports are nonrefereed and hence may later appear in any journals, conferences, symposia, etc. |
| 出版者 |
|
|
言語 |
ja |
|
出版者 |
情報処理学会 |