研究概述
arXiv:2608.18085v1 公告类型:新论文
摘要:已有研究表明,大型语言模型(LLMs)在开放式文本生成中能够表达多样化的个性特征。然而,目前尚不清楚它们是否能在目标导向的对话中做到这一点而不损害任务完成度,以及适应用户个性是否能提升交互质量。
研究问题与方法
我们在任务型对话(TOD)中研究这些问题,此类系统中,系统通过多轮交互帮助用户实现目标。我们构建了一个无需训练的框架,模拟两个LLM之间的TOD交互:一个展现目标个性的用户代理,以及一个在完成任务的同时适应用户的系统代理。
为隔离适应性的影响,我们在三种条件下改变系统对用户个性的了解程度:
- 中性条件(Neutral):系统不接收任何个性信息。
- 推断条件(Try):系统从对话线索中推断个性。
- 先知条件(Oracle):系统被明确告知个性。
实验设置
我们评估了GPT-4o、Qwen3-Next-80B和Gemini 2.0 Flash在Schema-Guided Dialogue(SGD)数据集的酒店和餐厅对话上的表现,覆盖大五人格特质及其对立面。
主要发现
我们发现,用户代理能够在系统保持强大任务性能的同时表达个性,尽管某些特质的实现可靠性远低于其他特质。
适应用户个性可提高约束满足率、信息提供率和用户满意度,但会降低真实性,揭示出个性化与任务接地之间的权衡。
先知条件的增益在目标特质被强烈表达时增长,而推断条件的增益在很大程度上对实现强度不敏感。
结论
总体而言,推断条件(Try)中的基于线索的适应最能解决这一权衡,为无需微调的个性感知TOD提供了更可靠的路径。