零数据引导对话推荐系统的实证研究
An Empirical Study on Zero-Data Bootstrapping for Conversational Recommender Systems
该论文系统研究了零数据对话推荐系统(CRS)引导方法,从商品评论、元数据和用户-商品交互等非对话信号生成合成对话监督数据。论文比较了 Jensen-Shannon 多样性和 Fisher 信息两种选择策略,发现领域合成数据一致优于零样本提示和朴素合成基线,主动选择比随机采样更省数据,低资源场景下合成数据可超越稀缺真实对话并与之互补。
Conversational Recommender Systems (CRS) typically require domain-specific dialogue data, which is costly, scarce, and often unavailable in new domains. We conduct a systematic empirical study of zero-data CRS bootstrapping: generating synthetic conversational supervision from non-conversational signals---item reviews, metadata, and user-item interactions---without any in-domain dialogue corpus. We compare two information-theoretic selection strategies, Jensen-Shannon diversity and Fisher information, across domain signals, model architectures, datasets, and fine-tuning paradigms. Our results show that domain-grounded synthetic data consistently outperforms zero-shot prompting and naive synthetic baselines; active selection improves data efficiency over random sampling; metadata and collaborative filtering signals each improve selection quality; and, in low-resource settings, synthetic data can outperform scarce real dialogues while further complementing them. These findings establish non-conversational domain signals as a viable path toward building CRS without conversational training data. The code is available at https://anonymous.4open.science/r/zero_data_crs/ .
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org