跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分38

数据稀缺下 LLM 的协作式个性化偏好对齐:近似帕累托最优(APO)方法

Collaborative Personalized Preference Alignment for LLMs under Data Deficiency

AI 导读

针对用户个性化反馈稀缺导致轻量对齐器难以训练的问题,研究者提出近似帕累托最优(APO)方法,先按更新兼容性对用户分组,再结合梯度下降与受控上升协调相互竞争的目标,学习支持少样本适配的对齐器初始化。在 Fed-ChatbotPA 和 UltraFeedback 上,仅用 20 个本地样本即持续优于现有方法。

来源:HuggingFace Daily Papers · arxiv.org