HuggingFace Daily Papers·· 3 天前AI 评分42
MetaRubric:面向基于评分标准的强化学习,用证据感知奖励解决 Vacuous Credit 问题
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
AI 导读
MetaRubric 通过交替进行证据感知的策略优化与响应引导的评分标准自适应,解决评分模型在响应缺失所需信息时仍给出高分的 Vacuous Credit 问题。
来源:HuggingFace Daily Papers · arxiv.org