HuggingFace Daily Papers·· 2 天前AI 评分46
HuatuoGPT-3:仅用强化学习从基座模型完成领域适配
HuatuoGPT-3: RL-Only Domain Adaptation from Base Models
AI 导读
研究团队提出 One-stage Policy Optimization(OnePO),仅用强化学习即可将基座模型适配到医疗领域,解决冷启动中的 Gradient Starvation 与 Teacher-Distribution Anchoring 问题。
来源:HuggingFace Daily Papers · arxiv.org