OpenAI 用人类偏好微调 774M 参数 GPT-2
OpenAI 用人类反馈微调 774M 参数 GPT-2,在多项任务上匹配了外部标注者的偏好。摘要任务用了 6 万条人工标注,风格续写等较简单任务只需 5 千条;标注者偏好摘要整句照抄原文,导致模型学会照抄。OpenAI 表示此举意在让安全技术更接近'机器与人对话'这一通用任务。
推荐理由:原文给出人类偏好微调 GPT-2 的任务结果与标注成本,并暴露标注偏好与作者意图不一致的问题。
内容形态
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
547 条精选近 30 天 31 条共收录 6,561 条
OpenAI 用人类反馈微调 774M 参数 GPT-2,在多项任务上匹配了外部标注者的偏好。摘要任务用了 6 万条人工标注,风格续写等较简单任务只需 5 千条;标注者偏好摘要整句照抄原文,导致模型学会照抄。OpenAI 表示此举意在让安全技术更接近'机器与人对话'这一通用任务。
推荐理由:原文给出人类偏好微调 GPT-2 的任务结果与标注成本,并暴露标注偏好与作者意图不一致的问题。
OpenAI 报告在新构建的模拟躲猫猫环境中,智能体通过多智能体对抗训练自发学会逐步复杂的工具使用。智能体形成了六种不同的策略与反策略,其中一些是团队事先不知道环境支持的。作者认为这种自监督涌现的复杂性表明,多智能体共同适应未来可能产生极复杂且智能的行为。
推荐理由:原文记录了多智能体在躲猫猫环境中自发形成的六种策略与反策略,可帮助读者理解多智能体协同如何催生复杂行为。
OpenAI 训练的智能体仅从单条人类演示出发,在 Montezuma's Revenge 上取得 74500 分的高分,超过此前已发表的最好结果。算法做法是从演示中精心挑选的状态开始连续游戏,使用 PPO 优化游戏得分进行学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:原文说明从单条人类演示中选取起始状态再用 PPO 优化得分的算法思路,读者可以理解这一强化学习方法的可迁移做法。
OpenAI 发布分析,显示自 2012 年以来最大 AI 训练所用算力以 3.4 个月翻倍的速度指数增长,远超摩尔定律 2 年的翻倍周期。该指标累计增长超过 300,000 倍,而 2 年翻倍同期只带来 7 倍增长。文中指出算力提升是 AI 进展的关键组成,若趋势延续,需为远超当今系统能力的影响做好准备。
推荐理由:OpenAI 用自己的分析给出 2012 年以来最大 AI 训练算力 3.4 个月翻倍、增长超 30 万倍的数据,读者可据此对照摩尔定律理解算力趋势。
OpenAI 联合 Future of Humanity Institute、Centre for the Study of Existential Risk。
推荐理由:OpenAI 与多家机构联合发布预测 AI 恶意用途的论文,为理解 AI 安全威胁和防范思路提供了系统性参考。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两个候选行为中哪个更好来推断人类想要什么。该工作旨在免去人工编写目标函数,避免为复杂目标使用简单代理或目标偏差导致不良甚至危险行为,是构建安全 AI 系统的一步。
推荐理由:原文说明该算法通过比较两种行为的优劣来推断人类偏好,从而免去人工编写目标函数,可作为对齐研究的背景参考。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari/MuJoCo 等现代 RL 基准上可与标准强化学习方法性能相当,同时克服了 RL 的许多不便之处。
推荐理由:原文指出进化策略在 Atari/MuJoCo 基准上可媲美标准 RL,并克服 RL 的诸多不便,读者可借此了解另一种可扩展的优化路线。