OpenAI Five 击败 Dota 2 世界冠军战队 OG
OpenAI Five 在周末的决赛中连赢两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI,也是 AI 首次在直播比赛中战胜电竞职业选手。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下对局中战胜优秀职业选手,但在公开职业比赛中落败。
推荐理由:原文记录了 AI 首次在公开直播比赛中击败电竞世界冠军的节点,并交代了与此前私下对局结果的对比背景。
公司与模型
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
815 条精选近 30 天 146 条共收录 5,741 条
OpenAI Five 在周末的决赛中连赢两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI,也是 AI 首次在直播比赛中战胜电竞职业选手。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下对局中战胜优秀职业选手,但在公开职业比赛中落败。
推荐理由:原文记录了 AI 首次在公开直播比赛中击败电竞世界冠军的节点,并交代了与此前私下对局结果的对比背景。
OpenAI 发布 Spinning Up in Deep RL,一套旨在让任何人学会成为深度强化学习熟练从业者的教育材料。资源包含清晰的 RL 代码示例、教育性练习、文档和教程。
推荐理由:OpenAI 自家发布的深度强化学习教育资源,代码示例、练习和教程齐全,适合想系统入门深度 RL 的开发者按图索骥。
OpenAI Five 本周在温哥华 The International 2018 上与顶级 Dota 2 选手对战两场皆负,但两局前 20-35 分钟都保持较大获胜机会。
推荐理由:OpenAI 官方复盘 OpenAI Five 在 The International 的两场失利,指出前期 20-35 分钟保持优势这一具体表现。
OpenAI Five 在三局两胜的比赛中战胜由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的队伍,其中四人曾打过职业 Dota。比赛面向现场观众并有 10 万人同时在线观看直播。
推荐理由:原文记录了 OpenAI Five 击败高分段 Dota 战队的比赛结果,可作为 AI 在复杂即时对战场景进展的早期事件参考。
OpenAI 训练的智能体仅从单条人类演示出发,在 Montezuma's Revenge 上取得 74500 分的高分,超过此前已发表的最好结果。算法做法是从演示中精心挑选的状态开始连续游戏,使用 PPO 优化游戏得分进行学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:原文说明从单条人类演示中选取起始状态再用 PPO 优化得分的算法思路,读者可以理解这一强化学习方法的可迁移做法。
OpenAI 用结合 Transformer 与无监督预训练的通用、任务无关系统,在多项语言任务上取得 SOTA 结果,并开源发布该系统。OpenAI 表示这一结果验证了监督学习与无监督预训练结合的有效性,希望推动在更大、更多样数据集上的后续研究。
推荐理由:原文说明了方法组合与开放发布,读者可以据此理解无监督预训练思路在多项语言任务上的效果。
OpenAI 发布分析,显示自 2012 年以来最大 AI 训练所用算力以 3.4 个月翻倍的速度指数增长,远超摩尔定律 2 年的翻倍周期。该指标累计增长超过 300,000 倍,而 2 年翻倍同期只带来 7 倍增长。文中指出算力提升是 AI 进展的关键组成,若趋势延续,需为远超当今系统能力的影响做好准备。
推荐理由:OpenAI 用自己的分析给出 2012 年以来最大 AI 训练算力 3.4 个月翻倍、增长超 30 万倍的数据,读者可据此对照摩尔定律理解算力趋势。
OpenAI 联合 Future of Humanity Institute、Centre for the Study of Existential Risk。
推荐理由:OpenAI 与多家机构联合发布预测 AI 恶意用途的论文,为理解 AI 安全威胁和防范思路提供了系统性参考。
OpenAI 表示其 Dota 2 结果显示,在足够算力下自我博弈(self-play)可让机器学习系统从远低于人类水平跃升到超人水平。该系统在一个月内从勉强匹敌高分段选手进步到击败顶级职业选手,此后仍在继续提升;自我博弈系统中的数据会随智能体变强而自动改善,不受监督深度学习训练数据集质量上限的约束。
推荐理由:OpenAI 借 Dota 2 结果说明自我博弈为何能突破监督学习的数据上限,对理解强化学习路线有参考价值。
OpenAI 打造出一个在标准赛事规则下、Dota 2 1v1 比赛中战胜世界顶尖职业选手的 bot。该 bot 通过自我对弈从零学会游戏,不使用模仿学习或树搜索,OpenAI 称这是迈向在涉及真实人类的复杂场景中达成明确目标的 AI 系统的一步。
推荐理由:原文说明 bot 从零自学习、不用模仿学习和树搜索,读者可据此理解其在复杂真实环境中的方法论意义。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。因易用且表现良好,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 官方宣布 PPO 算法开源,并说明其成为内部默认强化学习算法的原因,可帮助读者了解该方法的定位。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两个候选行为中哪个更好来推断人类想要什么。该工作旨在免去人工编写目标函数,避免为复杂目标使用简单代理或目标偏差导致不良甚至危险行为,是构建安全 AI 系统的一步。
推荐理由:原文说明该算法通过比较两种行为的优劣来推断人类偏好,从而免去人工编写目标函数,可作为对齐研究的背景参考。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari/MuJoCo 等现代 RL 基准上可与标准强化学习方法性能相当,同时克服了 RL 的许多不便之处。
推荐理由:原文指出进化策略在 Atari/MuJoCo 基准上可媲美标准 RL,并克服 RL 的诸多不便,读者可借此了解另一种可扩展的优化路线。
OpenAI 发布 OpenAI Gym 公测版(public beta),这是一个用于开发和比较强化学习(RL)算法的工具包。它包含持续扩充的环境套件,覆盖模拟机器人到 Atari 游戏,并提供用于比较和复现结果的网站。
推荐理由:工具面向强化学习算法的开发与结果比较,环境覆盖模拟机器人和 Atari 游戏,可帮助读者了解可复现评测的入口。
OpenAI 宣布成立,是一家非营利人工智能研究公司,目标是推动数字智能以最有可能造福全人类的方式发展。其研究不受产生财务回报的义务约束,可更专注于对人类的正面影响。
推荐理由:OpenAI 官方宣布成立并阐明非营利定位,读者可以此了解其不受财务回报约束的研究初衷。