跳到正文

公司与模型

OpenAI / ChatGPT 最新动态

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

815 条精选近 30 天 146 条共收录 5,741 条

更新

精选归档 · 第 41 页

4月15日周一第 801–815 条
  1. OpenAI:官网动态82

    OpenAI Five 击败 Dota 2 世界冠军战队 OG

    OpenAI Five 在周末的决赛中连赢两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI,也是 AI 首次在直播比赛中战胜电竞职业选手。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下对局中战胜优秀职业选手,但在公开职业比赛中落败。

    推荐理由:原文记录了 AI 首次在公开直播比赛中击败电竞世界冠军的节点,并交代了与此前私下对局结果的对比背景。

11月8日周四
  1. OpenAI:官网动态68

    OpenAI 发布深度强化学习教育资源 Spinning Up in Deep RL

    OpenAI 发布 Spinning Up in Deep RL,一套旨在让任何人学会成为深度强化学习熟练从业者的教育材料。资源包含清晰的 RL 代码示例、教育性练习、文档和教程。

    推荐理由:OpenAI 自家发布的深度强化学习教育资源,代码示例、练习和教程齐全,适合想系统入门深度 RL 的开发者按图索骥。

8月23日周四
8月6日周一
  1. OpenAI:官网动态74

    OpenAI Five 在表演赛中战胜 99.95 百分位 Dota 玩家队伍

    OpenAI Five 在三局两胜的比赛中战胜由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的队伍,其中四人曾打过职业 Dota。比赛面向现场观众并有 10 万人同时在线观看直播。

    推荐理由:原文记录了 OpenAI Five 击败高分段 Dota 战队的比赛结果,可作为 AI 在复杂即时对战场景进展的早期事件参考。

7月4日周三
  1. OpenAI:官网动态66

    OpenAI 用单条人类演示训练智能体在 Montezuma's Revenge 上达到 74500 分

    OpenAI 训练的智能体仅从单条人类演示出发,在 Montezuma's Revenge 上取得 74500 分的高分,超过此前已发表的最好结果。算法做法是从演示中精心挑选的状态开始连续游戏,使用 PPO 优化游戏得分进行学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。

    推荐理由:原文说明从单条人类演示中选取起始状态再用 PPO 优化得分的算法思路,读者可以理解这一强化学习方法的可迁移做法。

6月11日周一
  1. OpenAI:官网动态75

    OpenAI 发布基于无监督预训练的语言理解模型并取得 SOTA 结果

    OpenAI 用结合 Transformer 与无监督预训练的通用、任务无关系统,在多项语言任务上取得 SOTA 结果,并开源发布该系统。OpenAI 表示这一结果验证了监督学习与无监督预训练结合的有效性,希望推动在更大、更多样数据集上的后续研究。

    推荐理由:原文说明了方法组合与开放发布,读者可以据此理解无监督预训练思路在多项语言任务上的效果。

5月16日周三
  1. OpenAI:官网动态76

    OpenAI 分析:最大 AI 训练算力自 2012 年起每 3.4 个月翻倍

    OpenAI 发布分析,显示自 2012 年以来最大 AI 训练所用算力以 3.4 个月翻倍的速度指数增长,远超摩尔定律 2 年的翻倍周期。该指标累计增长超过 300,000 倍,而 2 年翻倍同期只带来 7 倍增长。文中指出算力提升是 AI 进展的关键组成,若趋势延续,需为远超当今系统能力的影响做好准备。

    推荐理由:OpenAI 用自己的分析给出 2012 年以来最大 AI 训练算力 3.4 个月翻倍、增长超 30 万倍的数据,读者可据此对照摩尔定律理解算力趋势。

2月20日周二
8月16日周三
  1. OpenAI:官网动态71

    OpenAI 谈 Dota 2 成绩:自我博弈让系统从低于人类到超人水平

    OpenAI 表示其 Dota 2 结果显示,在足够算力下自我博弈(self-play)可让机器学习系统从远低于人类水平跃升到超人水平。该系统在一个月内从勉强匹敌高分段选手进步到击败顶级职业选手,此后仍在继续提升;自我博弈系统中的数据会随智能体变强而自动改善,不受监督深度学习训练数据集质量上限的约束。

    推荐理由:OpenAI 借 Dota 2 结果说明自我博弈为何能突破监督学习的数据上限,对理解强化学习路线有参考价值。

8月11日周五
  1. OpenAI:官网动态71

    OpenAI 打造 Dota 2 bot 在 1v1 比赛中战胜世界顶尖职业选手

    OpenAI 打造出一个在标准赛事规则下、Dota 2 1v1 比赛中战胜世界顶尖职业选手的 bot。该 bot 通过自我对弈从零学会游戏,不使用模仿学习或树搜索,OpenAI 称这是迈向在涉及真实人类的复杂场景中达成明确目标的 AI 系统的一步。

    推荐理由:原文说明 bot 从零自学习、不用模仿学习和树搜索,读者可据此理解其在复杂真实环境中的方法论意义。

7月20日周四
  1. OpenAI:官网动态73

    OpenAI 发布强化学习算法 Proximal Policy Optimization (PPO)

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。因易用且表现良好,PPO 已成为 OpenAI 内部默认的强化学习算法。

    推荐理由:OpenAI 官方宣布 PPO 算法开源,并说明其成为内部默认强化学习算法的原因,可帮助读者了解该方法的定位。

6月13日周二
  1. OpenAI:官网动态70

    OpenAI 与 DeepMind 合作研究从人类偏好中学习

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两个候选行为中哪个更好来推断人类想要什么。该工作旨在免去人工编写目标函数,避免为复杂目标使用简单代理或目标偏差导致不良甚至危险行为,是构建安全 AI 系统的一步。

    推荐理由:原文说明该算法通过比较两种行为的优劣来推断人类偏好,从而免去人工编写目标函数,可作为对齐研究的背景参考。

3月24日周五
  1. OpenAI:官网动态63

    OpenAI 提出进化策略(ES)可作为强化学习的可扩展替代方案

    OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari/MuJoCo 等现代 RL 基准上可与标准强化学习方法性能相当,同时克服了 RL 的许多不便之处。

    推荐理由:原文指出进化策略在 Atari/MuJoCo 基准上可媲美标准 RL,并克服 RL 的诸多不便,读者可借此了解另一种可扩展的优化路线。

4月27日周三
  1. OpenAI:官网动态71

    OpenAI 发布 OpenAI Gym 公测版强化学习工具包

    OpenAI 发布 OpenAI Gym 公测版(public beta),这是一个用于开发和比较强化学习(RL)算法的工具包。它包含持续扩充的环境套件,覆盖模拟机器人到 Atari 游戏,并提供用于比较和复现结果的网站。

    推荐理由:工具面向强化学习算法的开发与结果比较,环境覆盖模拟机器人和 Atari 游戏,可帮助读者了解可复现评测的入口。

12月11日周五
  1. OpenAI:官网动态83

    OpenAI 宣布成立非营利人工智能研究公司

    OpenAI 宣布成立,是一家非营利人工智能研究公司,目标是推动数字智能以最有可能造福全人类的方式发展。其研究不受产生财务回报的义务约束,可更专注于对人类的正面影响。

    推荐理由:OpenAI 官方宣布成立并阐明非营利定位,读者可以此了解其不受财务回报约束的研究初衷。