OpenAI 发布 GPT-4o并向 ChatGPT 免费用户开放更多能力
OpenAI 发布 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。消息来自官网 Spring Update,feed 未提供完整正文。
推荐理由:OpenAI 官方宣布新模型与免费能力调整,读者可据此了解 ChatGPT 付费与免费功能边界的变化。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
800 条精选近 30 天 60 条共收录 3,805 条
OpenAI 发布 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。消息来自官网 Spring Update,feed 未提供完整正文。
推荐理由:OpenAI 官方宣布新模型与免费能力调整,读者可据此了解 ChatGPT 付费与免费功能边界的变化。
OpenAI 发布最新旗舰模型 GPT-4o,并在 ChatGPT 中向免费用户开放更多功能。官方称这是其最新旗舰模型,同时扩展了免费版 ChatGPT 可用的能力范围。
推荐理由:OpenAI 官方宣布旗舰模型上线,同时明确免费用户可用范围扩大,适合据此评估对现有 ChatGPT 使用方式的影响。
Zyphra 发布 7B 基础模型 Zamba,采用 Mamba 块加每 6 层共享权重的全局注意力层的混合架构。
推荐理由:官方原文给出架构设计、训练规模和开放 checkpoints 细节,读者可以据此评估 Mamba 混合架构在本地部署上的取舍。
xAI 发布 Grok-1.5 Vision 预览版,新增视觉理解能力,可处理图像、图表及文档内容,支持跨模态推理与视觉问答,现面向早期测试者开放试用。
推荐理由:xAI发布Grok-1.5 Vision预览版,具备多模态视觉理解能力
OpenAI 发布视频生成模型 Sora,可生成一分钟高保真视频。模型基于 Transformer 架构处理视频和图像潜在编码的时空 patch,在可变时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型。OpenAI 认为扩展视频生成模型是构建物理世界通用模拟器的一条有前景的路径。
推荐理由:原文给出 Sora 的技术路线与能力边界,读者可以据此理解视频生成模型作为物理世界模拟器的思路。
Llama 2 发布,可在 Hugging Face 上获取。
OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是接受图像和文本输入、输出文本的大型多模态模型,在多项专业和学术基准上达到人类水平表现,但在许多现实场景中仍不及人类。
推荐理由:官方原文明确了 GPT-4 的多模态输入形态和基准表现定位,可作为了解该模型能力边界的直接信源。
OpenAI 发布 GPT-4。官方介绍其可生成、编辑并与用户迭代创意和技术写作任务,如创作歌曲、编写剧本或学习用户的写作风格。
推荐理由:OpenAI 官方介绍 GPT-4 在创意与技术写作上可与用户迭代协作,适合关注其文本能力边界的读者。
OpenAI 训练了名为 ChatGPT 的模型,能以对话方式交互。对话格式让 ChatGPT 可以回答追问、承认错误、质疑错误前提并拒绝不当请求。
推荐理由:OpenAI 官方首次介绍 ChatGPT,说明对话式交互在追问、纠错和拒答上的设计意图,可作为理解该产品起点的一手材料。
OpenAI 训练并开源了名为 Whisper 的神经网络,其英文语音识别的稳健性和准确率接近人类水平。
推荐理由:原文来自 OpenAI 官方,点明 Whisper 在英文语音识别上的稳健性和准确率接近人类水平,并直接开源。
Hugging Face 与 BigScience 发布 1760 亿参数的开源多语言大模型 BLOOM,支持 46 种自然语言和 13 种编程语言。模型由 70 多个国家、250 多个机构的 1000 多名研究者历时一年协作完成,在法国 Jean Zay 超算上训练 117 天,算力来自 CNRS 和 GENCI 价值约 300 万欧元的资助。
推荐理由:原文来自 BLOOM 团队官方发布,给出了参数规模、语言覆盖、训练成本和开放使用方式,读者可以了解这个开放大模型的实际边界。
OpenAI 训练出比 GPT-3 更能遵循用户意图的 InstructGPT 模型,同时更真实、毒性更低。模型采用人在回路的对齐研究技术训练,现已作为 OpenAI API 的默认语言模型部署。
推荐理由:原文说明了对齐训练带来的意图遵循与真实性改进,以及 InstructGPT 成为 API 默认模型这一关键落地变化。
OpenAI 宣布训练出神经网络 DALL·E,可根据自然语言文本描述生成图像,覆盖广泛可用自然语言表达的概念。
推荐理由:OpenAI 官方宣布文本生成图像模型 DALL·E,读者可据此了解文生图方向的早期源头。
OpenAI 推出神经网络 CLIP,能通过自然语言监督高效学习视觉概念。只需提供待识别视觉类别的名称,CLIP 即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:原文说明 CLIP 用自然语言监督学习视觉概念并可零样本套用于分类基准,读者可了解其与 GPT 系列零样本思路的关联。
OpenAI 发布 Jukebox,一个可直接以原始音频形式生成音乐的神经网络,支持多种流派和艺术家风格,包括初步的歌声。OpenAI 同时开源模型权重和代码,并提供探索生成样本的工具。
推荐理由:原文给出 Jukebox 以原始音频生成含人声音乐的核心能力,并说明开放模型权重与代码,读者可据此评估其可复用性。
OpenAI 发布 GPT-2 分阶段发布的最终版本,即 1.5B 参数的最大版本,同时公开代码和模型权重以帮助检测 GPT-2 模型的输出。OpenAI 表示自 8 月以来已有更大的语言模型发布,但坚持按原计划完成分阶段发布,为社区提供一个完整的分阶段发布流程案例,并继续与 AI 社区探讨负责任发布。
推荐理由:OpenAI 以完整分阶段发布作为案例放出 1.5B 版本,读者可借此了解负责任发布的实际过程。
OpenAI 发布 774M 参数的 GPT-2 语言模型,此前已于 2 月发布 124M 小型版、5 月分阶段发布 355M 中型版,并与合作伙伴及 AI 社区研究了模型的滥用风险与社会效益。同时发布一份开源法律协议以便组织间建立模型共享合作,并发布关于与 AI 研究社区协调发布规范经验的技术报告。
推荐理由:原文交代了 GPT-2 分阶段发布策略的推进节奏,并附带模型共享法律协议与发布规范报告,可了解负责任发布实践。
OpenAI 用结合 Transformer 与无监督预训练的通用、任务无关系统,在多项语言任务上取得 SOTA 结果,并开源发布该系统。OpenAI 表示这一结果验证了监督学习与无监督预训练结合的有效性,希望推动在更大、更多样数据集上的后续研究。
推荐理由:原文说明了方法组合与开放发布,读者可以据此理解无监督预训练思路在多项语言任务上的效果。
OpenAI 打造出一个在标准赛事规则下、Dota 2 1v1 比赛中战胜世界顶尖职业选手的 bot。该 bot 通过自我对弈从零学会游戏,不使用模仿学习或树搜索,OpenAI 称这是迈向在涉及真实人类的复杂场景中达成明确目标的 AI 系统的一步。
推荐理由:原文说明 bot 从零自学习、不用模仿学习和树搜索,读者可据此理解其在复杂真实环境中的方法论意义。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。因易用且表现良好,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 官方宣布 PPO 算法开源,并说明其成为内部默认强化学习算法的原因,可帮助读者了解该方法的定位。