Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,856条收录
652条精选

精选归档 · 第 2 页

2140 条 · 共 652

9月4日9月4日周五

星期五 · 8 条
03:10
Chubby♨️@kimmonismus精选
AI 评分 76/100
OpenAI 发布 GPT-6 Astra,基准全面超越 Claude Fable 5.1At this point, they completely crushed Fable 5.1 in every benchmark. Claude Fable 5.1 was sota in several key benchmarks for 2 days.Astra is better - and way cheaper.作者引用 OpenAI 官方基准称 GPT-6 Astra 以 99.9% 饱和 ARC-AGI-3,在 ExploitBench 得 100%,并在各项基准上全面超过此前保持 SOTA 两天的 Claude Fable 5.1,且价格更低。

Chubby♨️: 来自 OpenAI 官网的官方 GPT-6 Astra 基准测试 "Astra 在 ARC-AGI-3 上以 99.9% 的得分达到饱和,在 ExploitBench 上以 100% 的得分达到饱和" "GPT-6 Astra 今天开始向有...

另有 9 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:阿易 AI Notes (@AYi_AInotes)Simon Willison 博客X:小北 (@frxiaobei)X:Sherwin Wu(@sherwinwu)X:Rohan Paul (@rohanpaul_ai)X:Greg Brockman (@gdb)
推荐理由:原文汇总了官方基准数字与开放范围,并附成本对比图,读者可据此比较 GPT-6 Astra 与 Claude Fable 5.1 的性价比。
03:01
The Verge:AI(RSS)精选
AI 评分 83/100
OpenAI 发布 GPT-6 Astra,称已进入 AGI 时代

OpenAI 发布下一代的旗舰模型 GPT-6 Astra,称其为能力上的世代跃升,Greg Brockman 表示现在可能已进入 AGI 时代。


推荐理由:报道把 GPT-6 Astra 的能力宣称、AGI 判断与 Hugging Face 事件后的安全安排放在一起,读者可对照看待发布时机的商业与信任背景。
02:29
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 88/100
OpenAI 发布 GPT-6 Astra:多项基准刷新纪录, cybersecurity 能力达 Critical 阈值

OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。

另有 9 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)X:阿易 AI Notes (@AYi_AInotes)Simon Willison 博客X:Greg Brockman (@gdb)X:小北 (@frxiaobei)X:Sherwin Wu(@sherwinwu)
推荐理由:官方发布给出多项评测数字、定价和可用渠道,读者可以据此比较它相对前代和竞品的能力与成本变化。
02:29
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
OpenAI 发布 GPT-6 Astra 并公布安全概览,称其网络安全能力达到 Preparedness Framework 的 Critical 级

OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。


推荐理由:OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。
02:29
🚨 AI News | TestingCatalog@testingcatalog精选
AI 评分 81/100
OpenAI 发布 GPT-6 Astra,初期仅向 Daybreak Access 组织开放OPENAI 🔥: GPT-6 Astra will initially be available only to organizations in its Daybreak Access program.AGI today, but only in Daybreak 👀Over the next several days, it will be released to all Plus, Pro, Business, and Enterprise users.OpenAI 发布 GPT-6 Astra,初期仅向 Daybreak Access 计划中的组织开放,未来几天将陆续推送给所有 Plus、Pro、Business 和 Enterprise 用户。

Hayden Field: "如果我们回头审视并问:'AGI 究竟是在什么时候真正诞生的?'我认为答案会指向大约这个时期,而且很可能就是这款模型。"Greg Brockman 今天在谈及 GPT-6 Astra 时如此表示,并补充道:"就我个人而言,我确实认为我们已经...


推荐理由:原文给出了 GPT-6 Astra 的分级开放节奏和 OpenAI 高层关于 AGI 的表态,读者可以了解新模型的获取路径和官方定位。
02:01
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

另有 3 家信源报道X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)X:Kim (@kimmonismus)
推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。
02:01
TechCrunch:AI(RSS)精选
AI 评分 81/100
OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议

OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。

另有 9 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:阿易 AI Notes (@AYi_AInotes)Simon Willison 博客X:小北 (@frxiaobei)X:Sherwin Wu(@sherwinwu)X:Rohan Paul (@rohanpaul_ai)X:Greg Brockman (@gdb)
推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。

9月3日9月3日周四

星期四 · 3 条
23:02
Google DeepMind:Blog(RSS)精选
AI 评分 70/100
Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型, hourly 更新且分辨率较上一代提升约 5 倍

Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。

另有 7 家信源报道TechCrunch:AI(RSS)X:DAIR.AI (@dair_ai)The Decoder:AI News(RSS)MarkTechPost(RSS)IT之家(RSS)The Verge:AI(RSS)X:Google AI (@GoogleAI)
推荐理由:原文给出分辨率、卫星数据接入和降水精度的具体数字,并说明在 Google 产品和 Cloud 中的获取方式,读者可评估其实际用途。
05:40
Chubby♨️@kimmonismus精选
AI 评分 78/100
Meta 发布 Muse Spark 1.3,Intelligence Index 得 61-62 分逼近 Claude 与 GPT-5.6It’s worth really grasping this: in a very short time, the race between OpenAI and Anthropic has turned into a contest involving OpenAI, Anthropic, xAI, and Meta, and Google is back in the mix, too.They are all on (mostly) equal footing, with little difference between them even in benchmarks like the Artificial Analysis Intelligence Index.Chinese open-weight models are hot on their heels as well. 2026 is truly a wild year, release after release, a completely different landscape compared to the year before. We’re seeing unprecedented leaps in capabilities.I remember the debates in 2025 about whether we had hit a wall; today, we see major improvements every single day. You can practically feel the exponential growth kicking in.Meta 发布 Muse Spark 1.3,为五个月内第四个 Muse Spark 版本。max 变体(合作伙伴限时预览)在 Artificial Analysis Intelligence Index 得 62 分。

Artificial Analysis: Meta 发布了 Muse Spark 1.3,这是他们在五个月内第四次发布 Muse Spark 模型。Muse Spark 1.3 (max) 目前面向 Meta 的合作伙伴提供有限预览,在 Artificial Analysis 智能...

另有 8 家信源报道X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:Testing Catalog (@testingcatalog)X:Rohan Paul (@rohanpaul_ai)MarkTechPost(RSS)IT之家(RSS)X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
推荐理由:引用 Artificial Analysis 的实测数据,可据此把 Meta Muse Spark 1.3 的能力与成本放在与 OpenAI、Anthropic、xAI 同台比较的坐标系里。
04:43
Alexandr Wang@alexandr_wang精选
AI 评分 73/100
Meta 发布 Muse Spark 1.3,智能体与科学推理能力提升i really hate to say it, but…gemini who? 🏎️💨Meta 发布 Muse Spark 1.3,是五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。

Artificial Analysis: Meta 发布了 Muse Spark 1.3,这是他们在五个月内第四次发布 Muse Spark 模型。Muse Spark 1.3 (max) 目前面向 Meta 合作伙伴限量预览,在 Artificial Analysis 智能指数上...

另有 8 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)MarkTechPost(RSS)IT之家(RSS)X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
推荐理由:Meta 官方发布 Muse Spark 1.3,评测数据完整,读者可以比较其智能体表现与单任务成本的变化。

9月2日9月2日周三

星期三 · 6 条
23:58
Google DeepMind:Blog(RSS)精选
AI 评分 78/100
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。

另有 19 家信源报道X:fofr (@fofrAI)Ars Technica:AI(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)MarkTechPost(RSS)X:Google DeepMind (@GoogleDeepMind)The Decoder:AI News(RSS)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)X:Ammaar Reshi (@ammaar)X:Gemini (@GeminiApp)X:Logan Kilpatrick (@OfficialLoganK)X:Sundar Pichai (@sundarpichai)X:Testing Catalog (@testingcatalog)X:Josh Woodward (@joshwoodward, Google Labs VP)X:Demis Hassabis (@demishassabis)X:OpenRouter (@OpenRouter)X:Rohan Paul (@rohanpaul_ai)X:Google AI (@GoogleAI)
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
10:07
Qwen@Alibaba_Qwen精选
AI 评分 68/100
Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿🏆 #1 overall on Code Arena, and top of the Pareto frontier at $5/MToken. Thanks! @arena Give Qwen3.8-Max-0902 a spin on QwenCloud.🥳通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。

Arena.ai: Qwen3.8-Max-0902 由 @Alibaba_Qwen 发布,刚刚在 Code Arena: WebDev 中以 1,691 分的成绩登顶总榜第一,并以混合 $5/MToken 的价格成为 Pareto 前沿上得分最高的模型! 在...

另有 5 家信源报道IT之家(RSS)X:Kim (@kimmonismus)X:通义千问 / Qwen (@Alibaba_Qwen)X:阿易 AI Notes (@AYi_AInotes)X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。
04:19
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 82/100
OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布

OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。

另有 5 家信源报道X:Rohan Paul (@rohanpaul_ai)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:OpenAI 说明了把 Astra 评为 Critical 网络安全能力的评估依据、对应的安全防护设计和受限开放安排,有助于读者理解前沿模型能力分级与放行逻辑。
02:29
Anthropic:Newsroom(网页)精选
AI 评分 87/100
Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。

另有 4 家信源报道The Verge:AI(RSS)IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。
02:29
Claude Platform:开发者版本说明(RSS)精选
AI 评分 72/100
Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。

另有 11 家信源报道IT之家(RSS)X:Thariq (@trq212)Hacker News 热门(buzzing.cc 中文翻译)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:Testing Catalog (@testingcatalog)X:小北 (@frxiaobei)The Decoder:AI News(RSS)MarkTechPost(RSS)TechCrunch:AI(RSS)The Verge:AI(RSS)
推荐理由:官方版本说明给出定价、缓存和 API 兼容性变化,开发者可据此评估迁移成本与新特性用法。
02:18
ClaudeDevs@ClaudeDevs精选
AI 评分 55/100
Claude Fable 5.1 上线 Claude Code 与 Claude Platform,缓存读取降价 75%Fable 5.1 is now live in Claude Code and the Claude Platform.It's priced the same as Fable 5, with 75% cheaper API cache reads. It gets a lot further into a long task before it needs your input, is better at telling you when it's stuck, and its writing style is more natural.Claude Fable 5.1 现已上线 Claude Code 和 Claude Platform,定价与 Fable 5 相同,API 缓存读取便宜 75%。模型在长任务中能更久自主推进、更善于提示用户它已卡住,写作风格也更自然。Anthropic 同时发布了 Claude Fable 5.1 和 Claude Mythos 5.1,称其为编码与知识工作领域最先进的模型。

Claude: We’re introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world’s most advanced models for coding and knowle...

另有 13 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)The Verge:AI(RSS)X:OpenRouter (@OpenRouter)X:Kim (@kimmonismus)X:Thariq (@trq212)Hacker News 热门(buzzing.cc 中文翻译)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:小北 (@frxiaobei)The Decoder:AI News(RSS)TechCrunch:AI(RSS)
推荐理由:原文给出 Fable 5.1 的定价变化与长任务、卡点提示、写作风格上的改进,读者可对照现有工作流评估是否切换。

9月1日9月1日周二

星期二 · 1 条
01:03
Runway:News(网页)精选
AI 评分 67/100
Runway 发布 Interface World Models 首个模型 Solaris,实时逐帧生成可交互界面

Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。


推荐理由:官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。

8月31日8月31日周一

星期一 · 1 条
20:29
IT之家(RSS)精选
AI 评分 76/100
DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。


推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。

8月29日8月29日周六

星期六 · 1 条
13:26
IT之家(RSS)精选
AI 评分 72/100
智谱开源 GLM-5.3 模型权重,主打智能体编程与网络防御

智谱宣布开源 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查。


推荐理由:许可条款把强制安全审查限定在百亿美元级外部模型服务,自有部署和中小团队实际不受影响,开源可用性比表面限制更宽。