完整基准测试结果。简直疯狂。 ARC-AGI 3,从 7.8% 跃升至 98.6%
另有 2 家信源报道The Decoder:AI News(RSS)IT之家(RSS)模型发布
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
精选归档 · 第 2 页
第 21–40 条 · 共 652 条
9月4日
来自 OpenAI 官网的官方 GPT-6 Astra 基准测试 "Astra 在 ARC-AGI-3 上以 99.9% 的得分达到饱和,在 ExploitBench 上以 100% 的得分达到饱和" "GPT-6 Astra 今天开始向有...
另有 9 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:阿易 AI Notes (@AYi_AInotes)Simon Willison 博客X:小北 (@frxiaobei)X:Sherwin Wu(@sherwinwu)X:Rohan Paul (@rohanpaul_ai)X:Greg Brockman (@gdb)OpenAI 发布下一代的旗舰模型 GPT-6 Astra,称其为能力上的世代跃升,Greg Brockman 表示现在可能已进入 AGI 时代。
OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。
另有 9 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)X:阿易 AI Notes (@AYi_AInotes)Simon Willison 博客X:Greg Brockman (@gdb)X:小北 (@frxiaobei)X:Sherwin Wu(@sherwinwu)OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。
"如果我们回头审视并问:'AGI 究竟是在什么时候真正诞生的?'我认为答案会指向大约这个时期,而且很可能就是这款模型。"Greg Brockman 今天在谈及 GPT-6 Astra 时如此表示,并补充道:"就我个人而言,我确实认为我们已经...
IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。
另有 3 家信源报道X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)X:Kim (@kimmonismus)OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。
另有 9 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:阿易 AI Notes (@AYi_AInotes)Simon Willison 博客X:小北 (@frxiaobei)X:Sherwin Wu(@sherwinwu)X:Rohan Paul (@rohanpaul_ai)X:Greg Brockman (@gdb)9月3日
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。
另有 7 家信源报道TechCrunch:AI(RSS)X:DAIR.AI (@dair_ai)The Decoder:AI News(RSS)MarkTechPost(RSS)IT之家(RSS)The Verge:AI(RSS)X:Google AI (@GoogleAI)Meta 发布了 Muse Spark 1.3,这是他们在五个月内第四次发布 Muse Spark 模型。Muse Spark 1.3 (max) 目前面向 Meta 的合作伙伴提供有限预览,在 Artificial Analysis 智能...
另有 8 家信源报道X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:Testing Catalog (@testingcatalog)X:Rohan Paul (@rohanpaul_ai)MarkTechPost(RSS)IT之家(RSS)X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)Meta 发布了 Muse Spark 1.3,这是他们在五个月内第四次发布 Muse Spark 模型。Muse Spark 1.3 (max) 目前面向 Meta 合作伙伴限量预览,在 Artificial Analysis 智能指数上...
另有 8 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)MarkTechPost(RSS)IT之家(RSS)X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)9月2日
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
另有 19 家信源报道X:fofr (@fofrAI)Ars Technica:AI(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)MarkTechPost(RSS)X:Google DeepMind (@GoogleDeepMind)The Decoder:AI News(RSS)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)X:Ammaar Reshi (@ammaar)X:Gemini (@GeminiApp)X:Logan Kilpatrick (@OfficialLoganK)X:Sundar Pichai (@sundarpichai)X:Testing Catalog (@testingcatalog)X:Josh Woodward (@joshwoodward, Google Labs VP)X:Demis Hassabis (@demishassabis)X:OpenRouter (@OpenRouter)X:Rohan Paul (@rohanpaul_ai)X:Google AI (@GoogleAI)Qwen3.8-Max-0902 由 @Alibaba_Qwen 发布,刚刚在 Code Arena: WebDev 中以 1,691 分的成绩登顶总榜第一,并以混合 $5/MToken 的价格成为 Pareto 前沿上得分最高的模型! 在...
另有 5 家信源报道IT之家(RSS)X:Kim (@kimmonismus)X:通义千问 / Qwen (@Alibaba_Qwen)X:阿易 AI Notes (@AYi_AInotes)X:阿里云 / Alibaba Cloud (@alibaba_cloud)OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。
另有 5 家信源报道X:Rohan Paul (@rohanpaul_ai)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。
另有 4 家信源报道The Verge:AI(RSS)IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。
另有 11 家信源报道IT之家(RSS)X:Thariq (@trq212)Hacker News 热门(buzzing.cc 中文翻译)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:Testing Catalog (@testingcatalog)X:小北 (@frxiaobei)The Decoder:AI News(RSS)MarkTechPost(RSS)TechCrunch:AI(RSS)The Verge:AI(RSS)We’re introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world’s most advanced models for coding and knowle...
另有 13 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)The Verge:AI(RSS)X:OpenRouter (@OpenRouter)X:Kim (@kimmonismus)X:Thariq (@trq212)Hacker News 热门(buzzing.cc 中文翻译)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:小北 (@frxiaobei)The Decoder:AI News(RSS)TechCrunch:AI(RSS)9月1日
Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。
8月31日
DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。
8月29日
智谱宣布开源 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查。