Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,857条收录
652条精选

精选归档 · 第 14 页

261280 条 · 共 652

6月17日6月17日周三

星期三 · 6 条
23:43
Hugging Face:Blog(RSS)精选
AI 评分 69/100
MolmoMotion:语言引导的3D运动预测模型

MolmoMotion基于Molmo 2骨干网络,输入视频帧、物体上的3D点标记及文字动作指令(如“移动并旋转桌上放水果的木碗”),预测未来数秒内这些点的3D轨迹。提供两个变体:自回归的MolmoMotion-AR逐步预测坐标,流匹配的MolmoMotion-FM通过连续空间变换处理多可能性运动。同时发布MolmoMotion-1M数据集(含116万视频的3D点轨迹及动作描述)和PointMotionBench基准测试(2700个人工验证视频片段)。模型权重、数据集和基准测试均已开源。


推荐理由:MolmoMotion把3D运动预测从模板化推到任意物体,百万级数据集和基准让研究门槛大降,做机器人和视频生成的值得认真看,但目前仍是研究阶段,离落地还有距离。
17:38
Hugging Face:Blog(RSS)精选
AI 评分 83/100
GLM-5.2:为长周期任务而生

GLM-5.2 发布,支持 1M token 上下文,采用 IndexShare 架构——每 4 个稀疏注意力层共用一个轻量索引器,将 1M 上下文下每 token FLOPs 降低 2.9 倍;MTP 层改进使推测解码接受长度提升 20%。长周期编码基准上,FrontierSWE 落后 Opus 4.8 仅 1%、领先 GPT-5.5 1%;PostTrainBench 仅次于 Opus 4.8;SWE-Marathon 落后 Opus 4.8 13% 但排名第二。标准编码测试 Terminal-Bench 2.1 获 81.0 分(GLM-5.1 为 63.5),接近 Opus 4.8 的 85.0。模型引入努力级别控制以平衡性能与延迟。MIT 开源许可,无地域限制。

另有 10 家信源报道The Decoder:AI News(RSS)智谱:研究(网页内嵌数据)Simon Willison 博客Hacker News 热门(buzzing.cc 中文翻译)X:Testing Catalog (@testingcatalog)公众号:智谱(GLM)X:Kim (@kimmonismus)X:智谱 Z.ai (@Zai_org)IT之家(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)
推荐理由:GLM-5.2 是第一个在长程编码基准上直逼 Opus 4.8 的开源模型,MIT 许可无地域限制,开源生态终于有了能打硬仗的长上下文工具。
16:05
MarkTechPost(RSS)精选
AI 评分 70/100
MiniMax 发布 MSA 稀疏注意力方法,开源推理内核并推出 MiniMax-M3 模型

MiniMax 发布 MSA(MiniMax Sparse Attention),一种构建在 Grouped Query Attention 上的稀疏注意力方法。它将注意力分解为索引分支与主分支:索引分支以块粒度(默认 128 token)为每个 GQA 组选择 16 个 token 块(固定预算 2048 个键值 token),主分支仅在这些块上执行精确 softmax 注意力。MSA 在 109B 参数 MoE 模型上训练,开源了面向 NVIDIA SM100 GPU 的推理内核 fmha_sm100(MIT 许可,支持 BF16/FP8/NVFP4/FP4),并发布生产模型 MiniMax-M3。MSA-PT 在 MMLU、GSM8K、HumanEval、RULER-8K、RULER-32K 上分别达 67.2、77.7、64.0、84.2、77.5,与全注意力基线持平。128K 上下文下,其 exp-free Top-k 选择比 torch.topk 快 5.1 倍。


推荐理由:MiniMax 把长上下文注意力从 O(N) 压到固定每查询 2048 token,还同时开源高效内核与生产模型,对做长上下文 agent 的团队是即时可用的方法,遗憾是只限 SM100 GPU。
15:36
jietang@jietang精选
AI 评分 72/100
GLM-5.2 开源登顶全球评测,与 Opus 4.8 持平(Claude、GPT、GLM) GLM-5.2 Tops Artificial Analysis as the #1 Open-Source Model, Ranking Top 3 Globally GLM-5.2 launched and went open-source today, delivering a solid scorecard across multiple authoritative third-party benchmarks and arenas. 📊 Artificial Analysis Intelligence Index A comprehensive evaluation that integrates several authoritative leaderboards spanning coding, reasoning, long context, and more. GLM-5.2 scored 51, ranking among the top of all available models—on par with Claude Opus 4.8—and claiming the #1 spot among open-source models worldwide.🎨 Code Arena A real-world head-to-head arena focused on front-end code generation, with Elo rankings produced by blind user voting. GLM-5.2 ranked #2 globally with a score of 1,595. 🏆 DesignArena A category arena centered on scenarios that combine design and code. GLM-5.2 took the top spot with a score of 1,360.⚙️ FrontierSWE A software-engineering benchmark built around the "frontier of human capability," assessing engineering ability across three dimensions: implementation, performance, and research. GLM-5.2 ranked #3 overall. 💪 From front-end development and design-to-code to engineering-grade software tasks, GLM-5.2 consistently lands in the top tier across multiple real-world evaluation scenarios, steadily closing in on the world's strongest models. We'll keep pushing forward in pursuit of an ever-higher ceiling of intelligence.智谱今日开源 GLM-5.2,在 Artificial Analysis 综合评测中以 51 分排名全球前三、开源模型第一,与 Claude Opus 4.8 持平。该模型在 Code Arena 前端代码生成中获 1,595 分排名第二,在 DesignArena 设计编码场景中以 1,360 分夺冠,并在软件工程基准 FrontierSWE 中位列第三。
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Nathan Lambert:Interconnects(RSS)
推荐理由:智谱GLM-5.2在多个硬核基准上压过所有开源模型,直接跟Claude Opus对标,做模型选型的得重新看看国产开源了。
12:05
xAI:News(网页)精选
AI 评分 73/100
xAI 发布 Grok Imagine Video 1.5

xAI 将 Grok Imagine Video 1.5 从预览转为全面可用,在 Imagine API 上提供 grok-imagine-video-1.5,并在 grok.com/imagine 及 iOS/Android 应用上推出 Video 1.5 Fast 版。相比前代,模型在音频与语音(更清晰、嘴型同步更好)、运动与物理(更连贯、重量感更真实)、生成速度(6 秒 720p 视频约 25 秒,此前超 40 秒)上全面提升。同时逐步推出 Projects、Multiple agents(并行运行多个生成任务)、Search 等新功能,以优化创作流程。

另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)
推荐理由:Grok Imagine 1.5 把视频生成速度砍半,音效同步和项目功能让创作者工作流更顺畅,xAI 在视频方向上站住了脚。
07:12
jietang@jietang精选
AI 评分 77/100
智谱发布旗舰模型 GLM-5.2,实现稳定 1M token 长程任务能力We're introducing GLM-5.2, our latest flagship model for long-horizon tasks. It marks a substantial leap in long-horizon task capability over its predecessor GLM-5.1 and, for the first time, delivers that capability on a solid 1M-token context. GLM-5.2's new capabilities include:Solid 1M Context: A solid 1M-token context that stably sustains long-horizon work Advanced Coding with Flexible Effort: Stronger coding capabilities with multiple thinking effort levels to balance performance and latency Improved Architecture: We propose IndexShare, which reuses the same indexer across every four sparse attention layers, reducing per-token FLOPs by 2.9× at a 1M context length. We also improve GLM-5.2’s MTP layer for speculative decoding, increasing the acceptance length by up to 20% Pure Open: An MIT open-source license — no regional limits, technical access without borders Supporting long-horizon tasks starts with making long context engineering-usable: the model must maintain quality across long, messy coding-agent trajectories, not just accept more tokens. A 1M context is easy to claim, but much harder to keep reliable under real engineering pressure. To this end, we substantially expanded 1M-context training for coding-agent scenarios, covering large-scale implementation, automated research, performance optimization, and complex debugging. The result is a long-context system that is not only wide in scope, but solid in execution: a practical substrate for sustained engineering work.This capability is reflected in GLM-5.2's performance on three long-horizon coding benchmarks. FrontierSWE measures whether an agent can complete open-ended technical projects at the scale of hours to tens of hours, spanning systems optimization, large-scale code construction, and applied ML research. On this benchmark, GLM-5.2 trails Opus 4.8 by only 1%, while edging out GPT-5.5 by 1% and Opus 4.7 by 11%. On PostTrainBench, where each agent is given an H100 GPU and evaluated by how much it can improve small models through post-training, GLM-5.2 outperforms both Opus 4.7 and GPT-5.5, ranking second only to Opus 4.8. On SWE-Marathon, an ultra-long-horizon software engineering benchmark covering tasks such as building compilers, optimizing kernels, and developing production-grade services, GLM-5.2 still has room to grow, trailing Opus 4.8 by 13% while remaining second only to the Opus series. Across all three benchmarks, GLM-5.2 is the highest-ranked open-source model, showing that its 1M context has translated into practical long-horizon delivery capability.智谱发布 GLM-5.2,首次在 1M token 上下文中实现稳定长程任务能力。其 IndexShare 架构将每四个稀疏注意力层共享同一索引器,使 1M 上下文下每 token FLOPs 降低 2.9 倍。模型采用 MIT 开源协议,无区域限制。
另有 1 家信源报道X:唐杰(@jietang)
推荐理由:GLM-5.2 把开源长上下文模型的实用性推到了新高度,MIT 许可无限制,对做 coding agent 的团队是真正可用的基础设施。

6月16日6月16日周二

星期二 · 10 条
15:05
🚨 AI News | TestingCatalog@testingcatalog精选
AI 评分 75/100
Cartesia 发布 Sonic 3.5 与 Ink 2 实时语音模型Cartesia shipped Sonic 3.5 and Ink 2, two models built to run as a single real-time voice stack, with transcription on one side and speech on the other.Ink 2 ranks first for accuracy on Artificial Analysis's streaming speech-to-text board.Sonic 3.5 places at the top of the real-time text-to-speech view at around 82ms to first audio.Cartesia 推出 Sonic 3.5 和 Ink 2 两个模型,作为单一实时语音栈,分别负责文本转语音和语音转文本。Ink 2 在 Artificial Analysis 的流式语音转文字排行榜上排名第一。Sonic 3.5 在实时文本转语音中位列榜首,首音频延迟约 82ms。Cartesia 成为目前唯一同时拥有 #1 听与说模型的提供商。

Karan Goel: 我们发布了 Sonic-3.5 和 Ink-2,这是目前可用于语音智能体的、在文本转语音和语音转文本领域排名第一的流式模型。 全新的架构为速度与质量开辟了新的前沿。 我们现在是唯一一家在"说"和"听"两方面都拥有排名第一模型的供应商。


推荐理由:Cartesia 同时发布实时语音合成和识别两个模型的迭代版,双双登顶第三方基准,80ms 首音频延迟让语音代理的交互感接近真人,做实时语音应用的开发者可以重点看一下。
14:14
公众号:通义实验室(千问)精选
AI 评分 75/100
Qwen-Robot 发布:通义实验室用三模型打通大模型到物理世界

通义实验室发布 Qwen-Robot 套件,以 Qwen-RobotNav、Qwen-RobotManip、Qwen-RobotWorld 三个模型分别覆盖导航、操作与世界预测,统一采用语言优先接口。


推荐理由:将视觉语言模型与物理行动对齐,统一跨本体表示和数据协同,为具身智能规模化提供了一种可行路径。
12:39
Qwen:Blog Retrieval(API)精选
AI 评分 72/100
Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力

Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道(1,933 小时第一人称视频转 24,808 小时数据)及上下文策略适配。

另有 4 家信源报道Hacker News 热门(buzzing.cc 中文翻译)公众号:通义实验室(千问)MarkTechPost(RSS)X:通义千问 / Qwen (@Alibaba_Qwen)
推荐理由:Qwen 这次发布的机器人模型,用统一对齐框架把跨实体数据规模化训练跑通了,OOD 泛化大幅领先,做具身智能的值得认真看一下。
12:39
Qwen:Blog Retrieval(API)精选
AI 评分 72/100
Qwen-RobotWorld:具身智能体的无界世界

Qwen-RobotWorld以语言为统一动作接口,采用双流Multimodal Diffusion Transformer(MMDiT)架构,将Qwen2.5-VL作为动作编码器。在4个基准测试中取得顶尖成绩,统一20余种机器人形态,基于860万跨场景训练对和1300多项操作技能。语言接口标准化500多种动作类别,支持操作、自动驾驶、室内导航的联合训练。还支持Scene2Robot人类到机器人转移及2–4路多视角几何一致视频生成。

另有 4 家信源报道Hacker News 热门(buzzing.cc 中文翻译)公众号:通义实验室(千问)MarkTechPost(RSS)X:通义千问 / Qwen (@Alibaba_Qwen)
推荐理由:具身智能的世界模型长期受限于单一形态,Qwen-RobotWorld用语言统一动作接口,把操作、驾驶、导航合训,多视角几何一致性和人类演示迁移是过去一年最扎实的落地信号,做机器人的别错过。
12:39
Qwen:Blog Retrieval(API)精选
AI 评分 73/100
Qwen-Robot Suite:面向物理世界智能的基础模型套件

Qwen 发布三款基础模型——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld。Nav 通过可控观测协议统一指令跟随、点/物体目标导航、目标追踪和自动驾驶五类任务,在 VLN-CE RxR 上达 76.5% SR,HM3Dv2 物体目标导航(仅 RGB)75.6% SR,EVT-Bench 追踪率 90.0%,NAVSIM 91.4 PDMS。Manip 利用规范状态-动作空间对超 38,100 小时异构开源机器人数据进行跨本体训练。World 通过自然语言动作接口协同训练 20 余种本体,预测操控、驾驶和导航的物理未来。三者共同将通用智能转化为物理行动。

另有 5 家信源报道Hacker News 热门(buzzing.cc 中文翻译)公众号:通义实验室(千问)MarkTechPost(RSS)X:通义千问 / Qwen (@Alibaba_Qwen)Qwen:Blog Retrieval(API)
推荐理由:Qwen把导航、操作和世界模型打包成机器人基础套件,用统一语言接口串起来,这是具身智能从单点突破走向系统化的信号,虽然离真实世界还有距离,但方向很清晰。
10:40
公众号:蚂蚁百灵(Ling)精选
AI 评分 79/100
蚂蚁百灵发布 Ling & Ring 2.6 技术报告

蚂蚁百灵发布 Ling & Ring 2.6 技术报告,系统公开 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 的架构、预训练、后训练及 Agent 强化学习细节。三款模型采用 Hybrid Linear Attention 架构,将 Lightning Attention 与 MLA 以 7:1 比例结合。Ling-2.6-flash 在 4×H20 硬件上解码速度达 340 tokens/s,Ling-2.6-1T 在 Artificial Analysis Intelligence Index 上 token efficiency 较前代提升约 4 倍。Ring-2.6-1T high 在 PinchBench 得 87.60,ClawEval 得 63.82。三款模型均已开源。

另有 1 家信源报道X:蚂蚁百灵 (@AntLingAGI)
推荐理由:蚂蚁百灵2.6技术报告首次公开Hybrid Linear Attention与KPop Agent RL细节,开源模型在OpenClaw登顶,把万亿模型从聊天拉到真实工作流,做Agent应用的值得细读。
10:24
公众号:蚂蚁百灵(Ling)精选
AI 评分 77/100
蚂蚁百灵发布 Ling & Ring 2.6 技术报告

蚂蚁百灵发布 Ling & Ring 2.6 技术报告,公开 2.6 系列在架构、预训练、后训练及 Agent 强化学习等细节。该系列采用 Lightning Attention 与 MLA 以 7:1 比例结合的混合线性注意力架构,预训练处理约 9.6T tokens,上下文扩展至 256K。


推荐理由:报告系统公开了万亿参数模型在架构迁移、Agent RL和推理基础设施上的完整技术链路,为设计高性能Agent系统提供了可复现的工程方案。
10:00
IT之家(RSS)精选
AI 评分 70/100
成本砍半,字节跳动推出 Seedance 2.0 Mini 视频生成模型

字节跳动火山引擎旗下火山方舟体验中心于 6 月 15 日上线 Seedance 2.0 Mini 视频生成模型,计划近期开放 API。该模型比 Seedance 2.0 Fast 快 2 倍,输出质量相当。图生视频定价 0.023 元/千 tokens,视频生视频 0.014 元/千 tokens,720P 规格下单秒生成成本约 0.5 元,较 Seedance 2.0 标准版降低约一半。模型面向电商内容生产、营销素材批量生成、UGC 创作及特效玩法等高频率、大规模视频生成场景。


推荐理由:Seedance 2.0 Mini 把视频生成成本压到 0.5 元/秒,比标准版便宜一半,对做大批量电商素材和 UGC 的团队是个实际信号,值得等 API 开放后看实测。
01:25
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 67/100
下一代投机解码:DFlash 与 Spec V2

Z Lab、Modal 与 SGLang 团队联合发布 DFlash 投机解码模型和 SGLang 的默认 Spec V2 引擎。DFlash 采用块扩散+KV 注入并行生成整块 draft token,在 Qwen 3.5 397B-A17B(BF16)的 HumanEval 数据集上、并发 1 时吞吐量达到基线的 4.3


推荐理由:DFlash 用并行起草和 KV 注入实现了实测 4.3 倍吞吐,再加上 SGLang Spec V2 引擎优化,推理加速不再是纸上谈兵。做 LLM 部署和推理服务的人,可以直接用这个组合试试。

6月15日6月15日周一

星期一 · 3 条
23:01
公众号:MiniMax(稀宇科技)精选
AI 评分 76/100
MiniMax 开源 M3 模型权重及 MSA 技术论文

MiniMax 上周五开源了 428B 总参数、23B 激活参数的 M3 模型权重,同步发布 MSA(MiniMax Sparse Attention)技术论文,该架构显著降低长上下文计算成本。M3 是首个从预训练阶段就进行文本、图像等多模态交错混合训练的开源模型。发布两周后,M3 在 Artificial Analysis 综合智能指数、GDPval-AA 排行榜均获开源模型第一,Code Arena WebDev 跻身帕累托最优序列,Vals.AI 榜单居国产模型首位。输出速度已从约 30 TPS 提升至约 80 TPS,计划再提速 30–40%;Token Plan 后台新增调用量看板。

另有 1 家信源报道X:MiniMax (@MiniMax_AI)
推荐理由:M3 是第一个从预训练阶段就深度融合多模态的开源模型,MSA 架构让长上下文成本大幅降低,它的开源会给做多模态应用的团队一个高性价比的选择,国产开源又多了一个能打的基座。
18:26
公众号:月之暗面(Kimi)精选
AI 评分 62/100
Kimi K2.7 Code 高速版上线:输出速度约 5-6 倍,API 定价为普通版 2 倍

Kimi K2.7 Code 高速版已上线,与普通版为同一模型,输出速度约 5-6 倍,常规编程场景下约 180 Token/s,短上下文可达 260 Token/s,API 定价为普通版的 2 倍。


推荐理由:代码生成延迟是编程模型体验的关键短板,180 token/s 的高输出速度使长上下文任务中的等待感显著缩短,而 2 倍定价并没有让成本增速高于效率提升。
01:59
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 72/100
里约热内卢市政府 AI 模型 Rio3.5 在基准测试中击败 Qwen3.7

里约热内卢市政府开发的 AI 模型 Rio3.5,在近期基准测试中超越了 Qwen3.7。该消息源自 Hacker News 上的一篇帖子,指出 Rio3.5 在多项评测中表现优于 Qwen3.7。目前尚未公开具体的测试细节或基准名称。


推荐理由:一个市政府 IT 部门训练的模型在基准测试中击败了 Qwen3.7,这让人重新审视谁在参与前沿模型竞争。如果结果可复现,可能是今年最意外的黑马。

6月14日6月14日周日

星期日 · 1 条
07:48
🚨 AI News | TestingCatalog@testingcatalog精选
AI 评分 78/100
智谱GLM-5.2开源发布,支持1M上下文ICYMI 👀: Z AI released GLM-5.2 for all users on GLM Coding Plans.As our new flagship model, GLM-5.2 delivers powerful coding capabilities, usable 1M-context support, and continued strengths in long-horizon tasks.Open-source and API support are planned for next week.智谱发布最强开源模型GLM-5.2,面向所有GLM Coding Plan用户(Lite/Pro/Max)开放。该模型支持真正可用的100万上下文窗口,在长程任务独立完成方面保持领先,适合构建复杂AI智能体应用,也是国产最强编码模型的核心引擎。面对外部封锁限制,智谱强调科学全球性、AGI不应被高墙垄断,采取激进开源态度。GLM-5.2的开源与API预计下周同步上线。

jietang: GLM-5.2 is Fully Open, Frontier Intelligence Belongs to Everyone Today, the sudden restriction of certain frontier model...

另有 10 家信源报道The Decoder:AI News(RSS)智谱:研究(网页内嵌数据)Simon Willison 博客Hacker News 热门(buzzing.cc 中文翻译)X:Testing Catalog (@testingcatalog)公众号:智谱(GLM)X:Kim (@kimmonismus)X:智谱 Z.ai (@Zai_org)IT之家(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)
推荐理由:智谱发布 GLM-5.2,把 1M 上下文和强编码能力装进开源模型,在当前地缘限制下这种激进开放是难得的立场,做 agent 的值得上手一试。