Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,856条收录
652条精选

精选归档 · 第 19 页

361380 条 · 共 652

5月29日5月29日周五

星期五 · 6 条
08:02
公众号:阶跃星辰(Step)精选
AI 评分 61/100
阶跃发布 Step 3.7 Flash,面向生产级 Agent 的高效率 Flash 模型

阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ²-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode 等主流架构及 MCP/Skills 协议,支持云端与本地部署,已在 Kilo Code 等生态中完成接入验证。

另有 3 家信源报道X:OpenRouter (@OpenRouter)IT之家(RSS)X:阶跃星辰 StepFun (@StepFun_ai)
推荐理由:Step 3.7 Flash 用激活仅 11B 的 MoE 架构把 Agent 工作流稳定性做透了,兼容主流框架还开源,对需要低延迟、高可靠性的生产环境 Agent 是真正可用的选择。
02:42
xAI:News(网页)精选
AI 评分 82/100
Grok Build 0.1 on API

xAI 的最新编码模型 Grok Build 0.1 已通过 xAI API 进入公开测试阶段。该模型专为智能体编码任务训练,支持网页开发、调试和 MCP,同时也是驱动 Grok Build CLI 的同一模型。其推理速度超过 100 tokens/秒,定价为输入 $1/m tokens,输出 $2/m tokens。除编码外,它也适用于通用智能体及工具调用场景,并可通过 OpenRouter 和 Vercel AI Gateway 获取。

另有 4 家信源报道X:Elon Musk (@elonmusk, xAI)X:阿易 AI Notes (@AYi_AInotes)X:SpaceXAI (@SpaceXAI)X:Testing Catalog (@testingcatalog)
推荐理由:xAI 把编码模型卷到了 100+ t/s 和 $2/M 输出,专攻 agentic coding,这是直接在叫板 Claude Code 和 Cursor,做开发工具的同行该重新算账了。
01:14
TechCrunch:AI(RSS)精选
AI 评分 72/100
Anthropic 发布 Opus 4.8 并推出新型"动态工作流"工具

Anthropic 发布了最新的 Opus 4.8 大语言模型,并为该模型引入了一个名为“Dynamic Workflows”的新工具。该工具旨在协调由多个子代理组成的群组,以执行复杂任务。

另有 13 家信源报道X:Thariq (@trq212)X:Boris Cherny (@bcherny)X:Claude Devs (@ClaudeDevs)X:OpenRouter (@OpenRouter)Hacker News 热门(buzzing.cc 中文翻译)X:洪明 (@hongming731)The Decoder:AI News(RSS)X:Claude (@claudeai)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:Opus 4.8 是 Anthropic 对 Opus 4.7 失望反应的快速回应,亮点不在跑分而在模型能主动标记不确定性,这比正确率更实用。动态工作流让跨子 agent 的代码迁移成为现实,开发团队值得关注。
01:05
Anthropic:Newsroom(网页)精选
AI 评分 85/100
Claude Opus 4.8 发布:在编码、智能体技能与推理方面实现全面升级

Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中均取得进步。Claude Opus 4.8 现已可用,价格与前代相同。同步推出的新功能包括:用户可控制任务投入程度、Claude Code 新增“动态工作流”特性,以及 Opus 4.8 的 2.5 倍速模式价格降低为以往的三分之一。早期测试者反馈其在智能体任务中的判断力更可靠、工具调用更高效。该模型在 Online-Mind2Web 测评中得分 84%,超越了 Opus 4.7 和 GPT-5.5。此外,其诚实度与对齐表现也得到提升,代码错误漏检率降低了约 75%。


推荐理由:Opus 4.8看着是常规升级,但动态工作流让Claude Code能啃下跨十万行代码迁移这种硬骨头,快速模式降价三倍更是直接拉低了实时场景的入场券。
00:06
SenseTime@SenseTime_AI精选
AI 评分 65/100
SenseNova信息图表生成模型升级:文本、布局与图表质量全面增强𝗛𝗼𝘄 𝗼𝘂𝗿 𝘂𝗽𝗴𝗿𝗮𝗱𝗲𝗱 𝗶𝗻𝗳𝗼𝗴𝗿𝗮𝗽𝗵𝗶𝗰 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 𝗺𝗼𝗱𝗲𝗹 — 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮-𝗨𝟭-𝟴𝗕-𝗠𝗼𝗧-𝗜𝗻𝗳𝗼𝗴𝗿𝗮𝗽𝗵𝗶𝗰 — 𝗱𝗲𝗹𝗶𝘃𝗲𝗿𝘀 𝗲𝘃𝗲𝗻 𝘀𝘁𝗿𝗼𝗻𝗴𝗲𝗿 𝗰𝗮𝗽𝗮𝗯𝗶𝗹𝗶𝘁𝗶𝗲𝘀 💪• 𝗧𝗲𝘅𝘁 𝗮𝗰𝗰𝘂𝗿𝗮𝗰𝘆 & 𝗿𝗲𝗮𝗱𝗮𝗯𝗶𝗹𝗶𝘁𝘆 enhanced — reduced repetition, avoided unnatural enlargement, and stronger support for small fonts • 𝗟𝗮𝘆𝗼𝘂𝘁 𝗰𝗼𝗻𝘀𝗶𝘀𝘁𝗲𝗻𝗰𝘆 & 𝗿𝗮𝘁𝗶𝗼𝗻𝗮𝗹𝗶𝘁𝘆 improved, with more stable backgrounds • 𝗖𝗵𝗮𝗿𝘁 & 𝗱𝗶𝗮𝗴𝗿𝗮𝗺 𝗾𝘂𝗮𝗹𝗶𝘁𝘆 elevated • 𝗔𝗰𝗮𝗱𝗲𝗺𝗶𝗰 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 supportedTry it out: 🥰 https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic 🖼 Showcases: https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1_infographic_showcases.md 👾 Discord: https://discord.gg/BuTXPHmQub@huggingface @githubSenseNova-U1-8B-MoT-Infographic 是一个升级后的8B参数信息图表生成模型。其核心提升在于:增强了文本的准确性与可读性,减少了重复和不自然的放大;改进了布局的一致性与合理性,背景更稳定;提升了图表与示意图的渲染质量;并新增了学术内容的渲染支持。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤这个8B信息图生成模型升级了,文本和布局都更稳,对常做数据图表和学术配图的人算个实用的小迭代,没有到改变游戏规则的程度。

5月28日5月28日周四

星期四 · 3 条
23:38
Xiaomi MiMo@XiaomiMiMo精选
AI 评分 69/100
MiMo-V2.5现已登陆OpenCode限时免费MiMo-V2.5 is now available in OpenCode — free for a limited time. 🎉MiMo-V2.5现已在OpenCode上线--限时免费。🎉 【引用 @opencode】:OpenCode x MiMo V2.5 - 限时免费 1M上下文 • 推理 • 文本 • 图像

OpenCode: OpenCode x MiMo V2.5 - Free for a limited time 1M context • reasoning • text • image

另有 3 家信源报道公众号:小米 MiMoIT之家(RSS)X:小米 MiMo (@XiaomiMiMo)
推荐理由:MiMo-V2.5在OpenCode免费开放,1M上下文加多模态推理,小米的模型迭代不算大新闻,但趁免费白嫖一下国产模型的机会别错过。如果你正在选型,跑个分试试。
23:36
SenseTime@SenseTime_AI精选
AI 评分 68/100
商汤发布信息图生成模型升级,增强多项核心能力𝗛𝗼𝘄 𝗼𝘂𝗿 𝘂𝗽𝗴𝗿𝗮𝗱𝗲𝗱 𝗶𝗻𝗳𝗼𝗴𝗿𝗮𝗽𝗵𝗶𝗰 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 𝗺𝗼𝗱𝗲𝗹 — 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮-𝗨𝟭-𝟴𝗕-𝗠𝗼𝗧-𝗜𝗻𝗳𝗼𝗴𝗿𝗮𝗽𝗵𝗶𝗰 — 𝗱𝗲𝗹𝗶𝘃𝗲𝗿𝘀 𝗲𝘃𝗲𝗻 𝘀𝘁𝗿𝗼𝗻𝗴𝗲𝗿 𝗰𝗮𝗽𝗮𝗯𝗶𝗹𝗶𝘁𝗶𝗲𝘀 💪• 𝗧𝗲𝘅𝘁 𝗮𝗰𝗰𝘂𝗿𝗮𝗰𝘆 & 𝗿𝗲𝗮𝗱𝗮𝗯𝗶𝗹𝗶𝘁𝘆 enhanced — reduced repetition, avoided unnatural enlargement, and stronger support for small fonts • 𝗟𝗮𝘆𝗼𝘂𝘁 𝗰𝗼𝗻𝘀𝗶𝘀𝘁𝗲𝗻𝗰𝘆 & 𝗿𝗮𝘁𝗶𝗼𝗻𝗮𝗹𝗶𝘁𝘆 improved, with more stable backgrounds • 𝗖𝗵𝗮𝗿𝘁 & 𝗱𝗶𝗮𝗴𝗿𝗮𝗺 𝗾𝘂𝗮𝗹𝗶𝘁𝘆 elevated • 𝗔𝗰𝗮𝗱𝗲𝗺𝗶𝗰 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 supportedTry it out: 🥰 https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic 🖼 Showcases: https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1_infographic_showcases.md 👾 Discord: https://discord.gg/BuTXPHmQub@huggingface @github商汤科技介绍了其升级后的信息图生成模型 SenseNova-U1-8B-MoT-Infographic。该模型参数为8B,在四个关键维度进行了优化:文本准确性与可读性增强,减少了重复和不当放大;布局的一致性与合理性提升,背景更稳定;图表与示意图的质量提高;并新增了学术内容的渲染支持。推文提供了在 Hugging Face 上的模型页面链接及能力展示页面。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:信息图生成赛道又出新货,商汤这次把文本渲染和布局稳定性真正做好了,做学术图表或运营配图的人可以直接去HuggingFace试用,效果肉眼可见的提升。
04:05
Krea@krea_ai精选
AI 评分 73/100
Krea 2图像模型现已登陆ComfyUIKrea 2 available in Comfy!Krea 2现已登陆Comfy! KREA的首个基础图像模型--从零训练--具备可调节的创造力、风格参考和情绪板条件控制。

ComfyUI: KREA 2 Image is now a Partner Node in ComfyUI KREA's first foundation image model — trained from scratch — with tunable ...

另有 1 家信源报道X:Krea AI (@krea_ai)
推荐理由:Krea 终于掏出自己的基础图像模型,不再只是包装别人模型。ComfyUI 原生节点让工作流玩家可以立刻上手折腾,自研模型的风格控制是个新鲜变量。

5月27日5月27日周三

星期三 · 2 条
11:19
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
MiniMax-M2系列:微小激活释放最大真实世界智能

MiniMax推出M2系列大语言模型。其旗舰模型M2采用混合专家(MoE)架构,总参数229.9B,每个token仅激活9.8B参数。该系列专为智能体部署设计,基于三大组件构建:智能体驱动的数据管道、可扩展的智能体原生强化学习系统Forge,以及展示早期自我进化能力的M2.7检查点。这种设计使其在智能体编码、深度搜索、办公任务及推理基准测试中达到了前沿性能水平。


推荐理由:MiniMax 把激活参数压到 9.8B 却敢喊前沿,整套 design 都是为 agent 场景重做的,搞 agent 的开发者该认真看一眼这个信号。
09:31
Qwen@Alibaba_Qwen精选
AI 评分 68/100
Qwen3.7-Max代码竞技场排名第四,与Claude Opus 4.6持平🚀🚀 Qwen3.7-Max just hit #4 on Code Arena, on par with Claude Opus 4.6 ,top-ranked Chinese lab on the board! @arenaMore to ship. Stay tuned. 🕶️🚀🚀 Qwen3.7-Max 刚刚在 Code Arena 上升至第 4 名,与 Claude Opus 4.6 持平,是榜单上排名最高的中国实验室!@arena 更多内容即将发布。敬请期待。🕶️

Arena.ai: Qwen3.7 Max (20250517) debuts at #4 in Code Arena: Frontend - the top-ranked Chinese lab on the board, surpassing GLM-5....

另有 9 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)公众号:通义实验室(千问)X:通义千问 / Qwen (@Alibaba_Qwen)X:X.PIN (@thexpin)Qwen:Blog Retrieval(API)X:OpenRouter (@OpenRouter)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)
推荐理由:Qwen3.7-Max 在 Code Arena 前端任务上排第四,跟 Claude Opus 4.6 打平,国产模型第一次在 agentic web dev 摸到第一梯队,做 Web Agent 的可以认真看看。

5月26日5月26日周二

星期二 · 3 条
14:11
IT之家(RSS)精选
AI 评分 76/100
面壁智能开源 MiniCPM5-1B:在 AA-Index 上超越所有 2B 参数以下模型,能跑在手机、浏览器上

面壁智能开源其新一代端侧大语言模型MiniCPM5-1B。该模型仅1B参数,在AA-Index榜单上超越所有2B参数以下模型,相比3个月前的Qwen3.5-2B效果更优且参数量减半。经INT4量化后权重仅0.5GB,支持在手机和浏览器上运行。其Base Model版本由面壁智能自主研发的AI训练框架ForgeTrain预训练完成,现已全面开源模型权重、训练数据集与部署方案。


推荐理由:1B参数干翻所有2B以下模型,量化后0.5GB就能塞进手机和浏览器,这个效率把端侧模型的门槛又压低了,做移动端AI的值得跟进。
13:11
IT之家(RSS)精选
AI 评分 77/100
谷歌 AI 框架 AlphaProof Nexus 攻克 2 道悬置 56 年数学难题

谷歌 DeepMind 推出 AlphaProof Nexus,结合大语言模型与 Lean 形式化验证,在 353 个开放 Erdős 问题中自主解决 9 个,其中 2 个已悬而未决 56 年。该系统还在 OEIS 的 492 个开放猜想中证明 44 个,每个问题推理成本仅数百美元。


推荐理由:AlphaProof Nexus 不是刷榜,是真解了 Erdős 难题,56 年悬而未决的那两道——这说明 AI 开始从具身数学题爬向纯数学研究了,做理论的人该认真看一眼。
07:11
IT之家(RSS)精选
AI 评分 74/100
OpenAI GPT-5.6 模型曝下月发布:AI 上下文 150 万 tokens

多名开发者在 OpenAI Codex 后端日志中发现未官宣的 GPT-5.6 模型,内部代号 iris-alpha。该模型将支持 150 万 token 的上下文窗口,较当前 GPT-5.5 的 105 万 token 提升约 43%,有望于今年 6 月发布。测试显示,在输入达到 90 万 token 时仍能流畅响应。同系列还发现了 ember-alpha 与 beacon-alpha 版本。此外,GPT-5.6 在前端界面生成能力上也有所提升。基于爆料信息,Anthropic Claude、Google Gemini 及 xAI Grok 也可能瞄准同期发布新模型。


推荐理由:开发者从后端日志扒出 GPT-5.6,150 万上下文是真香,直接生成商用级前端界面更让人眼馋,这代模型值得等。

5月25日5月25日周一

星期一 · 6 条
18:49
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 58/100
inclusionAI 发布 SingGuard 系列模型

inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-4b。该模型是一种策略自适应多模态 LLM 护栏,将安全策略作为运行时输入而非固定训练分类,支持对文本、图像、图文、多语言、查询侧和响应侧进行安全评估。SingGuard 采用动态推理流程,可先快速输出首 token 安全信号,再继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全及多语言响应安全的六大类基准测试中,SingGuard 达到平均 SOTA 性能。模型支持标准 Transformers 和 vLLM 聊天消息输入,无需手动改写提示词。


推荐理由:蚂蚁集团开源的多模态安全护栏模型,把审核策略变成了动态可配置参数,对需要灵活合规的部署团队来说比单纯调 API 更可控。普通用户看看就好,做安全的人值得试。
18:49
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 71/100
<中文标题>SingGuard: 策略自适应多模态护栏模型族开源</中文标题>

<中文摘要>SingGuard 是一个策略自适应的多模态护栏模型族,包含 Sing-Guard-4b 和 Sing-Guard-8b 两个版本。它将安全策略作为运行时输入而非固定分类,部署团队可自定义自然语言规则而无需重训练模型。支持文本、图像、图文、多语言以及查询端与响应端的安全评估,提供快速和快慢结合两种推理模式。在涵盖多模态安全、纯图像安全、文本查询/响应安全、多语言查询/响应安全六大类基准上取得平均 SOTA 表现。模型已开源至 HuggingFace 和 ModelScope。</中文摘要>

另有 1 家信源报道蚂蚁 inclusionAI:GitHub 新仓库
推荐理由:蚂蚁的 SingGuard 把安全策略变成了运行时输入,意味着审核规则可以随时改而不必重训模型,这对做内容安全的产品人是真省事,值得跟进。
18:48
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 74/100
inclusionAI 发布 SingGuard-8b 策略自适应多模态安全护栏模型族

inclusionAI 发布 SingGuard-8b,一个策略自适应(policy-adaptive)的多模态 LLM 安全护栏模型族,支持文本、图像、图文、多语言、查询侧和响应侧的安全评估。SingGuard 将活跃安全策略作为运行时输入,部署团队无需重训模型即可按默认或自定义自然语言规则进行审核。模型采用动态推理流程,先快速路由输出初步安全信号,再在需要时继续生成更精确的判断。在六大基准类别上,SingGuard 取得平均 SOTA 性能,并展现出对运行时策略的强适应性。模型支持标准 Transformers 和 vLLM 聊天格式输入。


推荐理由:蚂蚁集团开源的这个多模态安全防护模型把安全策略变成运行时参数,不用重训就能适配新规则,做内容审核的团队可以直接套用,降低定制成本。
18:48
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 69/100
蚂蚁 inclusionAI 发布策略自适应多模态安全护栏模型 Sing-Guard-8b

SingGuard 是蚂蚁 inclusionAI 推出的策略自适应多模态大语言模型安全护栏模型族(版本 Sing-Guard-8b),支持纯文本、纯图像、图文混合、多语言查询与回复的安全评估。其核心设计将安全策略作为运行时输入,部署团队可基于默认分类或自定义自然语言规则评估内容,无需重新训练模型。模型内置 fast-slow 动态推理流程:首 token 路由快速输出安全信号,需深度推理时继续生成更精确的最终判断。在涵盖多模态安全、纯图像安全、文本查询与回复安全、多语言查询与回复安全的六大基准测试上取得平均 SOTA 性能,并已开源至 HuggingFace 与 ModelScope。

另有 1 家信源报道蚂蚁 inclusionAI:GitHub 新仓库
推荐理由:蚂蚁集团开源的多模态内容审核模型,最大亮点是运行时动态注入安全策略而不需重训,对需要灵活定制审核规则的团队是低门槛的高分工程实现。
18:48
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 69/100
inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b

inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。


推荐理由:把安全策略写成自然语言就能即插即用,不用重新微调,这个思路对需要频繁调整合规规则的产品团队很实用。虽然只是个2B的小模型,但开箱即用的动态适配能力值得关注。
18:48
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 68/100
inclusionAI 发布 Sing-Guard-2b:策略自适应多模态大模型安全护栏

inclusionAI 开源了 Sing-Guard 模型家族,版本包括 Sing-Guard-2b 和 Sing-Guard-8b。该模型将安全策略作为运行时输入,支持文本、图像、图文及多语言场景的查询侧

另有 1 家信源报道蚂蚁 inclusionAI:GitHub 新仓库
推荐理由:SingGuard把安全策略变成运行时输入,不用再为新规则重新训练模型,这对需要频繁调整审核标准的团队来说是个实用的发布。