阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ²-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode 等主流架构及 MCP/Skills 协议,支持云端与本地部署,已在 Kilo Code 等生态中完成接入验证。
另有 3 家信源报道X:OpenRouter (@OpenRouter)IT之家(RSS)X:阶跃星辰 StepFun (@StepFun_ai)模型发布
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
精选归档 · 第 19 页
第 361–380 条 · 共 652 条
5月29日
xAI 的最新编码模型 Grok Build 0.1 已通过 xAI API 进入公开测试阶段。该模型专为智能体编码任务训练,支持网页开发、调试和 MCP,同时也是驱动 Grok Build CLI 的同一模型。其推理速度超过 100 tokens/秒,定价为输入 $1/m tokens,输出 $2/m tokens。除编码外,它也适用于通用智能体及工具调用场景,并可通过 OpenRouter 和 Vercel AI Gateway 获取。
另有 4 家信源报道X:Elon Musk (@elonmusk, xAI)X:阿易 AI Notes (@AYi_AInotes)X:SpaceXAI (@SpaceXAI)X:Testing Catalog (@testingcatalog)Anthropic 发布了最新的 Opus 4.8 大语言模型,并为该模型引入了一个名为“Dynamic Workflows”的新工具。该工具旨在协调由多个子代理组成的群组,以执行复杂任务。
另有 13 家信源报道X:Thariq (@trq212)X:Boris Cherny (@bcherny)X:Claude Devs (@ClaudeDevs)X:OpenRouter (@OpenRouter)Hacker News 热门(buzzing.cc 中文翻译)X:洪明 (@hongming731)The Decoder:AI News(RSS)X:Claude (@claudeai)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中均取得进步。Claude Opus 4.8 现已可用,价格与前代相同。同步推出的新功能包括:用户可控制任务投入程度、Claude Code 新增“动态工作流”特性,以及 Opus 4.8 的 2.5 倍速模式价格降低为以往的三分之一。早期测试者反馈其在智能体任务中的判断力更可靠、工具调用更高效。该模型在 Online-Mind2Web 测评中得分 84%,超越了 Opus 4.7 和 GPT-5.5。此外,其诚实度与对齐表现也得到提升,代码错误漏检率降低了约 75%。
5月28日
OpenCode x MiMo V2.5 - Free for a limited time 1M context • reasoning • text • image
另有 3 家信源报道公众号:小米 MiMoIT之家(RSS)X:小米 MiMo (@XiaomiMiMo)KREA 2 Image is now a Partner Node in ComfyUI KREA's first foundation image model — trained from scratch — with tunable ...
另有 1 家信源报道X:Krea AI (@krea_ai)5月27日
MiniMax推出M2系列大语言模型。其旗舰模型M2采用混合专家(MoE)架构,总参数229.9B,每个token仅激活9.8B参数。该系列专为智能体部署设计,基于三大组件构建:智能体驱动的数据管道、可扩展的智能体原生强化学习系统Forge,以及展示早期自我进化能力的M2.7检查点。这种设计使其在智能体编码、深度搜索、办公任务及推理基准测试中达到了前沿性能水平。
Qwen3.7 Max (20250517) debuts at #4 in Code Arena: Frontend - the top-ranked Chinese lab on the board, surpassing GLM-5....
另有 9 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)公众号:通义实验室(千问)X:通义千问 / Qwen (@Alibaba_Qwen)X:X.PIN (@thexpin)Qwen:Blog Retrieval(API)X:OpenRouter (@OpenRouter)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)5月26日
面壁智能开源其新一代端侧大语言模型MiniCPM5-1B。该模型仅1B参数,在AA-Index榜单上超越所有2B参数以下模型,相比3个月前的Qwen3.5-2B效果更优且参数量减半。经INT4量化后权重仅0.5GB,支持在手机和浏览器上运行。其Base Model版本由面壁智能自主研发的AI训练框架ForgeTrain预训练完成,现已全面开源模型权重、训练数据集与部署方案。
谷歌 DeepMind 推出 AlphaProof Nexus,结合大语言模型与 Lean 形式化验证,在 353 个开放 Erdős 问题中自主解决 9 个,其中 2 个已悬而未决 56 年。该系统还在 OEIS 的 492 个开放猜想中证明 44 个,每个问题推理成本仅数百美元。
多名开发者在 OpenAI Codex 后端日志中发现未官宣的 GPT-5.6 模型,内部代号 iris-alpha。该模型将支持 150 万 token 的上下文窗口,较当前 GPT-5.5 的 105 万 token 提升约 43%,有望于今年 6 月发布。测试显示,在输入达到 90 万 token 时仍能流畅响应。同系列还发现了 ember-alpha 与 beacon-alpha 版本。此外,GPT-5.6 在前端界面生成能力上也有所提升。基于爆料信息,Anthropic Claude、Google Gemini 及 xAI Grok 也可能瞄准同期发布新模型。
5月25日
inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-4b。该模型是一种策略自适应多模态 LLM 护栏,将安全策略作为运行时输入而非固定训练分类,支持对文本、图像、图文、多语言、查询侧和响应侧进行安全评估。SingGuard 采用动态推理流程,可先快速输出首 token 安全信号,再继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全及多语言响应安全的六大类基准测试中,SingGuard 达到平均 SOTA 性能。模型支持标准 Transformers 和 vLLM 聊天消息输入,无需手动改写提示词。
<中文摘要>SingGuard 是一个策略自适应的多模态护栏模型族,包含 Sing-Guard-4b 和 Sing-Guard-8b 两个版本。它将安全策略作为运行时输入而非固定分类,部署团队可自定义自然语言规则而无需重训练模型。支持文本、图像、图文、多语言以及查询端与响应端的安全评估,提供快速和快慢结合两种推理模式。在涵盖多模态安全、纯图像安全、文本查询/响应安全、多语言查询/响应安全六大类基准上取得平均 SOTA 表现。模型已开源至 HuggingFace 和 ModelScope。</中文摘要>
另有 1 家信源报道蚂蚁 inclusionAI:GitHub 新仓库inclusionAI 发布 SingGuard-8b,一个策略自适应(policy-adaptive)的多模态 LLM 安全护栏模型族,支持文本、图像、图文、多语言、查询侧和响应侧的安全评估。SingGuard 将活跃安全策略作为运行时输入,部署团队无需重训模型即可按默认或自定义自然语言规则进行审核。模型采用动态推理流程,先快速路由输出初步安全信号,再在需要时继续生成更精确的判断。在六大基准类别上,SingGuard 取得平均 SOTA 性能,并展现出对运行时策略的强适应性。模型支持标准 Transformers 和 vLLM 聊天格式输入。
SingGuard 是蚂蚁 inclusionAI 推出的策略自适应多模态大语言模型安全护栏模型族(版本 Sing-Guard-8b),支持纯文本、纯图像、图文混合、多语言查询与回复的安全评估。其核心设计将安全策略作为运行时输入,部署团队可基于默认分类或自定义自然语言规则评估内容,无需重新训练模型。模型内置 fast-slow 动态推理流程:首 token 路由快速输出安全信号,需深度推理时继续生成更精确的最终判断。在涵盖多模态安全、纯图像安全、文本查询与回复安全、多语言查询与回复安全的六大基准测试上取得平均 SOTA 性能,并已开源至 HuggingFace 与 ModelScope。
另有 1 家信源报道蚂蚁 inclusionAI:GitHub 新仓库inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。
inclusionAI 开源了 Sing-Guard 模型家族,版本包括 Sing-Guard-2b 和 Sing-Guard-8b。该模型将安全策略作为运行时输入,支持文本、图像、图文及多语言场景的查询侧
另有 1 家信源报道蚂蚁 inclusionAI:GitHub 新仓库