🤝 Day-0 support for MiniCPM5-2B on stable vLLM. ⚡ Dense 2.6B model with 131K native context 🧠 Think / No-Think from th...
🤝 Day-0 support for MiniCPM5-2B on stable vLLM. ⚡ Dense 2.6B model with 131K native context 🧠 Think / No-Think from th...
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。
Cactus Compute 发布 Needle 2,一个 45M 参数的开源工具调用模型,以 14MB 二进制文件发布,约 28MB RAM 即可运行完整会话。
NVIDIA 扩展 Nemotron 3 模型家族,推出 300 亿参数混合专家模型 Nemotron 3.5 Lightning,面向高吞吐智能体工作负载,输出速度最高提升 4 倍,智能体任务完成速度提升 30%。同时发布开源模型路由库 NeMo Switchyard,可将任务成本降至 Opus 4.8 单独运行的近三分之一,并支持在 RTX PC、DGX 等本地设备部署。
同一事件,精选展示《NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务》MiniMax H3 is native in ComfyUI, day zero with the weights. Model highlights: → Text-to-video, prompt only → Image-to-vi...
OpenAI 正式推出 GPT-5.6 公开版本,并发布基于 GPT-5.6 和 Codex 技术的 ChatGPT Work 智能体。该智能体可自主处理数小时的复杂工作流,例如从客户研究到生成营销素材并适配多市场。它集成了 Unified Plugins Directory,支持 Google Drive、Slack、Salesforce 等第三方插件,并配备 Auto-Review 功能以防止数据泄露。桌面端所有用户即刻可用;Web 和移动端优先开放给 Pro、Enterprise、Edu 用户,Plus 和 Business 稍后跟进。ChatGPT Work 与 Codex 共享 agent 消费池,按任务复杂度和所选模型计费。
同一事件,精选展示《OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体》Today, we're launching our third-gen voice model and architecture, GPT-Live. GPT-Live is a full-duplex model with built-...
GPT-Realtime-2.1-mini is now available in the API, bringing reasoning and tool use to our Realtime mini lineup at the sa...
Introducing Claude Sonnet 5, our most agentic Sonnet yet. It makes plans, uses tools like browsers and terminals, and ru...
同一事件,精选展示《Claude Sonnet 5 发布》Google 将计算机使用(Computer use)作为内置工具集成至 Gemini 3.5 Flash,使开发者能构建跨浏览器、移动端和桌面环境的智能体。此前该功能仅作为独立模型在 Gemini 2.5 中提供,现已原生整合至主 Flash 模型。开发者可通过 Gemini API 及 Gemini Enterprise Agent Platform 调用。安全方面,模型采用针对性对抗训练降低提示注入风险,并新增两项可选企业级保护:要求用户确认敏感操作、检测到间接提示注入时自动停止。该能力在持续软件测试、跨应用知识工作等长周期企业自动化场景中表现更优。(198字)
同一事件,精选展示《Gemini 3.5 Flash 引入 computer use 功能》Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。
Introducing Sakana Fugu: A full multi-agent orchestration system accessible via a single model API. Our ‘Fugu Ultra’ mod...
The open-weight labs did not come to play this week. StepFun dropped Step 3.7 Flash. MiniMax dropped M3. Both with open ...
Today @MiniMax_AI ships M3 — the first frontier model purpose-built for computer-use agents. Natively multimodal. One mo...
同一事件,精选展示《MiniMax M3 模型上线 Cloudflare AI Gateway》MiniMax 发布 M3 模型,采用全新稀疏注意力架构 MSA,支持 1M 上下文窗口,并原生支持图片、视频输入及电脑桌面操作,是国内首个齐备这些要素的开源模型。
Excited to support Step 3.7 Flash by @StepFun_ai on ZenMux from day one. 🚀 A sparse MoE vision-language model built for...
阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ²-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode 等主流架构及 MCP/Skills 协议,支持云端与本地部署,已在 Kilo Code 等生态中完成接入验证。
5月22日,阿里千问App官方宣布,千问App、PC端及网页端接入全新一代大模型Qwen3.7-Max。用户需将千问App更新至6.9.7及以上版本,即可免费体验该模型。Qwen3.7-Max定位为全能的智能体基座,核心能力覆盖编程开发、办公流程自动化及超长周期任务执行。官方实测显示,在一项长达35小时、包含超过1000次工具调用的全自主内核优化实验中,该模型保持了连贯推理。此外,模型具备跨框架泛化能力,并即将通过阿里云百炼平台提供API调用服务。
同一事件,精选展示《阿里通义千问Qwen3.7-Max上线OpenRouter》微软研究院近日推出Fara1.5系列浏览器操作智能体,包含4B、9B和27B三种参数规模。其中最大模型Fara1.5-27B在Online-Mind2Web基准测试中达到72%的准确率,显著优于OpenAI Operator、Gemini 2.5 Computer Use等主流模型。此次发布同步推出FaraGen1.5合成数据流水线,可在受控环境中高效训练智能体,为自动化浏览器操作提供了新解决方案。
📣Meet Qwen3.7-Max — our latest flagship, made for the Agent Era. A versatile foundation for agents that actually get th...
同一事件,精选展示《阿里通义千问Qwen3.7-Max上线OpenRouter》The new Gemini Spark model will have Agent mode / Chat mode. New advanced use of tools.
研究团队发布了名为Needle的轻量级模型,它将谷歌Gemini的工具调用能力浓缩至仅2600万参数。该模型在保持核心功能的同时,体积显著缩小,旨在实现更高效的部署与应用。项目代码已在GitHub开源,并在Hacker News社区获得了超过100点的关注度。
科大讯飞正式发布星火 X2-Flash 模型并开放API。该模型采用MoE架构,总参数300亿,支持256K上下文,基于华为昇腾910B集群训练。其在智能体、代码等能力上大幅提升,在深度研究报告、Skill管理等多项任务上效果接近业界万亿参数模型,而整体token消耗不到主流大尺寸模型的三分之一。通过结合DSA与MTP技术,模型在国产芯片上的训练效率从同规模A800集群的20%提升至90%,并解决了长交互场景采样效率低的问题,为大规模强化学习训练扫清障碍。AstronClaw、Loomy等已率先接入。
Kimi发布K2.6版本,专注提升开源编程能力。新版本在代码生成与理解方面实现优化,发布后在Hacker News获得132个点赞。此次更新强化了Kimi在开发者工具领域的布局,通过改进编程辅助功能,为开源社区提供更高效的代码编写支持。
另有 4 家信源报道X:Testing Catalog (@testingcatalog)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)IT之家(RSS)LG AI Research 发布混合推理模型 EXAONE 4.0,融合通用语言能力与 EXAONE Deep 的推理能力,支持 MCP 和 Function Calling,并新增西班牙语。
Mistral AI发布了两个新的边缘计算模型Ministral 3B和Ministral 8B。两者均支持高达128k的上下文长度。Ministral 8B采用了特殊的交错滑动窗口注意力模式,以实现更快、内存效率更高的推理。这些模型在知识、常识、推理、函数调用和效率方面为10B以下类别设定了新标杆,可用于设备端翻译、离线智能助手、本地分析和机器人等场景。在多项基准测试中,它们超越了同级别的Gemma 2 2B、Llama 3.2 3B等模型。Ministral 8B的API定价为$0.1 / M tokens,Ministral 3B为$0.04 / M tokens。