♥️ GPT-5.6 在健康领域迈出了重要一步,无论是在前沿性能还是成本方面。 这些模型推动了每美元性能的边界,将最优秀的健康智能带给所有人。最小的变体 GPT-5.6 Luna,在最低推理努力下进行评估,其表现超过了最高推理努力下的 GP...
模型发布
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
精选归档 · 第 10 页
第 181–200 条 · 共 652 条
7月12日
7月11日
蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。
另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)GPT-5.6 is a major step forward for health intelligence. Across the lineup, we’re delivering stronger performance at low...
GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。
7月10日
美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。
Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问题。
Cognition 发布迄今最强模型 SWE-1.7,基于 Kimi K2.7 基座训练,通过强化学习管线改进(基础设施、训练稳定性、数据质量、长程任务技术)实现前沿智能水平并大幅降低成本。在 FrontierCode 1.1 Main 基准上达 42.3%(Kimi K2.7 Code 为 30.1%,GPT-5.5 为 43.0%,Opus 4.8 为 46.5%),Terminal-Bench 2.1 达 81.5%,SWE-Bench Multilingual 达 77.8%。模型针对长周期异步任务优化,现已在 Devin(Web、桌面、CLI)通过 Cerebras 以 1000 TPS 提供。
OpenAI 宣布 GPT-5.6 将作为 Microsoft 365 Copilot 的首选模型,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork。该集成使用户能在日常工具中以更少提示轮次创建更高质量文档、进行更深入数据分析、生成更精美演示,并完成跨职能协作。GPT-5.6 在每个 token 上提供更实用的工作产出,性价比更强,并支持按需处理最复杂任务。微软通过 OpenAI API 直接调用该模型服务 Microsoft 365 客户。
另有 6 家信源报道公众号:卡尔的AI沃茨X:Sam Altman (@sama)公众号:数字生命卡兹克IT之家(RSS)X:Satya Nadella (@satyanadella)TechCrunch:AI(RSS)OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。
另有 12 家信源报道公众号:卡尔的AI沃茨The Decoder:AI News(RSS)OpenAI:官网动态(RSS · 排除企业/客户案例)X:Kim (@kimmonismus)X:OpenAI (@OpenAI)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)TechCrunch:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Sam Altman (@sama)OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。
另有 17 家信源报道X:Greg Brockman (@gdb)X:Jason Liu (@jxnlco)X:OpenRouter (@OpenRouter)X:OpenAI (@OpenAI)The Decoder:AI News(RSS)X:OpenAI Developers (@OpenAIDevs)OpenAI:官网动态(RSS · 排除企业/客户案例)Hacker News 热门(buzzing.cc 中文翻译)公众号:数字生命卡兹克X:Kim (@kimmonismus)X:Charlie Holtz(@charlieholtz)X:Rohan Paul (@rohanpaul_ai)TechCrunch:AI(RSS)X:Testing Catalog (@testingcatalog)X:Sam Altman (@sama)MarkTechPost(RSS)X:Noam Brown (@polynoamial)7月9日
(1) 今天我们发布了 Muse Spark 1.1--一款价格极低但能力强大的智能体与编程模型。该模型已通过我们全新的 Meta Model API 以及 Meta AI 开放使用。
另有 6 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:Elvis Saravia (@omarsar0, DAIR.AI)The Decoder:AI News(RSS)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)Simon Willison 博客NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。Hugging Face 提供 BF16、FP8、NVFP4 检查点。
另有 1 家信源报道MarkTechPost(RSS)蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。
蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。
xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。
另有 7 家信源报道X:Elon Musk (@elonmusk, xAI)Cursor BlogX:Michael Truell (@mntruell)MarkTechPost(RSS)IT之家(RSS)The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。
另有 11 家信源报道X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)TechCrunch:AI(RSS)X:Sam Altman (@sama)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)The Verge:AI(RSS)X:Jason Liu (@jxnlco)