Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,857条收录
652条精选

精选归档 · 第 10 页

181200 条 · 共 652

7月12日7月12日周日

星期日 · 1 条
00:55
Sam Altman@sama精选
AI 评分 68/100
OpenAI 发布 GPT-5.6 系列医疗评估结果"physicians found fewer flaws in GPT-5.6 responses than physician-written responses."OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。

Karan Singhal: ♥️ GPT-5.6 在健康领域迈出了重要一步,无论是在前沿性能还是成本方面。 这些模型推动了每美元性能的边界,将最优秀的健康智能带给所有人。最小的变体 GPT-5.6 Luna,在最低推理努力下进行评估,其表现超过了最高推理努力下的 GP...


推荐理由:GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。

7月11日7月11日周六

星期六 · 3 条
16:17
MarkTechPost(RSS)精选
AI 评分 74/100
蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。
09:10
Greg Brockman@gdb精选
AI 评分 71/100
GPT-5.6 健康智能升级,Luna 性能提升成本降 25 倍GPT-5.6 for health intelligence, the team has been focusing hard on improvements here:GPT-5.6 用于健康智能,团队一直专注于这方面的改进: 整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

OpenAI: GPT-5.6 is a major step forward for health intelligence. Across the lineup, we’re delivering stronger performance at low...


推荐理由:GPT-5.6 主打健康智能,虽然还没实测,但 25 倍的降本让高级推理不再是实验室专属,做医疗应用的可以提前评估切换成本了。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。


推荐理由:首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。

7月10日7月10日周五

星期五 · 8 条
12:01
公众号:龙猫LongCat(美团)精选
AI 评分 74/100
美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。


推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。
08:20
Google Research:Blog(网页)精选
AI 评分 70/100
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型

Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问题。


推荐理由:SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
Cognition 推出 SWE-1.7,接近 GPT 5.5 与 Opus 智能水平

Cognition 发布迄今最强模型 SWE-1.7,基于 Kimi K2.7 基座训练,通过强化学习管线改进(基础设施、训练稳定性、数据质量、长程任务技术)实现前沿智能水平并大幅降低成本。在 FrontierCode 1.1 Main 基准上达 42.3%(Kimi K2.7 Code 为 30.1%,GPT-5.5 为 43.0%,Opus 4.8 为 46.5%),Terminal-Bench 2.1 达 81.5%,SWE-Bench Multilingual 达 77.8%。模型针对长周期异步任务优化,现已在 Devin(Web、桌面、CLI)通过 Cerebras 以 1000 TPS 提供。


推荐理由:Cognition 把 RL 训练的编码模型推到了和 GPT-5.5 叫板的水平,成本还低得多,做代码 agent 的值得认真看看他们的训练稳定性、多集群等思路。
03:59
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 69/100
GPT-5.6 成为 Microsoft 365 Copilot 首选模型

OpenAI 宣布 GPT-5.6 将作为 Microsoft 365 Copilot 的首选模型,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork。该集成使用户能在日常工具中以更少提示轮次创建更高质量文档、进行更深入数据分析、生成更精美演示,并完成跨职能协作。GPT-5.6 在每个 token 上提供更实用的工作产出,性价比更强,并支持按需处理最复杂任务。微软通过 OpenAI API 直接调用该模型服务 Microsoft 365 客户。

另有 6 家信源报道公众号:卡尔的AI沃茨X:Sam Altman (@sama)公众号:数字生命卡兹克IT之家(RSS)X:Satya Nadella (@satyanadella)TechCrunch:AI(RSS)
推荐理由:GPT-5.6进入Microsoft 365 Copilot,标志着OpenAI的最强模型直接嵌入全球最广泛使用的办公套件,普通用户终于能无感体验到前沿AI,但别期望太多颠覆,只是模型升级带来的自然提升。
01:12
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体

OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。

另有 12 家信源报道公众号:卡尔的AI沃茨The Decoder:AI News(RSS)OpenAI:官网动态(RSS · 排除企业/客户案例)X:Kim (@kimmonismus)X:OpenAI (@OpenAI)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)TechCrunch:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Sam Altman (@sama)
推荐理由:ChatGPT Work 把代理能力真正派发给了普通用户,配合插件、定时任务和电脑控制,这是 ChatGPT 从问答工具迈向自主完成复杂工作的关键一步。但我更关心 GPT-5.6 的推理提升到底多大,案例里没给数字。
01:12
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 85/100
GPT-5.6 系列模型发布:Sol、Terra、Luna

OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。

另有 17 家信源报道X:Greg Brockman (@gdb)X:Jason Liu (@jxnlco)X:OpenRouter (@OpenRouter)X:OpenAI (@OpenAI)The Decoder:AI News(RSS)X:OpenAI Developers (@OpenAIDevs)OpenAI:官网动态(RSS · 排除企业/客户案例)Hacker News 热门(buzzing.cc 中文翻译)公众号:数字生命卡兹克X:Kim (@kimmonismus)X:Charlie Holtz(@charlieholtz)X:Rohan Paul (@rohanpaul_ai)TechCrunch:AI(RSS)X:Testing Catalog (@testingcatalog)X:Sam Altman (@sama)MarkTechPost(RSS)X:Noam Brown (@polynoamial)
推荐理由:GPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。

7月9日7月9日周四

星期四 · 8 条
22:30
AI at Meta@AIatMeta精选
AI 评分 65/100
Meta 发布 Muse Spark 1.1 模型Straight from @finkd — Muse Spark 1.1 is live.来自 @finkd 的消息 - Muse Spark 1.1 已上线。

Mark Zuckerberg: (1) 今天我们发布了 Muse Spark 1.1--一款价格极低但能力强大的智能体与编程模型。该模型已通过我们全新的 Meta Model API 以及 Meta AI 开放使用。

另有 6 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:Elvis Saravia (@omarsar0, DAIR.AI)The Decoder:AI News(RSS)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)Simon Willison 博客
推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。
16:57
MarkTechPost(RSS)精选
AI 评分 70/100
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍

NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。Hugging Face 提供 BF16、FP8、NVFP4 检查点。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:把120B MoE压到75B后,同节点服务吞吐几乎翻倍,单张H100百万token并发从1涨到8。对长上下文RAG和AI编码助手这类对吞吐敏感的产品来说,这不是论文调优,是实打实的降本方案。
15:16
IT之家(RSS)精选
AI 评分 73/100
蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0

蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。


推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。
15:16
IT之家(RSS)精选
AI 评分 72/100
蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video

蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。


推荐理由:蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。
08:57
MarkTechPost(RSS)精选
AI 评分 70/100
Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型

Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。


推荐理由:蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。
02:50
xAI:News(网页)精选
AI 评分 85/100
xAI 发布 Grok 4.5

xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。

另有 7 家信源报道X:Elon Musk (@elonmusk, xAI)Cursor BlogX:Michael Truell (@mntruell)MarkTechPost(RSS)IT之家(RSS)The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。
01:08
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 77/100
OpenAI 发布 GPT-Live 新一代全双工语音模型

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

另有 11 家信源报道X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)TechCrunch:AI(RSS)X:Sam Altman (@sama)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)The Verge:AI(RSS)X:Jason Liu (@jxnlco)
推荐理由:GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。