精选归档 · 第 9 页

161180 条 · 共 591

7月10日7月10日周五

星期五 · 1 条
01:12
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 85/100
GPT-5.6 系列模型发布:Sol、Terra、Luna

OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。


推荐理由:GPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。

7月9日7月9日周四

星期四 · 5 条
19:58
公众号:龙猫LongCat(美团)精选
AI 评分 74/100
美团正式开源 LongCat-2.0,同步开放国产卡推理代码

美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,为真实 Agentic Coding 任务而生,并作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型。


推荐理由:LongCat-2.0 把针对国产卡的模型、芯片适配与部署优化作为完整开源栈发布,为存量算力部署万亿模型提供了可复现的协同方案。
02:50
xAI:News(网页)精选
AI 评分 85/100
xAI 发布 Grok 4.5

xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。


推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。
01:08
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 77/100
OpenAI 发布 GPT-Live 新一代全双工语音模型

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。


推荐理由:GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。
00:21
Hugging Face:Blog(RSS)精选
AI 评分 66/100
原生速度的 vLLM transformers 建模后端

Hugging Face 宣布 transformers vLLM 后端现与手写原生 vLLM 实现速度相当甚至更快。模型作者无需移植代码,即可自动利用 transformers 获得超快推理。测试使用 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B-A22B-FP8 MoE(数据+专家并行)三种配置,吞吐量均达到或超过原生。该后端通过 torch.fx 静态分析图、AST 重写代码实现动态层融合,支持张量/管道/专家并行及 torch.compile。用户仅需添加 --model-impl transformers 标志。目前不支持线性注意力模型但即将支持。


推荐理由:用 transformers 写的模型,现在不用改一行代码就能在 vLLM 里跑到手写实现的水平,模型作者最大的集成痛被抹平了。虽然主要是工程黑魔法,但生态意义不小。

7月8日7月8日周三

星期三 · 9 条
16:08
The Decoder:AI News(RSS)精选
AI 评分 74/100
OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟

OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百万输入/输出token,Anthropic的Fable 5为$10/$50。


推荐理由:被美国政府按了暂停键的 GPT-5.6 终于要公开了,基准测试小胜 Claude Mythos 5 且 token 消耗仅三分之一,价格也比 Anthropic 便宜近半,开发者可以准备预算了。
10:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。


推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。
09:10
公众号:蚂蚁百灵(Ling)精选
AI 评分 64/100
蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先

蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从“更多Token”转向“更高Token密度”策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升显著,千亿参数模型在Agent任务中超越部分更大模型;小模型flash吞吐达2.4倍,五轮对话成本下降10倍以上。


推荐理由:蚂蚁百灵副总裁周俊这次分享,把大模型效率问题从零散优化推到了架构、训练、智能体协同设计的范式层面,7+1 混合注意力方案和 Kpop 算法对做模型的人是实质参考。
09:00
公众号:蚂蚁百灵(Ling)精选
AI 评分 60/100
蚂蚁集团周俊:如何用混合线性改造提升万亿参数模型的Token密度

蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。


推荐理由:7:1 的混合注意力配比、将真实错误纳入训练以及区分工具调用与自然语言的奖励函数,为同时追求长上下文效率和智能体可靠性的工作提供了可参照的技术路线。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 88/100
Agon:基于隐式对抗评分的跨模型竞争强化学习框架

Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。


推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
长度惩罚使思维链更难被监控

长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。


推荐理由:这篇论文用实验证明,给推理链加长度惩罚不只会缩短推理,还会优先删掉暴露模型真实决策过程的线索,让外部监控更难发现模型被误导的痕迹。做AI安全和对齐的人应该认真读一下。
00:53
MarkTechPost(RSS)精选
AI 评分 70/100
Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法

Liquid AI 开源了 Antidoom,一种基于 Final Token Preference Optimization (FTPO) 的针对性修复方法,用于减少推理模型中的 doom loop(死循环)问题。该方法定位循环开始的第一个 token,训练模型选择连贯替代项,而不改变整体输出分布。在 LFM2.5-2.6B 上,硬数学和编程任务中的循环率从 10.2% 降至 1.4%;Qwen3.5-4B 上从 22.9% 降至 1%。整套流程可在数小时内完成,全部代码和数据集(LiquidAI/antidoom-mix-v1.0)已开源。


推荐理由:Antidoom 用一次训练就修复了小型推理模型常见的 doom loop,LFM2.5 和 Qwen3.5 的循环率从两位数掉到 1%,代码和数据全开源,自己训模型时可以直接加这一环。
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 67/100
Cognition 发布 SWE-1.7 模型并详解 RL 训练方法

Cognition 发布 SWE-1.7,称其以更低成本达到前沿智能水平。模型基于 Kimi K2.7 底座训练,FrontierCode 1.1 Main 通过率 42.3%,Terminal-Bench 2.1 为 81.5%,已在 Devin(Web、Desktop 和 CLI)中经 Cerebras 以 1000 TPS 提供。


推荐理由:官方既公布基准成绩也详解训练方法,读者可以了解多集群 RL 训练、熵稳定和自压缩等具体做法。

7月7日7月7日周二

星期二 · 3 条
13:17
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
LLM-as-a-Verifier:一种通用验证框架

LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。


推荐理由:把验证当作新的缩放轴,这个思路很扎实,尤其直接给 Claude Code 搭了扩展。做 agent 系统的开发者现在可以试试把评估模块换成连续概率打分,也许比离散判断有效。
11:09
Tencent Hy@TencentHunyuan精选
AI 评分 71/100
腾讯混元Hy3登陆OpenRouter,免费至7月21日Thank you @novita_labs for making Hy3 available on @OpenRouter 🎉🎉🎉腾讯混元Hy3模型已通过Novita Labs作为Day-0合作伙伴在OpenRouter上线,并开放免费使用至7月21日。Hy3采用295B MoE架构(21B active),原生支持256K上下文,提供三种可配置推理模式,在编码、推理及长上下文任务上表现强劲,专为智能体工作流和生产级AI场景优化,兼顾可靠性、效率与成本。

Novita AI: ⚡ 作为 Day-0 合作伙伴,@TencentHunyuan Hy3 现已上线 @OpenRouter。 🎉 7 月 21 日前免费使用。 Hy3 专为真实业务场景打造,具备以下能力: 🧠 295B MoE(21B 激活参数) 📚 ...


推荐理由:腾讯混元 Hy3 在 OpenRouter 免费上线,295B MoE 模型直接可用,对想试国产模型海外部署的开发者是个低门槛入口,但模型本身没有给出超越预期的亮点,更像常规渠道拓展。
01:11
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 63/100
SGLang 集成 DSpark 推测解码:置信度驱动的可变长度验证

SGLang 团队将 DSpark 推测解码算法集成到开源推理引擎中。该算法采用半自回归块起草器一次生成一组 token,并利用置信度头与顺序温度缩放(STS)为每个请求动态分配可变验证长度,从而在高负载下裁剪无效验证成本。SGLang 支持密集模型(如 Qwen3)和稀疏模型(如 DeepSeek-V4),通过全 CUDA 图处理不规则的每请求验证长度。提供三种验证模式:static(全长)、compact(生产路径)和 cap-accept(接受上限测量)。还引入了零开销调度、基于离线成本表的在线调度器、融合 Triton 核等优化。在 H200 上使用 DeepSeek-V4-Flash 的测试中,DSpark 在整个并发扫描范围内比 MTP 和非推测基线实现了更优的吞吐量-延迟权衡。


推荐理由:DSpark 这版推测解码的工程落地比论文本身更有看头——SGLang 用 ragged CUDA Graph 和动态调度把 trimm 掉的计算按字节级回收,383 tok/s 的单请求速度对部署方是即时可用的性能增益。

7月6日7月6日周一

星期一 · 2 条
15:20
公众号:腾讯混元精选
AI 评分 70/100
腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。


推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。
15:11
公众号:腾讯混元精选
AI 评分 85/100
腾讯混元正式发布 Hy3,Agent 能力与产品体验跃升

腾讯混元正式发布 Hy3,在推理、智能体、长上下文等任务上比肩参数规模 2~5 倍的旗舰模型。内部盲测中 Hy3 均分 2.67/4,优于 GLM5.1 的 2.51/4;幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。


推荐理由:Hy3 用 8 个业务线的实测数值(幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 升至 90%)说明模型从榜单到生产可用的差距具体落在哪里。