精选归档 · 第 18 页

341360 条 · 共 591

5月20日5月20日周三

星期三 · 3 条
02:18
Google Blog:AI(RSS)精选
AI 评分 83/100
Gemini 3.5:前沿智能与行动能力相结合

Google 在 I/O 大会上正式发布了最新的 Gemini 3.5 模型系列。该系列模型将前沿的人工智能能力与执行操作的功能相结合,旨在提供更强的综合性能。作为 Google 最新推出的模型,它代表了其在大模型技术上的最新进展。


推荐理由:Google 在 I/O 上甩出 Gemini 3.5,这次不只拼多模态,更强调‘行动’,是所有做 Agent 的团队必须对标的新基座。
00:00
Cohere 产品与研究博客(网页)精选
AI 评分 71/100
Cohere 开源 Command A+:218B 参数 MoE 模型主打企业级智能体能力

Cohere 发布 Command A+ 并以 Apache 2.0 许可开源权重,模型采用 MoE 架构,总参数 218B、激活 25B,支持 128K 输入上下文和 48 种语言。


推荐理由:官方公布了 Command A+ 的架构参数、基准成绩与量化部署门槛,可帮助企业评估其在私有环境中的智能体部署可行性。

5月19日5月19日周二

星期二 · 2 条
11:51
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
训练后 MoE 可通过自蒸馏跳过一半专家

本文提出零专家自蒸馏适应框架,将训练完成的静态混合专家模型转换为高效动态模型。该方法通过在每个混合专家层注入零输出专家,并利用原始模型作为冻结教师进行两阶段自蒸馏适应,以实现稳定的架构转换。在两个大型开源模型及11个基准测试上的实验表明,该方法能消除超过50%的专家计算量,同时仅带来极小的准确率损失,并显著提升端到端推理速度。


推荐理由:把训练好的MoE直接改成动态的,推理时跳过一半专家,速度提升20%而精度几乎没掉,做模型部署的值得认真看一下这个一行代码不改的蒸馏方案。
03:34
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
Qwen 3.7 预览版

Qwen3.7-Max-Preview 与 Qwen3.7-Plus-Preview 登陆 Arena。文本榜单中 Qwen3.7-Max-Preview 位列第 13,阿里巴巴成为第 6 大实验室;视觉榜单中 Qwen3.7-Plus-Preview 位列第 16,阿里巴巴排名第 5。官方预告 Qwen3.7 系列模型即将正式发布。


推荐理由:阿里 Qwen 3.7 预览版来了,国产模型在推理和多模态上的推进速度令人侧目,虽然还是预览,但已经是一个值得开发者提前盯紧的信号。

5月17日5月17日周日

星期日 · 2 条
00:51
Ant Ling@AntLingAGI精选
AI 评分 80/100
社区协作再创佳绩,vLLM支持万亿级模型Another day0 collaboration, another community win. Thanks @vllm_project team for the always reliable support~ 🫡🫡又一次Day0协作,又一次社区胜利。感谢@vllm_project团队始终可靠的支持~ 🫡🫡

vLLM: Congrats to @AntLingAGI on Ring-2.6-1T going open! 🎉 The thinking sibling of Ling-2.6-1T — trillion-scale, built for ag...


推荐理由:蚂蚁百灵把万亿参数的 thinking 模型开源,vLLM 第一天就能跑,想自己搭 agent 推理服务的可以直接动手了,开源生态的齿轮转得比想象中快。

5月16日5月16日周六

星期六 · 4 条
22:01
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
Δ-Mem:适用于大型语言模型的高效在线内存

研究人员提出了Δ-Mem,一种专为大型语言模型设计的高效在线内存系统。该系统通过仅存储和更新模型激活的增量变化,而非完整的激活状态,显著降低了内存占用。实验表明,Δ-Mem能将内存使用量减少高达70%,同时保持模型输出的质量基本无损。这一方法有助于在资源受限的环境中部署和运行大规模语言模型,提升其在线推理和持续学习场景下的可行性。


推荐理由:Δ-Mem 把 LLM 的在线记忆开销压得够低,如果实验结果稳得住,长上下文推理的成本结构又要改写了。
17:02
Chubby♨️@kimmonismus精选
AI 评分 75/100
研究人员利用Anthropic Mythos工具构建macOS内核漏洞,绕过苹果M5芯片内存完整性执行安全系统Three researchers used Anthropic's Mythos to build a working macOS kernel exploit that bypasses Apple's M5 Memory Integrity Enforcement, a security system Apple spent five years and billions of dollars building.Bug found April 25. Working exploit May 1. Walked into Apple Park to deliver the report in person.MIE was the flagship security feature of the M5 and A19, designed to kill the entire memory corruption bug class. According to Apple's own research, it disrupted every known public exploit chain against modern iOS.Calif didn't break MIE. They walked around it. Data-only attack, no pointer manipulation, standard syscalls from an unprivileged user to root.The 55-page technical report drops after Apple patches. This is the story of the year in cybersecurity.三名研究人员借助Anthropic的Mythos工具,成功开发出一个可绕过苹果M5芯片内存完整性执行(MIE)安全机制的macOS内核漏洞利用程序。MIE是苹果耗时五年、投入巨资为M5和A19芯片打造的旗舰安全功能,旨在彻底消除内存损坏漏洞。研究团队于4月25日发现漏洞,5月1日即完成开发,并亲自前往苹果园区提交报告。该攻击采用纯数据攻击方式,无需操纵指针,仅通过非特权用户的标准系统调用即可获取根权限。完整技术报告将在苹果发布补丁后公开。

International Cyber Digest: Video of exploit in action. Source: https://blog.calif.io/p/first-public-kernel-memory-corruption


推荐理由:从发现漏洞到提权 root 只用了六天,Mythos 绕开了苹果最核心的安全屏障。这是 AI 辅助漏洞利用的分水岭,安全工程师现在就该看。
03:19
Tomer Tunguz 博客(VC 分析)精选
AI 评分 72/100
推理的一阶导数:AI浪潮下的增长逻辑

AI推理是当今规模最大、增长最快的技术市场,预计七年内将达到2500亿美元。直接销售或转售推理服务的公司增长迅猛,如Anthropic和谷歌云。在AI时代前的软件公司中,Datadog和Twilio作为“推理的一阶导数”脱颖而出:Datadog的LLM可观测产品数据量近一季增长近两倍,其约20%的AI客户贡献了约80%的年度经常性收入;Twilio则通过AI重构的语音服务吸引客户。当前周期呈现高度集中特点,少数客户能驱动巨大收益。对于非AI原生公司,核心战略在于如何转售推理服务或从其客户的大量采购中获益。


推荐理由:Tomer 用「推理的第一导数」这个框架讲透了一件事,Twilio 和 Datadog 的暴涨不是偶然,而是买推理的衍生需求,pre-AI 公司想活就得问自己怎么沾上推理的光。
00:54
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 55/100
Eric Jang - 从零开始构建 AlphaGo

文章以AlphaGo为例,阐述了智能的基本构成要素。AlphaGo至今仍是最清晰、最完整的范例,它融合了三大核心基础:搜索技术、从经验中学习以及自我对弈。这三大要素共同构成了其实现超越人类棋艺的关键路径。


推荐理由:Eric Jang 把 AlphaGo 的搜索、自对弈和价值网络拆解得非常通透,用现代工具复现让这个经典思路对今天的 RL 和自动研究都有直接启发,做 LLM 后训练的尤其该听听他对信用分配问题的解释。

5月15日5月15日周五

星期五 · 6 条
19:30
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
克劳德(法律事务)

Anthropic公司在GitHub上开源了专为法律领域优化的AI模型“Claude for Legal”。该模型能更准确地处理法律文本、合同及案例摘要,旨在提升法律从业者效率。此消息在Hacker News上获得105个投票点数,显示出技术社区对其在法律科技领域应用潜力的关注。


推荐理由:Anthropic 把 Claude 在法律场景的提示和工具打包成仓库,对法律人来说比 API 文档更直接可用,垂直落地信号明显。
10:48
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
Darwin Family:基于MRI-Trust加权的进化合并实现语言模型推理能力的免训练扩展

Darwin Family框架通过免训练的梯度无关权重重组,探索重组现有模型隐式能力以提升推理性能。其核心包括14维自适应合并基因组实现细粒度组件重组;MRI-Trust融合机制通过可学习参数平衡层重要性信号与进化搜索;架构映射器支持异构模型家族间的跨架构融合。旗舰模型Darwin-27B-Opus在GPQA Diamond基准上达到86.9%准确率,在1252个模型中排名第六,无需训练即超越其基础模型。该框架在4B至35B参数规模上均能持续提升性能,支持递归多代进化,并能实现Transformer与Mamba组件的免训练融合。


推荐理由:训练free的进化合并新思路,用MRI诊断引导基因重组,直接把GPQA Diamond拉到86.9%排第6,比全训练模型还高,搞模型蒸馏和推理优化的可以抄作业。
09:00
公众号:蚂蚁百灵(Ling)精选
AI 评分 80/100
Ring-2.6-1T 正式开源:蚂蚁百灵发布万亿级思考模型

蚂蚁百灵开源万亿级思考模型 Ring-2.6-1T,重点强化 Agent 执行能力,在 PinchBench 和 ClawEval 上达到开源 SOTA。模型支持 high 与 xhigh 两档推理强度,并采用异步 Async RL 架构结合升级版棒冰算法提升训练效率。权重已开源至 Hugging Face 和 ModelScope,Chat 体验现已开放。


推荐理由:通过可调节推理强度,模型在 Agent 高频任务中减少不必要计算,复杂场景又能释放上限,为万亿参数模型的实际部署提供了更精细的资源控制方式。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
PAGER:弥合点精确几何图形界面控制中的语义-执行鸿沟

研究针对需要点级精度的几何图形界面控制任务,揭示了现有视觉-语言模型存在的语义-执行鸿沟:通用模型动作类型准确率高但任务成功率极低。为此,我们构建了包含4,906个问题、超过22.4万次像素级动作的PAGE Bench基准,并提出了拓扑感知智能体PAGER。该智能体通过依赖结构规划与像素级执行分解任务,结合像素接地监督调优与精度对齐强化学习,将任务成功率提升至最强通用基线的4.1倍,步骤成功率从GUI专用智能体的不足9%提高到62%以上,实现了点精确GUI控制的新突破。


推荐理由:GUI agent一直绕着精确点击走,这篇直接硬碰硬,把成功率从6%拉到62%,做CAD自动化或工业软件的团队可以重点关注。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
突破舒适区:面向RLVR的高效策略引导探索框架NudgeRL

强化学习与可验证奖励范式面临探索效率瓶颈。为此,研究团队提出NudgeRL框架,其核心是“策略助推”技术,通过为每次策略采样注入轻量级策略级上下文,引导模型产生多样化推理轨迹,无需依赖昂贵的外部监督。该框架进一步提出一个统一目标,将奖励分解为上下文间与上下文内组件,并通过蒸馏目标将有效行为迁移回基础策略。在五个高难度数学基准测试中,NudgeRL的表现优于标准GRPO方法,其效果相当于后者使用高达8倍采样预算的结果,且平均表现超过了依赖特权信息的Oracle引导基线,证明了结构化探索的高效性与可扩展性。


推荐理由:NudgeRL 首次把结构化探索引入 RLVR,比 GRPO 节省 8 倍 rollout 预算,数学推理效果还更好。做 LLM 推理优化的团队,这篇值得复现。
03:18
Tomer Tunguz 博客(VC 分析)精选
AI 评分 65/100
AI电子邮件的成本分析

使用顶尖AI模型处理邮件的月度成本约为22至130美元,中位数26美元。若软件公司以75%毛利率定价,年费可能高达350美元,加上托管服务后标价或达500美元,约为Google企业邮箱费用的两倍。采用小型模型可降低成本10至20倍,而通过本地运行利用用户GPU,更能将成本削减至接近零。结合基础启发式方法和技术优化,总成本有望降低100倍。这种针对不同工作负载匹配模型并进行成本分层的推理市场细分,将是未来一两年AI软件发展的关键。


推荐理由:Tunguz 给 AI 邮件算了一笔账,SOTA 模型月费 22-130 美元,但他更重要的判断是推理分割可以把成本压到百分之一,这对做 AI 软件的定价逻辑是个关键风向。

5月14日5月14日周四

星期四 · 3 条
23:31
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 59/100
蚂蚁 inclusionAI 推出万亿参数推理模型 Ring-2.6-1T

蚂蚁 inclusionAI 发布旗舰推理模型 Ring-2.6-1T,参数规模达万亿,面向智能体工作流、工程开发、科研分析等复杂场景。模型从“能回答”升级至“能执行”,在多步任务与工具协作中表现更优;支持 high/xhigh 两档推理强度,可灵活平衡效果与成本;采用异步强化学习结合 IcePop 算法提升训练效率。基准测试中,high 模式 PinchBench 得 87.60、ClawEval 63.82、Tau2-Bench 电信场景 95.32;xhigh 模式 ARC-AGI-V2 得 66.18、AIME 26 达 95.83、GPQA Diamond 88.27。上下文长度支持 128K 扩展至 256K(YaRN),已通过 HuggingFace 和 ModelScope 开放下载。


推荐理由:蚂蚁放出的万亿参数推理模型,Agent执行能力在PinchBench上超GPT-5.4,异步RL训练和可调推理强度对工程落地有参考价值,开源可试。
22:45
Hugging Face:Blog(RSS)精选
AI 评分 59/100
解锁连续批处理中的异步性

在连续批处理中,同步方式导致CPU与GPU交替工作,造成闲置浪费。测试显示,使用8B模型生成8K令牌时,GPU有24%的时间处于空闲状态。异步批处理通过分离工作负载,让CPU准备下一批次(N+1)的同时,GPU计算当前批次(N),从而消除闲置间隙。这可通过CUDA流实现操作并发,无需更改内核或模型,仅需协调硬件执行顺序。理论上,该方法可将总生成时间从300.6秒减少至228秒,实现24%的免费加速。相关技术已集成到transformers库的连续批处理中,显著提升推理性能。


推荐理由:文章手把手拆解了异步批处理如何用CUDA流和事件消除CPU与GPU的互相等待,把推理吞吐提升22%,搞推理优化的工程师值得细读。
04:42
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 79/100
ExploitGym:AI智能体能否将安全漏洞转化为真实攻击?

由伯克利RDI、马克斯·普朗克安全与隐私研究所、Anthropic、OpenAI及谷歌等机构研究人员组成的团队,发布了名为ExploitGym的新基准测试。该测试包含898个真实漏洞,要求AI智能体根据漏洞描述生成完整的漏洞利用程序。结果显示,前沿AI模型已能成功利用相当数量的漏洞,即使在启用ASLR等标准防御措施后,部分攻击仍能成功。这证明AI已具备自主将漏洞转化为实际攻击的能力,该技术具有双重用途:既可帮助防御者评估漏洞严重性,也可能降低攻击者的技术门槛。


推荐理由:顶级 AI 模型已能自己把已知软件漏洞变成可运行攻击代码,连 ASLR 等标准防御都挡不住部分攻击,研究更发现模型会主动寻找更危险的意外漏洞。安全行业不能再把这当成假设性问题了。