Topic · 主题全部主题 →

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

4,085条收录
517条精选

精选归档 · 第 17 页

321340 条 · 共 517

5月15日5月15日周五

星期五 · 4 条
09:00
公众号:蚂蚁百灵(Ling)精选
AI 评分 80/100
Ring-2.6-1T 正式开源:蚂蚁百灵发布万亿级思考模型

蚂蚁百灵开源万亿级思考模型 Ring-2.6-1T,重点强化 Agent 执行能力,在 PinchBench 和 ClawEval 上达到开源 SOTA。模型支持 high 与 xhigh 两档推理强度,并采用异步 Async RL 架构结合升级版棒冰算法提升训练效率。权重已开源至 Hugging Face 和 ModelScope,Chat 体验现已开放。


推荐理由:通过可调节推理强度,模型在 Agent 高频任务中减少不必要计算,复杂场景又能释放上限,为万亿参数模型的实际部署提供了更精细的资源控制方式。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
PAGER:弥合点精确几何图形界面控制中的语义-执行鸿沟

研究针对需要点级精度的几何图形界面控制任务,揭示了现有视觉-语言模型存在的语义-执行鸿沟:通用模型动作类型准确率高但任务成功率极低。为此,我们构建了包含4,906个问题、超过22.4万次像素级动作的PAGE Bench基准,并提出了拓扑感知智能体PAGER。该智能体通过依赖结构规划与像素级执行分解任务,结合像素接地监督调优与精度对齐强化学习,将任务成功率提升至最强通用基线的4.1倍,步骤成功率从GUI专用智能体的不足9%提高到62%以上,实现了点精确GUI控制的新突破。


推荐理由:GUI agent一直绕着精确点击走,这篇直接硬碰硬,把成功率从6%拉到62%,做CAD自动化或工业软件的团队可以重点关注。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
突破舒适区:面向RLVR的高效策略引导探索框架NudgeRL

强化学习与可验证奖励范式面临探索效率瓶颈。为此,研究团队提出NudgeRL框架,其核心是“策略助推”技术,通过为每次策略采样注入轻量级策略级上下文,引导模型产生多样化推理轨迹,无需依赖昂贵的外部监督。该框架进一步提出一个统一目标,将奖励分解为上下文间与上下文内组件,并通过蒸馏目标将有效行为迁移回基础策略。在五个高难度数学基准测试中,NudgeRL的表现优于标准GRPO方法,其效果相当于后者使用高达8倍采样预算的结果,且平均表现超过了依赖特权信息的Oracle引导基线,证明了结构化探索的高效性与可扩展性。


推荐理由:NudgeRL 首次把结构化探索引入 RLVR,比 GRPO 节省 8 倍 rollout 预算,数学推理效果还更好。做 LLM 推理优化的团队,这篇值得复现。
03:18
Tomer Tunguz 博客(VC 分析)精选
AI 评分 65/100
AI电子邮件的成本分析

使用顶尖AI模型处理邮件的月度成本约为22至130美元,中位数26美元。若软件公司以75%毛利率定价,年费可能高达350美元,加上托管服务后标价或达500美元,约为Google企业邮箱费用的两倍。采用小型模型可降低成本10至20倍,而通过本地运行利用用户GPU,更能将成本削减至接近零。结合基础启发式方法和技术优化,总成本有望降低100倍。这种针对不同工作负载匹配模型并进行成本分层的推理市场细分,将是未来一两年AI软件发展的关键。


推荐理由:Tunguz 给 AI 邮件算了一笔账,SOTA 模型月费 22-130 美元,但他更重要的判断是推理分割可以把成本压到百分之一,这对做 AI 软件的定价逻辑是个关键风向。

5月14日5月14日周四

星期四 · 4 条
23:31
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 59/100
蚂蚁 inclusionAI 推出万亿参数推理模型 Ring-2.6-1T

蚂蚁 inclusionAI 发布旗舰推理模型 Ring-2.6-1T,参数规模达万亿,面向智能体工作流、工程开发、科研分析等复杂场景。模型从“能回答”升级至“能执行”,在多步任务与工具协作中表现更优;支持 high/xhigh 两档推理强度,可灵活平衡效果与成本;采用异步强化学习结合 IcePop 算法提升训练效率。基准测试中,high 模式 PinchBench 得 87.60、ClawEval 63.82、Tau2-Bench 电信场景 95.32;xhigh 模式 ARC-AGI-V2 得 66.18、AIME 26 达 95.83、GPQA Diamond 88.27。上下文长度支持 128K 扩展至 256K(YaRN),已通过 HuggingFace 和 ModelScope 开放下载。

另有 3 家信源报道公众号:蚂蚁百灵(Ling)X:蚂蚁百灵 (@AntLingAGI)蚂蚁 inclusionAI:HuggingFace 新模型
推荐理由:蚂蚁放出的万亿参数推理模型,Agent执行能力在PinchBench上超GPT-5.4,异步RL训练和可调推理强度对工程落地有参考价值,开源可试。
22:45
Hugging Face:Blog(RSS)精选
AI 评分 59/100
解锁连续批处理中的异步性

在连续批处理中,同步方式导致CPU与GPU交替工作,造成闲置浪费。测试显示,使用8B模型生成8K令牌时,GPU有24%的时间处于空闲状态。异步批处理通过分离工作负载,让CPU准备下一批次(N+1)的同时,GPU计算当前批次(N),从而消除闲置间隙。这可通过CUDA流实现操作并发,无需更改内核或模型,仅需协调硬件执行顺序。理论上,该方法可将总生成时间从300.6秒减少至228秒,实现24%的免费加速。相关技术已集成到transformers库的连续批处理中,显著提升推理性能。


推荐理由:文章手把手拆解了异步批处理如何用CUDA流和事件消除CPU与GPU的互相等待,把推理吞吐提升22%,搞推理优化的工程师值得细读。
04:42
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 79/100
ExploitGym:AI智能体能否将安全漏洞转化为真实攻击?

由伯克利RDI、马克斯·普朗克安全与隐私研究所、Anthropic、OpenAI及谷歌等机构研究人员组成的团队,发布了名为ExploitGym的新基准测试。该测试包含898个真实漏洞,要求AI智能体根据漏洞描述生成完整的漏洞利用程序。结果显示,前沿AI模型已能成功利用相当数量的漏洞,即使在启用ASLR等标准防御措施后,部分攻击仍能成功。这证明AI已具备自主将漏洞转化为实际攻击的能力,该技术具有双重用途:既可帮助防御者评估漏洞严重性,也可能降低攻击者的技术门槛。

另有 1 家信源报道Anthropic:Research(发表成果 · 网页)
推荐理由:顶级 AI 模型已能自己把已知软件漏洞变成可运行攻击代码,连 ASLR 等标准防御都挡不住部分攻击,研究更发现模型会主动寻找更危险的意外漏洞。安全行业不能再把这当成假设性问题了。
02:44
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
解决循环:语言和推理的吸引子模型

吸引子模型解决了循环Transformer训练不稳定、成本高和深度固定的问题。它通过主干模块生成初始输出嵌入,吸引子模块迭代优化固定点,并利用隐式微分计算梯度,使训练内存与有效深度无关,迭代次数自适应收敛。在语言建模中,相比标准Transformer,困惑度最高降低46.6%,下游任务准确率最高提升19.7%,训练成本更低;一个770M参数的模型性能优于1.3B参数Transformer。在推理任务中,仅2700万参数模型在约1000个示例下,于Sudoku-Extreme和Maze-Hard上准确率分别达91.4%和93.1%,优于Claude、GPT o3等前沿模型。模型还展现出均衡内化现象,训练后初始输出嵌入接近均衡态,推理时可移除求解器而性能几乎无损,实现了迭代优化的可扩展性。


推荐理由:这可能是要改写语言模型训练范式的架构,把迭代推理变成可学习的固定点,770M 性能超 1.3B Transformer,27M 小模型解数独秒杀 Claude、GPT o3。最反直觉的是,训练后模型能内化迭代过程,推理时直接一步到位。

5月13日5月13日周三

星期三 · 4 条
11:55
Tencent Hy@TencentHunyuan精选
AI 评分 76/100
Hy3预览版登陆GMI,开源最强模型领跑Hy3 preview is now on @gmi_cloud. 🙌Hy3 预览版现已登陆 @gmi_cloud。🙌

GMI Cloud: Hy3 preview from @TencentHunyuan is now live on GMI #1 on OpenRouter's LLM leaderboard, open-sourced, and the strongest ...


推荐理由:腾讯混元 Hy3 开源且登顶 OpenRouter 排行榜,295B MoE 架构在推理和代码上提升明显,不是小厂的刷榜产品,搞 agent 和 coding 的可以认真试试。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
通过简单统一的扩展实现奥赛金牌级推理

本文提出一种将预训练推理模型转化为严格奥赛求解器的统一方法。该方法首先采用反向困惑度课程进行监督微调,以灌输严谨的证明搜索与自我检查行为;随后通过两阶段强化学习流程扩展这些能力,最终结合测试时扩展提升性能。基于此方案训练的30B参数模型SU-01,在仅使用约34万条短轨迹微调和200步强化学习后,能稳定处理超过10万token的长轨迹难题,并在IMO、USAMO、IPhO等数学与物理奥赛中达到金牌级表现,同时展现出向数学物理之外科学领域的强推理泛化能力。


推荐理由:IMO 金牌级推理模型又多了一个,SU-01 的方法干净统一,特别在超长推理链上的稳定性是真正突破,做推理模型训练和竞赛级 AI 的可以认真读一下。
02:30

5月12日5月12日周二

星期二 · 4 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
Learning to Explore: 通过探索感知策略优化扩展智能体推理能力

研究提出了一种探索感知的强化学习框架,使LLM智能体能够在不确定性高时才进行自适应探索。该方法通过变分推理设计了细粒度奖励函数,评估探索性行动对改善未来决策的潜力,并引入探索感知分组机制,在优化过程中将探索行动与任务完成行动分离。实验表明,该方法在一系列基于文本和GUI的智能体基准测试中取得了持续的性能提升。相关代码与模型已在GitHub和HuggingFace平台开源。


推荐理由:让 Agent 拥有了「感知自己不知道什么」的能力,只在信息不足时才探索,而不是盲目试错,是 Agent 训练方法的一个重要转向,做强化学习或 Agent 的值得认真看下。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
Learning Agentic Policy from Action Guidance

针对大型语言模型的智能体强化学习提出新方法ActGuide-RL,通过引入日常人类交互产生的海量动作数据作为规划式参考指引,帮助策略克服难以抵达奖励状态的探索障碍。该方法采用最小干预原则,仅在必要时自适应启用指引以匹配任务难度,同时通过混合策略训练将探索收益内化回无指引策略。在搜索智能体基准测试中,ActGuide-RL相比零强化学习基线在GAIA和XBench上分别提升10.7和19个百分点,性能与需要大量监督微调数据的流程相当,为智能体强化学习提供了减少对繁重监督微调依赖的新范式。


推荐理由:Agent RL长期被基础策略的探索能力卡脖子,这篇论文用人类日常交互的动作数据做引导,不用重型SFT就追平现有pipeline,是训练范式层面一次务实创新。
03:18
Tomer Tunguz 博客(VC 分析)精选
AI 评分 67/100
本地模型处理半数日常任务,响应速度优于云端

一项为期五周的实验发现,在总计约1400项日常工作任务中,约50%可由本地35B参数模型(如Qwen 3.6 35B)成功处理,涵盖邮件、日程、总结和行政事务等类别。性能对比显示,本地模型在常规代理任务上的平均响应时间为2.8秒,比云端Claude Opus 4.5快2.1倍,尽管后者在复杂推理上仍领先约20%。本地模型输出更简洁,云端模型则在结构和代码规范性上更优。随着本地模型性能提升,将计算负载转向本地以应对云端成本已成为必然趋势。


推荐理由:Tunguz用数据告诉你,本地35B模型延迟只有Opus的一半且能完成半数任务,对极致追求响应速度的产品思路冲击很大,本地优先可能会从边缘变成主流。
00:35
IT之家(RSS)精选
AI 评分 72/100
菲尔兹奖得主亲测 ChatGPT 5.5 Pro:17 分钟出论文级成果,替学生拉响红色警报

菲尔兹奖得主 Timothy Gowers 测试 ChatGPT 5.5 Pro,AI 在 17 分钟内独立解决了一个加法数论公开难题,产出了博士论文级别的成果。整个过程无需数学指导,仅通过简单提示完成。Gowers 警告,若 AI 数学能力按此速度发展,将很快对数学研究领域构成危机,尤其冲击博士生培养。他呼吁数学系紧急应对,帮助学生寻找新出路。另一位菲尔兹奖得主陶哲轩则指出,人类数学家在 AI 时代的核心价值在于“消化”和深入理解证明。


推荐理由:Gowers用GPT-5.5 Pro独立完成了够博士论文的数学成果,这不是AI辅助而是AI主导。两位菲尔兹奖得主同时拉响警报,对正在读博的你来说,这比任何论文都更有冲击力。

5月11日5月11日周一

星期一 · 4 条
09:34
IT之家(RSS)精选
AI 评分 78/100
消息称 AI 芯片企业 Cerebras IPO 获 20+ 倍超额认购,拟调升发行价近三成

AI芯片企业Cerebras的IPO获得超过20倍超额认购,有望成为2026年以来全球最大IPO。公司计划将发行股票数量从2800万股增至3000万股,发行价区间从115-125美元上调至150-160美元,以中间价计涨幅达29.17%,最高可筹资48亿美元。Cerebras的“晶圆级芯片”因集成大量高带宽SRAM缓存,特别适合AI推理的解码步骤,已获得亚马逊和OpenAI的大额订单。


推荐理由:Cerebras的晶圆级芯片在推理端有独特优势,这次IPO若以近50亿美元上限募资,意味着AI芯片竞赛又多了一个重量级玩家,对英伟达的格局是一记有趣的搅动。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
IndustryBench:探究大语言模型的工业知识边界

研究团队发布IndustryBench,这是一个基于中国国家标准(GB/T)和工业产品记录构建的2049项中文工业采购问答基准,并提供了多语言对齐版本。构建中,基于外部搜索的验证环节拒绝了70.3%的大语言模型生成问题,凸显了仅靠模型过滤的不可靠性。对多语言模型的评估发现:最佳系统得分(0-3分制)仅为2.083分,提升空间巨大;“标准与术语”是普遍能力短板;扩展推理会因引入无依据的安全关键细节而降低多数模型的安全调整分数;安全违规检查会显著改变模型排名。研究表明,工业领域的大语言模型评估需基于源文本、具备安全意识,而非依赖简单的聚合准确率。


推荐理由:工业采购场景下,LLM的准确率远不够用,而且推理模型越想越多反而越不安全,这个基准把幻觉和安全风险摆上了台面。
03:22
Chubby♨️@kimmonismus精选
AI 评分 76/100
旧版AI模型急诊诊断已超越人类医生It is unethical for a doctor not to consult an AI!A new study published in Science shows OpenAI's o1 model (not 5.5, but the over 1 year old o1!) outperformed ER physicians at diagnosing patients, identifying the correct or near-correct diagnosis 67% of the time versus 50–55% for doctors, especially in early triage when information is limited.The model also scored near-perfect on clinical reasoning in structured cases, far ahead of attending physicians.Again: a model over 1 year old, which is ages in the times of AI.This is one of the first studies testing an LLM against real, messy ER data rather than curated textbook cases. The performance gap was widest exactly where mistakes are most dangerous, early in the ER process when doctors have incomplete information and are under time pressure.And the model tested (o1) is already outdated by AI standards, meaning current models are likely even better.The study only covered short ER encounters, not longer hospitalizations with days of accumulating data. It also didn't test the model on imaging (scans, X-rays), which is central to many real diagnoses. The next step is proving these systems actually improve patient outcomes in practice, not just in controlled comparisons. But i bet the models will also outperform human doctors on such cases.一项发表于《科学》的研究显示,OpenAI一年前发布的o1模型在急诊诊断中表现优于医生。该模型在真实、混乱的急诊数据测试中,正确或接近正确诊断率达67%,而医生为50-55%,尤其在信息有限的早期分诊阶段优势最明显。研究指出,o1模型在结构化病例中的临床推理近乎完美,且该模型按AI标准已属旧版,当前模型可能更强。研究未涵盖长期住院数据及影像诊断,下一步需验证AI系统能否实际改善患者预后。

推荐理由:一年前的o1在真实急诊信息最不全、时间最紧的环节胜过急诊医生,这不是实验室刷榜,是直接冲击医疗流程。做AI落地的朋友可以拿这篇当说服医院的弹药。