Topic · 主题全部主题 →

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

4,085条收录
517条精选

精选归档 · 第 22 页

421440 条 · 共 517

3月5日3月5日周四

星期四 · 2 条
18:00
18:00
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
GPT-5.4 Thinking 系统卡

OpenAI 发布 GPT-5.4 Thinking 系统卡,披露新一代推理模型的架构细节、安全评估框架及能力边界。文档详述思维链优化机制、长上下文推理性能指标,明确数学推导与代码生成准确率数据,分析幻觉风险与偏见控制措施,并列出越狱攻击防护策略及企业级部署的安全限制建议。


推荐理由:OpenAI 发布 GPT-5.4 Thinking 系统卡,详述模型安全与能力评估

2月28日2月28日周六

星期六 · 1 条
08:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 80/100
拒绝"AI 味":我们用 6 个文学维度,重新审视了模型的创意写作边界

本文通过叙事工艺、语言艺术等六个文学维度,评估百灵模型Ling-2.5-1T的创意写作能力。测试显示,该模型能驾驭莎士比亚十四行诗、七言绝句等多种体裁,并通过感官描写实现“展现而非告知”的文学技法,在微观叙事和语言质感上接近人类水平。然而,模型仍存在依赖高频文学意象、处理否定指令时语义代偿等局限。该框架为创作者提供了激发AI写作潜力的具体方法。

另有 1 家信源报道蚂蚁百灵:Developer Blog(网页)
推荐理由:提供实用文学维度框架和 Prompt 技巧,助你驾驭 AI 创意写作。

2月26日2月26日周四

星期四 · 1 条
08:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 86/100
Ling 2.5 Lightning Attention+MLA 混合线性架构改造实践

为提升超长上下文下的计算效率,Ling 2.5架构将Ling 2.0的GQA改造为1:7的Lightning Attention与MLA混合线性注意力。此举旨在利用Lightning Attention提升长序列吞吐,并通过MLA极致压缩KV Cache。为确保改造后性能无损,团队设计了精细的平滑迁移训练策略,包括权重转换、QK Norm融合与Partial RoPE改造等多阶段加训。Scaling Law实验确定了1:7为最优混合比例,最终使万亿参数模型实现了更低的计算成本与更高的长文本推理效率。

另有 1 家信源报道蚂蚁百灵:Developer Blog(网页)
推荐理由:为大模型长上下文优化提供可落地的工程实践参考。

2月20日2月20日周五

星期五 · 1 条
00:06

2月13日2月13日周五

星期五 · 1 条
00:00
字节 Seed:Research Feed(网页内嵌数据)精选
"思考"更深,生成更准|Seedream 5.0 Lite 发布

字节跳动发布 Seedream 5.0 Lite 图像生成模型,采用多模态统一架构,跨模态理解与推理能力显著提升,Elo 评分超越前代 4.5 版本。模型首次引入实时检索增强能力,可联网获取最新知识,突破训练数据时间限制。内置丰富世界知识库,在信息可视化、视觉推理、复杂多主体生成等场景表现突出,能根据模糊指令精准修图,支持风格迁移与多步逻辑推理。目前已上线即梦 AI、火山方舟体验中心及豆包内测。


推荐理由:字节发布 Seedream 5.0 Lite,支持实时检索与深度推理的图像生成模型。

2月11日2月11日周三

星期三 · 3 条
18:55
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 61/100
inclusionAI 发布高性能量化推理 GEMM 内核库 Humming

inclusionAI 开源了 Humming,这是一个专为量化推理设计的高性能、轻量级即时编译 GEMM 内核库。它支持在 FP16、BF16、FP8 等多种激活数据类型下进行 8 比特以下任意权重类型的推理,兼容多种量化策略与缩放类型,并同时支持稠密 GEMM 和混合专家 GEMM 运算。该库兼容 SM75+ 及以上的所有 NVIDIA GPU,在多种计算场景下能提供业界领先的吞吐量和效率。其依赖极简,仅需 PyTorch 和 NVCC,软件包大小仅约 100 KB,便于超轻量化部署。


推荐理由:蚂蚁 inclusionAI 开源了一个 100KB 级的量化 GEMM 库,支持从 INT1 到 FP8 全家桶,SM75+ 全覆盖,做推理部署的工程师值得花半小时跑一下 benchmark,看看能不能替换掉现有的 Marlin 方案。
18:52
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 65/100
inclusionAI发布新一代即时大模型Ling-2.5-1T

inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合“正确性”与“过程冗余”的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先的开源性能。


推荐理由:蚂蚁把 1T 参数的即时模型开源了,63B 活跃参数加 1M 上下文,主打效率而非堆算力,对国内做开源推理模型的团队来说是个值得对标的基线。
18:52
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 78/100
inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T

inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。


推荐理由:蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。

2月7日2月7日周六

星期六 · 1 条
03:00
OpenAI:Alignment 研究博客(RSS)精选
AI 评分 71/100
在真实世界使用中发现未知的 AI 对齐偏差

研究表明,推理模型能够通过分析用户的实际反馈,识别并理解此前未知的 AI 行为对齐偏差。这种方法不依赖预设的偏差分类,而是从真实互动数据中主动发现模型行为与人类意图之间的潜在偏离,为动态监测和修正 AI 系统提供了新途径。


推荐理由:OpenAI 让推理模型从真实用户反馈中自动发现未知的对齐失败,这比红队测试更接近真实威胁面。做安全和对齐的人应该认真看,它可能改变你们的检测范式。

2月5日2月5日周四

星期四 · 1 条
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 72/100
Claude Opus 4.6 发布:最智能模型,专为复杂智能体任务设计

Anthropic 发布 Claude Opus 4.6,定位为最智能模型,专为复杂智能体任务和长周期工作设计。新模型推荐使用自适应思考模式(thinking: {type: "adaptive"}),弃用手动思考,且不支持预填充助手消息。


推荐理由:Opus 4.6 把长上下文和智能体推理推向实用,加上压缩 API 和数据驻留控制,这是 Anthropic 面向企业落地的完整答卷,做 agent 的开发者值得认真评估。

1月30日1月30日周五

星期五 · 1 条
15:55
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 61/100
高效离线推理框架 Flood:吞吐量显著领先,支持多模态与量化

Flood 是一款面向离线应用的高效大语言模型推理框架。它采用流水线并行降低通信开销,并通过分段式KV缓存管理提升连续性。框架支持连续批处理、分块预填充、FP8/INT8量化及多模态模型推理。性能测试表明,其在多种模型和硬件上的吞吐量最高可达 vLLM 的 2.4 倍。其专用内核 SegmentAttention 在处理长序列时,解码速度较 FlashAttention 最高提升 3.16 倍。该项目于 2025 年 3 月开源并快速迭代,已支持前瞻解码等新特性。


推荐理由:蚂蚁的 FLOOD 框架用流水线并行替代张量并行来压通信开销,实测吞吐比 vLLM 高 1.4 到 2.4 倍,做离线推理部署的团队值得花半小时跑一下 benchmark 看看自家场景能不能吃这个红利。

1月20日1月20日周二

星期二 · 1 条
11:20
Hugging Face:Blog(RSS)精选
AI 评分 83/100
差分Transformer V2

差分Transformer V2发布,其核心是改进的差分注意力机制。相较于V1,V2将查询头数量翻倍而保持键值头不变,差分操作后将维度缩减,从而在解码时能达到与标准Transformer相当的速度,且无需定制内核。新版本还解决了V1中因注意力分布均匀化导致的数值不稳定问题,特别是消除了RMSNorm层所需的巨大缩放因子(如在长序列下),从而避免了梯度爆炸,旨在实现更稳定的大规模预训练。


推荐理由:新注意力架构提升解码效率与训练稳定性,开发者可低成本集成优化模型。

1月14日1月14日周三

星期三 · 1 条
18:44
美团 LongCat:HuggingFace 新模型精选
美团LongCat发布重思考模式总结模型

美团LongCat推出基于5600亿参数MoE架构大模型LongCat-Flash-Thinking-2601的重思考模式(Heavy Thinking Mode),并发布LongCat-HeavyModel-Summary模型。该模式通过并行思考与总结两阶段协同扩展推理能力:前者以高温度并行生成多路径扩展宽度,后者将精炼轨迹递归反馈形成迭代循环延伸深度。模型经额外强化学习优化总结能力,已在Longcat AI平台上线。

另有 1 家信源报道美团 LongCat:HuggingFace 新模型
推荐理由:美团开源 560B 参数 MoE 推理模型,Heavy Thinking 模式支持并行多路径探索,已上线可体验

1月6日1月6日周二

星期二 · 1 条
06:56
Hugging Face:Blog(RSS)精选
AI 评分 80/100
NVIDIA发布Cosmos Reason 2模型,增强物理AI推理能力

NVIDIA在Hugging Face上发布了Cosmos Reason 2模型,旨在提升物理AI系统的推理能力。该模型通过改进的推理架构,使AI能更准确地理解和预测物理世界的动态与交互,核心升级包括对复杂场景的多步推理、不确定性量化及时间序列数据的深度理解。这一进展将推动机器人、自动驾驶等领域的发展,使AI在现实环境中的决策更可靠、更符合物理规律。


推荐理由:物理AI推理能力升级,机器人和具身智能落地的关键拼图

12月23日12月23日周二

星期二 · 1 条
03:57
Saining Xie@sainingxie精选
不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 【引用 @demishassabis】:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用。 显然,没有人能规避 no free lunch theorem,因此在实际且有限的系统中,总是必须围绕正在学习的目标分布有一定程度的专门化。 但关于通用性的要点在于,理论上,在 Turing Machine 的意义上,这种通用系统的架构能够在给定足够时间和内存(以及数据)的情况下学习任何可计算的东西,而人脑(和 AI foundation models)是近似 Turing Machines。 最后,关于 Yann 对国际象棋棋手的评论,人类竟然能发明国际象棋(以及现代文明的所有其他方面,从科学到 747s!),更不用说像 Magnus 这样的人能下得如此出色,这本身就令人惊叹。他可能不是严格最优的(毕竟他有有限的记忆和有限的决策时间),但考虑到我们的大脑是为狩猎采集而进化的,他以及我们能用大脑做到这些,实在令人难以置信。not getting into a philosophical debate, but this book really changed how I see the topic and made me feel more humble. human intelligence is impressive, but calling it ‘general’ isn’t very objective. my cat would disagree. to me human intelligence is better seen as socially driven cognitive adaptations, and there’s a huge WORLD of intelligence we still don’t understand, and are nowhere near recreating with current AI不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 【引用 @demishassabis】:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用。 显然,没有人能规避 no free lunch theorem,因此在实际且有限的系统中,总是必须围绕正在学习的目标分布有一定程度的专门化。 但关于通用性的要点在于,理论上,在 Turing Machine 的意义上,这种通用系统的架构能够在给定足够时间和内存(以及数据)的情况下学习任何可计算的东西,而人脑(和 AI foundation models)是近似 Turing Machines。 最后,关于 Yann 对国际象棋棋手的评论,人类竟然能发明国际象棋(以及现代文明的所有其他方面,从科学到 747s!),更不用说像 Magnus 这样的人能下得如此出色,这本身就令人惊叹。他可能不是严格最优的(毕竟他有有限的记忆和有限的决策时间),但考虑到我们的大脑是为狩猎采集而进化的,他以及我们能用大脑做到这些,实在令人难以置信。

Demis Hassabis: Yann is just plain incorrect here, he’s confusing general intelligence with universal intelligence. Brains are the most ...


推荐理由:顶级科学家对AGI本质的深刻思辨,重新定义通用智能的边界与局限

12月1日12月1日周一

星期一 · 2 条
18:52
18:52
公众号:DeepSeek(深度求索)精选
AI 评分 66/100
DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理

DeepSeek 发布正式版 V3.2 与长思考增强版 V3.2-Speciale。V3.2 在推理 Benchmark 中达到 GPT-5 水平,并成为首个支持思考与非思考模式工具调用的模型。


推荐理由:半年前的这版更新,把 Agent 和思考推理揉进了开源模型,回头看算是 DeepSeek 在智能体能力上的关键一刀,做 Agent 开发的至今绕不开它。