精选归档 · 第 2 页

2140 条 · 共 282

8月26日8月26日周三

星期三 · 2 条
22:28
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 82/100
以色列资助的假美国智库试图利用AI进行宣传

一个打着“汉诺威公共政策研究所”旗号的亲以色列网站,在九天内发布了124篇、超56万字的报告,旨在优化内容以引导ChatGPT等AI聊天机器人引用其亲以观点。该网站由美国公司Piro Inc依据《外国代理人登记法》为以色列政府分发内容,其背后是以色列政府数千万美元资助、经Havas Media等第三方转手的更广泛宣传行动。


推荐理由:调查把生成引擎优化与训练数据投毒的操作链拆开,让原本不可见的聊天机器人引用来源有了可核查的路径。
22:07

8月24日8月24日周一

星期一 · 2 条
22:54
Tomer Tunguz 博客(VC 分析)精选
AI 评分 60/100
AI 基础设施的牛鞭效应:从 GPU 到存储的连锁瓶颈

AI 基础设施瓶颈正沿供应链依次传导,形成典型的牛鞭效应。2023 年初 GPU 短缺使 H100 租赁价超 $9/小时,随后压力转移至内存,企业级 SSD 合约价单季上涨 80%;到 2025 年底智能体推高 CPU 需求,2026 年存储短缺导致西数和希捷 2026 全年 nearline 产能售罄。数据中心建设成本已超 $20b/GW,变压器交期近三年,涡轮机订单排至 2031 年。


推荐理由:把牛鞭效应用在 AI 硬件供应链上,解释了瓶颈逐段迁移的滞后期,可为判断 2027-2028 年哪些长期资本开支会先承压提供框架。
08:00
Epoch AI:研究、数据与评测精选
AI 评分 70/100
Epoch AI 报告:Nvidia 的价值增值为何在美国 GDP 统计中被漏记

Epoch AI 报告指出,Nvidia 等无厂芯片设计商在美国设计、在海外制造并销售的芯片,因货物不越境、IP 也无交易记录,其价值增值几乎完全未被计入美国 GDP。


推荐理由:报告解释了美国 GDP 为何漏记 Nvidia 等无厂芯片设计商的价值,并给出 0.3 个百分点的量化低估及可能的修正路径。

8月21日8月21日周五

星期五 · 1 条
21:07
OpenBMB@OpenBMB精选
AI 评分 69/100
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型🧮 Introducing MathForm, an open-source framework, dataset, and model for mathematical autoformalization with Lean 4.Formalizing mathematics makes mathematical knowledge machine-checkable, but it is more than translating statements into code. A model must map each concept onto the right types and definitions in Mathlib. A formal statement can compile and still misstate the original problem.Highlights ✨ MathForm Framework: Retrieval-Augmented, Verification-Guided Data Construction A retrieval planner pulls the Mathlib definitions and existing formalizations a statement needs. The generator then revises its output against Lean compiler diagnostics and semantic-consistency feedback for up to 3 rounds.FormalVerse Dataset: 367K+ Verified Lean 4 Examples Each example pairs a natural-language statement with verified Lean 4 code , across diverse mathematical domains and sources.Results 📊 • At a matched 100K budget with the same recipe and init, models trained on FormalVerse reach 60.32% Consistency Check, vs 46.53% on FineLeanCorpus and 41.49% on NuminaMath-LEAN • MathForm-8B achieves 88.06% Syntax Check and 72.37% Consistency Check Pass@8 across six benchmarks, outperforming ReForm-32B and Goedel-Formalizer-V2-32B at a quarter the size • On the hardest FATE-H / FATE-X subsets it reaches 63% / 37% Consistency Check, beating the strongest specialized baseline by 10 and 12 points🔗 Resources 📄 Paper: http://arxiv.org/abs/2608.14221 📚 Dataset: http://huggingface.co/datasets/openbmb/FormalVerse 🤖 Model: http://huggingface.co/openbmb/MathForm-8B 💻 Code: http://github.com/openbmb/MathForm面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。

8月20日8月20日周四

星期四 · 1 条
10:00
公众号:蚂蚁百灵(Ling)精选
AI 评分 68/100
Ling-3.0 tiny & flash Base Models 正式开源

蚂蚁百灵开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步开放预训练、中期训练及 WSM 合并等共 6 个 checkpoints。tiny-base 总参数 7.9B、激活参数 1.3B,flash-base 总参数 124B、激活参数 5.1B,均采用统一训练方案,适合持续预训练、监督微调、偏好优化及强化学习后训练等场景。


推荐理由:Ling-3.0 开放中间 checkpoint 和 WSM 合并策略,研究者可比较各训练阶段增益,并在自己数据上从合适节点继续预训练或后训练,而不只是拿到最终权重。

8月19日8月19日周三

星期三 · 1 条
02:23
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 65/100
OpenAI 在"关键网络能力"时代放缓模型开发节奏

OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的“关键网络安全能力”阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控,采用多阶段激活分类器检测机制。


推荐理由:最高风险预警若 30 分钟内无法排除误报就暂停训练,安全证据与隔离迁移先于大规模 RL,前沿模型开发进度开始被安全工程效率约束。

8月18日8月18日周二

星期二 · 2 条
13:34
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 64/100
inclusionAI 开源 ConceptEdit:基于概念缩放与密集监督的图像编辑数据生成管线

蚂蚁集团 inclusionAI 开源 ConceptEdit,一个基于概念缩放与密集监督的图像编辑数据生成管线。该管线通过三阶段流程(VLM 生成指令、FLUX 执行编辑、VQA 评估筛选)构建大规模、基于分类法的图像编辑数据集,并提供单概念与多概念两种变体。项目采用 MIT 许可证,支持断点续跑,需 OpenAI 兼容 VLM 端点与本地 FLUX 检查点。


推荐理由:流水线把图像编辑数据生成拆为指令生成、FLUX 编辑、VLM 评判三步,多概念版本将多个并行编辑合并为一条指令并支持断点续跑,为构建带质检的编辑训练数据提供可复用框架。
02:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
404 Media 追踪珍本图书流向:亚马逊批量购书扫描用于 AI 训练后销毁

404 Media 通过在一本珍本图书中放置追踪设备,首次揭露亚马逊未公开的购书行动:批量购入大量书籍,扫描用于 AI 训练数据,随后销毁。追踪显示这些书最终被送往亚马逊的一处人工智能训练中心。


推荐理由:跟踪证据把AI训练数据采购从传闻落到可查验的物流链条上,为版权方和作者判断图书被数字化利用提供了具体依据。

8月15日8月15日周六

星期六 · 1 条
19:23
The Decoder:AI News(RSS)精选
AI 评分 70/100
AI生成书籍正淹没亚马逊,并拉低人类作者的单书收入

一项对14,419本自出版电子书的分析显示,AI生成书籍正以数量而非质量挤占人类作者市场,即便未检测到AI文本的书籍,单书收入也在下滑。2023年Q1至2026年Q1,书目总量增长38.3倍,而季度收入仅增长8.9倍;在八个类型中,七个类型的无AI文本书籍单书收入下降。


推荐理由:这项研究把市场稀释从推测变成可量化证据,版权诉讼中此前缺少的经验性数据可能由此补上,并影响合理使用的判断。

8月14日8月14日周五

星期五 · 3 条
12:01
公众号:蚂蚁百灵(Ling)精选
AI 评分 62/100
蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。


推荐理由:真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。
00:00
METR:Notes(网页)精选
AI 评分 68/100
METR 分析 LLM 是否加速了科学发现:漏洞发现激增,算法优化未见明显拐点

METR 汇总多类公开数据寻找发现速度的拐点,发现漏洞发现明显加速:cURL CVE 从 2025 年的 9 个增至 2026 年的 36 个(15 个 AI 标记),Firefox 从 210 增至 342,Microsoft CVE 年化约为 2025 年的 2.5 倍。


推荐理由:原文用多领域公开数据对比 AI 对发现速度的影响,读者可以看到漏洞发现明显加快而算法优化尚未加速的反差。
00:00
Prime Intellect(网页)精选
AI 评分 75/100
Prime Intellect 测评18个前沿模型在 nanoGPT speedrun 上的自主研究能力

Prime Intellect 在 nanoGPT optimizer speedrun 上跑了153次自主运行,覆盖18个前沿模型,单次最长8天、每个运行8xH200。


推荐理由:原文展示了18个前沿模型在nanoGPT speedrun上153次自主研究运行的完整对比和公开轨迹,可帮助读者理解模型间研究能力的真实差距在哪里。

8月13日8月13日周四

星期四 · 1 条
08:00
Epoch AI:研究、数据与评测精选
AI 评分 60/100
Epoch AI 估算 AI 芯片性价比每年增长约 49%

Epoch AI 估算 2023 年 Q1 至 2025 年 Q4 每季度购买的 AI 芯片综合性价比,从约 5.6×10^11 升至约 1.4×10^12 bit-operations per second per dollar(2025 年不变美元),指数拟合平均每年增长约 49%(90% CI:36%–66%),倍增时间 1.7 年。


推荐理由:Epoch AI 用自建的芯片销量和价格数据量化了每季度购买 AI 芯片的性价比增长,并说明了 Nvidia 高利润率对均价的影响。

8月11日8月11日周二

星期二 · 6 条
20:11
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 65/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型,含 tiny 与 flash 两个尺寸及预训练、中期训练、合并(WSM)等阶段检查点。该系列采用混合线性注意力与稀疏 MoE 架构,总参数 7.9B,每 token 仅激活 1.3B 参数(128 个路由专家中激活 8 个)。


推荐理由:用加权检查点合并替代学习率衰减,让基座模型更适合持续预训练,也为验证不同衰减曲线省去重复实验。
20:11
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 63/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中期训练及合并(WSM)等阶段的检查点,支持继续预训练、微调与研究。Ling-3.0-tiny-base 采用稀疏 MoE 架构,含 128 个路由专家,每 token 仅激活 1.3B 参数,总参数量 7.9B,并原生混合线性注意力以高效处理长上下文。


推荐理由:它把学习率衰减替换为加权检查点合并,基座模型更适合持续预训练和数据扩展,做继续预训练或领域微调时可复用这一训练策略做离线探索。
20:11
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 64/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,含 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家,激活参数仅 5.1B(Non-emb)。


推荐理由:WSM 合并替代学习率衰减,让持续预训练和动态数据扩展不必为每种衰减策略重跑训练,降低实验成本。
20:10
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 64/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。


推荐理由:把训练中间态作为可下载 checkpoint 开放,配合 WSM 合并替代学习率衰减,做继续预训练或 MoE 研究时可从中间阶段开始,省去重复前置训练成本。
20:07
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 63/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点

蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中间训练及合并(WSM)等多个训练阶段检查点,支持继续预训练、微调与研究。


推荐理由:训练检查点分层开放,且用加权合并替代学习率衰减,为持续预训练和动态数据扩展提供了可复用的实验基座,减少不同策略的重复训练成本。
12:58
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
RynnValue:用时间距离扩展机器人价值基础模型

RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。


推荐理由:用时间距离替代偏好标注,让价值模型能利用原始时间戳规模化训练,跨具身、任务和视角的泛化能力为无偏好数据的机器人策略提供了新的奖励接口。