精选归档 · 第 12 页

221240 条 · 共 631

7月7日7月7日周二

星期二 · 1 条
01:11
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 63/100
SGLang 集成 DSpark 推测解码:置信度驱动的可变长度验证

SGLang 团队将 DSpark 推测解码算法集成到开源推理引擎中。该算法采用半自回归块起草器一次生成一组 token,并利用置信度头与顺序温度缩放(STS)为每个请求动态分配可变验证长度,从而在高负载下裁剪无效验证成本。SGLang 支持密集模型(如 Qwen3)和稀疏模型(如 DeepSeek-V4),通过全 CUDA 图处理不规则的每请求验证长度。提供三种验证模式:static(全长)、compact(生产路径)和 cap-accept(接受上限测量)。还引入了零开销调度、基于离线成本表的在线调度器、融合 Triton 核等优化。在 H200 上使用 DeepSeek-V4-Flash 的测试中,DSpark 在整个并发扫描范围内比 MTP 和非推测基线实现了更优的吞吐量-延迟权衡。


推荐理由:DSpark 这版推测解码的工程落地比论文本身更有看头——SGLang 用 ragged CUDA Graph 和动态调度把 trimm 掉的计算按字节级回收,383 tok/s 的单请求速度对部署方是即时可用的性能增益。

7月6日7月6日周一

星期一 · 2 条

7月5日7月5日周日

星期日 · 1 条
02:23
AYi@AYi_AInotes精选
AI 评分 77/100
SpaceX与Anthropic每月12.5亿美元算力合同:算力成新基本盘Damn,每月 12.5 亿美元,SpaceX 和 Anthropic 的算力合同简直掀翻了行业天花板, 修订后的 IPO 文件披露,这份合作持续到 2029 年 5 月,双方都可以提前九十天通知终止。12.5 亿美元一个月,签三年,还能随时终止,我觉得SpaceX 这笔算力生意,算盘打得太精了,@elonmusk 老马真的是个商业天才!我看完 Shotwell 的访谈和 SpaceX 上市后的修订版 IPO 披露,第一反应是,这根本不是普通的云服务订单啊, elon意图很明显,SpaceX 早就把算力当成了下一个基本盘,它不只是造火箭的,还在建地球上和太空中的数据中心,在搭自己的 AI 技术栈,连 X 平台都是它算力体系的一部分。所以真的不是 Anthropic 有钱没地方花,也不是 SpaceX 刚好有闲置算力, 你想啊,进能对外做算力供应商扩营收,退能保自己的 AI 和 X 业务不受影响,两头都占住了hhh,那这份合同真正藏着的主动权在哪呢,很多人只看到了 12.5 亿的月单体量,没注意那个 6 个月后可终止的条款。Shotwell 说的很直白,绝不会出售自己实际需要的算力,等于它先把长期订单的钱赚着,一旦自己的业务要用算力了,随时可以收回来。但能确定的是,AI 算力这场仗里,之前大家盯着的都是云厂商,没人把航天公司当成核心玩家。我暂时还没算清它现在的算力储备到底是什么量级,能支撑这么大的合同。 我理解当一家公司能自己搞定从基建到算力到应用的全链路,那么它在 AI 时代的话语权,会比所有人预想的都大。你觉得下一个找 SpaceX 买算力的会是谁呢,欢迎评论区交流呀~修订版IPO文件披露,SpaceX与Anthropic签订每月12.5亿美元算力合同,持续至2029年5月,双方可提前90天通知终止,另有6个月后可终止条款。分析认为,这非普通云服务--SpaceX已将算力作为下一个基本盘,既对外供应算力扩营收,又能保障自身AI及X业务。SpaceX总裁Shotwell表示,公司视失败为数据金矿,不接受完美发射;上市后面临季度财报,其时间维度不同于常规投资者,买SpaceX不是买下一个季度。

AYi: 我终于明白为什么 SpaceX 能越跑越快, 别人把失败当事故,他们把失败当数据金矿。 SpaceX 总裁 Shotwell 分享了SpaceX的投资逻辑, 以及SpaceX 是怎么对待失败、怎么跟投资人谈预期的? Shotwell有一句话...


推荐理由:SpaceX 一份每月 12.5 亿美元的算力合同浮出水面,关键不是金额而是条款——SpaceX 可随时收回算力自用。航天公司成了核心玩家,算力竞争的门槛和格局都被拉高了。

7月4日7月4日周六

星期六 · 1 条
08:00
Lilian Weng:Lil'Log(RSS)精选
AI 评分 57/100
Harness Engineering for Self-Improvement:AI装备层设计模式与自改进

Lilian Weng 近日系统探讨了 AI 的“装备层”(Harness)——位于基础模型与现实世界之间的系统层,负责编排执行、控制模型思考与规划。文章归纳三种核心设计模式:1)工作流自动化,采用“计划-执行-观察-改进”循环;2)将文件系统作为持久化内存,解决长程任务上下文窗口与状态持久化问题;3)子智能体与后台任务,实现并行执行与隔离管理。案例聚焦于 Claude Code、Codex 等编程智能体的装备层设计。未来方向包括上下文工程、工作流优化以及通过进化搜索联合优化模型权重。


推荐理由:Lilian Weng 这篇综述把 agent 自改进的脉络从 harness 设计一路拉到进化搜索,近期关键研究基本都串起来了,做 coding agent 和自动研究的同行建议通读。

7月3日7月3日周五

星期五 · 6 条
18:00
公众号:面壁智能(MiniCPM)精选
AI 评分 65/100
面壁智能发布AI全自动预训练框架ForgeTrain,8小时追平Megatron-LM

面壁智能发布全球首个完全由AI编写、无人类干预的生产级大模型预训练框架ForgeTrain。该框架针对特定模型和硬件从零自动“锻造”专用训练代码。基准测试显示,ForgeTrain在8小时内追平Megatron-LM,1.5至2天内实现稳定反超,模型FLOPS利用率提升约8%~10%,且可迁移至不同模型(MiniCPM4-0.5B/8B)和硬件(H100及昇腾NPU)。其采用四阶段Harness优化流程,全程自动判定。面壁智能将其工程思想概括为Forge Engineering。


推荐理由:这是AI编写生产级训练框架的首个实证,8小时追平Megatron-LM并反超,证明AI打穿Infra的范式已到临界点,做训练框架和Infra的都该看看。
10:34
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Program-as-Weights:一种面向模糊函数的编程范式

Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。


推荐理由:这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。
05:08
MarkTechPost(RSS)精选
AI 评分 70/100
阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控

阿里巴巴发布 Page Agent,一个开源的 JavaScript 客户端库,嵌入网页后可通过自然语言指令直接操作 DOM 元素。与 Playwright、Puppeteer 等外部浏览器自动化工具不同,Page Agent 不依赖截图或多模态模型,而是将实时 DOM 脱水压缩为 FlatDomTree 文本映射,让纯文本模型精准执行点击、表单填写等操作。它继承用户 cookies 和会话,无需独立后端,并支持任意 OpenAI 兼容端点的模型(示例使用 qwen3.5-plus)。项目采用 MIT 许可证,适合在自有应用内构建 AI 副驾、智能表单填充或无障碍控制等场景,但限于单页面范围,风险操作仍需服务端验证。


推荐理由:Page Agent 把浏览器自动化从外部驱动变成页面内 JS,读 DOM 而非截图,让 SaaS 内的 AI 助手成本更低、更精准,适合自己产品内嵌 copilot 的团队。
03:45
The Decoder:AI News(RSS)精选
AI 评分 78/100
Microsoft 成立"Frontier Company",斥资 25 亿美元派驻 6000 名 AI 工程师到企业客户现场

Microsoft 新设业务部门“Frontier Company”,拨款 25 亿美元,将 6000 名行业与工程专家派驻企业客户现场,“共同设计、共同创新、部署并持续改进 AI 系统”。该部门由 Rodrigo Kede Lima 领导,旨在超越“前部署工程”模式,成为“最大、以结果为导向的工程组织”。Microsoft 将自己定位为 OpenAI 和 Anthropic 的“平台中立”替代方案,后两者也已设立专门部署公司。Microsoft 将借助埃森哲、凯捷、安永等系统集成商扩大覆盖范围。


推荐理由:微软砸 25 亿美元成立 Frontier Company,把 6000 名工程师直接塞进企业客户现场,正面应战 OpenAI 和 Anthropic 的部署子公司。这一手既是补齐落地能力也是巩固生态,对 CIO 来说是选择多了,但对 AI 行业意味着部署军备竞赛正式开打。
02:37
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 59/100
Agent辅助的SGLang开发:初步探索

SGLang团队将LLM服务、分布式运行时、GPU内核、扩散管道等工作流编码为可执行的SKILL.md文件、脚本、基准合约和审查循环。现有技能包括:SGLang .claude/skills(CUDA调试、内核集成、性能分析等)、SGLang diffusion .claude/skills(扩散模型添加与调优)、BBuf/AI-Infra-Auto-Driven-SKILLS(跨框架SOTA循环)、KDA(MLSys 2026 FlashInfer内核竞赛获胜方案)以及BBuf/KDA-Pilot(已合并三个SGLang集成PR)。Profile证据是性能工作的核心,长期优化转向Loop Engineering——SGLang SOTA Performance Loop将追求SOTA分解为公平基准测试、差距决策、性能分析、补丁和再验证,Humanize/RLCR添加外部审查,Codex Goal以更低协调开销运行相同循环。评审重要性提升,开发者需定义问题、选择证据、设计工作流并判断结果是否可用于生产。


推荐理由:这不是一篇普通的开发经验总结,而是 SGLang 团队把调试、基准测试和性能调优等重复劳动变成可执行 agent 技能的实操手册,对于做推理框架和复杂工程的人非常值得一看。
02:03
Claude:Blog(网页)精选
AI 评分 61/100
Claude Enterprise 新增用量与成本分析及支出管控功能

Claude Enterprise 推出更丰富的管理分析工具和成本控制功能。仪表板现可按群组和用户分析用量与成本,支持按 SCIM 群组筛选,展示制品创建、文件编辑、技能和连接器对应的成本。Claude Code 管理控制台新增“使用量”和“价值”选项卡,分别显示活跃开发者、会话次数、常用命令,以及生产力提升估算、每次提交成本和年度价值估算。分析聊天支持自然语言查询并返回可导出图表。Analytics API 可将数据接入 Datadog Cloud Cost Management 和 CloudZero。管理员可设置模型默认和权限控制,并配置组织级支出限额的 75%、90% 告警通知;用户在 75% 和 95% 时收到应用内提醒。Admin API 支持自动审批额度增加、标记接近限额用户及快速变化的用量。


推荐理由:企业版管理员终于有了按群组和用户的成本明细、模型权限和花费警告。我觉得规模化部署 Claude 的团队会很看重这些,尤其能把 Claude Code 的价值量化成 ROI,财务团队可以直接拉进现有系统,不是一次性噱头。

7月2日7月2日周四

星期四 · 7 条
23:06
IT之家(RSS)精选
AI 评分 74/100
花旗、Adobe等企业限制员工使用AI旗舰模型以控制成本

据404 Media获取的内部资料,Atlassian、Adobe、亚马逊等六家企业正限制员工使用AI工具,要求改用能力较低的大模型避免成本失控。至少一家企业月度AI开销增至三倍,超1500万美元。花旗银行因GitHub改为按量计费,于6月24日禁用Claude Opus 4.6、4.7及GPT-5.5等旗舰模型。Adobe于6月30日终止Claude无限制使用协议。Atlassian数据显示其AI月支出从500万美元飙升至1500万美元,本财年预计超1.2亿美元。GitHub计划改用开源模型并测试单人按量计费模式。


推荐理由:这是第一份详细揭露大公司AI成本失控的内部报告,花旗直接禁用GPT-5.5和Claude 4.7,把「按需匹配模型」写进全员邮件,对所有在铺AI的企业都是一记现实的耳光。
19:39
Ars Technica:AI(RSS)精选
AI 评分 70/100
谷歌AI建设导致2025年用电量增长37%

2025年,谷歌年度用电量同比上涨37%,创历史最大增幅。数据中心全年消耗超4200万兆瓦时,超过新西兰、丹麦、尼日利亚等国总用电量。自2019年以来,谷歌总用电量已增长超250%。用电激增主要来自Google Cloud、YouTube视频流及支撑AI产品和服务的数据中心建设与运营。公司表示,AI基础设施建设速度超过电网脱碳速度,但仍致力于扩大全球清洁电力规模,并通过技术创新降低运营排放。2024年谷歌用电量增幅为27%。


推荐理由:谷歌2025年电力消耗暴增37%创历史纪录,清洁能源购买未能完全掩盖新建天然气电厂的排放,AI扩张的环境代价正加速兑现。
18:31
公众号:千问APP(阿里)精选
AI 评分 62/100
千问团队朱达:C端Agent Harness的"多快好省"工程哲学与主动服务探索

千问团队2026年1月上线通用复杂任务Agent(千问App胶囊入口),总结“多快好省”方法论:支持信息搜集、研究分析等任务;执行时间降至初始1/3;通过搜索范式与上下文管理优化交付质量;Token消耗仅为海外产品1/10。团队探索从被动响应转向主动服务,构建User Memory、Environment、Task System、Assistant四大组件,指出“情商”是主动服务最难环节。朱达提出Agent工程从Prompt Engineering演进至Harness Engineering,下一站是A IWare Engineering,强调“低功耗,够用就行”。


推荐理由:千问C端团队分享的Agent工程实践很务实,从“多快好省”到AIWare Engineering的演进思路,对正在做复杂任务Agent的团队是一个有价值的参考系。
08:00
PromptArmor:Threat Intelligence精选
AI 评分 65/100
PromptArmor 披露 Microsoft Copilot Cowork Skill 可绕过管理员设置调用 DeepSeek

PromptArmor 披露,即使组织未加入 DeepSeek Preview,Microsoft Copilot Cowork 的 Skill 也能通过 agent 自身的访问路径调用 DeepSeek(Mistral 亦验证可行),且无需 API key,认证由用户的 Cowork 会话自动授予。


推荐理由:原文实测展示了 Copilot Cowork Skill 如何绕过组织级模型封锁调用 DeepSeek,并给出管理员目前唯一可用的关闭路径。
04:35
Tomer Tunguz 博客(VC 分析)精选
AI 评分 60/100
构建AI智能体应优先设计路由

构建AI智能体时,应优先设计路由(router)而非选择模型。路由决定每个请求由哪层模型处理。正确路由可使70-80%流量运行在免费本地模型或异步推理上,将AI开销降低90%+。Brian Armstrong指出Coinbase通过更好的默认设置、路由和缓存,在token使用量增长的同时将AI支出减半。路由分三层:技能分类器、路由器、模型选择器。本地计算近乎零成本,异步批量推理比实时推理便宜两个数量级。大多数工作无需秒级返回。同步预测器标记复杂任务,夜间批量评估器更新路由权重。技能蒸馏后,非编码类任务中70-80%智能体流量可由本地模型处理。


推荐理由:Tunguz 把代理架构的设计重心从模型选择拉回到路由上,三层分类器-路由器-选择器的划分很清晰,做 AI 应用的团队可以参考,但其中的新东西不多。
01:39
Meta Engineering Blog(RSS)精选
AI 评分 71/100
Meta 大规模 AI 存储蓝图

Meta 运营数百 EB 级存储集群,基于 Tectonic 分层存储层构建 BLOB 存储架构,以应对两大挑战:最大化 GPU 利用率与研究迭代速度。传统 BLOB 架构的多层元数据查询可导致数百毫秒延迟,使 GPU 因 I/O 等待停顿。新架构将训练栈逐步迁移到 BLOB 存储接口上,利用闪存提供可预测的低 pMax 延迟,避免单 GPU 慢速拖慢整批任务。同时,统一的数据湖访问支持地理分布 GPU 间的数据高速注入与跨区移动,提升研究效率。


推荐理由:Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。
01:17
Google Developers Blog(RSS)精选
AI 评分 68/100
Google Cloud Workbench Notebooks 扩展发布:在 VS Code 中连接云端 Jupyter 环境

Google Cloud Workbench Notebooks 扩展正式上线,开发者可在 VS Code 中直接连接可扩展的云端 Jupyter 环境,无需切换上下文即可利用高性能 Google Cloud 基础设施完成机器学习全流程。该扩展已完全开源,可在 GitHub 和 VS Code Marketplace 获取。


推荐理由:这个扩展把Google Cloud的Jupyter环境直接嵌进VS Code,做ML的开发者不用再切换窗口,工作流会流畅不少,但对行业格局影响不大。

7月1日7月1日周三

星期三 · 2 条
22:01
TechCrunch:AI(RSS)精选
AI 评分 72/100
Meta效仿SpaceX,将过剩AI算力变现

据Bloomberg报道,Meta正计划推出云基础设施业务Meta Compute,对外出售AI计算能力和模型访问权限,直接与AWS、Google Cloud及Azure竞争。Meta已承诺未来几年投入1829亿美元建设AI基础设施,其中俄亥俄州数据中心(规模如曼哈顿)将于今年上线。新业务由基础设施主管Santosh Janardhan、Meta超级智能实验室负责人Daniel Gross和总裁Dina Powell McCormick领导。Meta可能效仿CoreWeave出售裸计算能力,并像AWS一样托管AI模型(包括近期发布的闭源模型Muse Spark)。扎克伯格此前已表示云业务“definitely on the table”。


推荐理由:Meta 进入云市场不只是大厂的新业务,而是算力资产化的信号,未来 AI 竞争可能从模型军备赛转向数据中心所有权,开发者能拿到更便宜的 GPU 但绑定生态的风险也得权衡。
16:32
MarkTechPost(RSS)精选
AI 评分 73/100
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型

NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。


推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。