精选归档 · 第 6 页

101120 条 · 共 631

8月7日8月7日周五

星期五 · 1 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 70/100
在 OpenRouter 上设置团队 AI 支出控制

OpenRouter 推出五项团队 AI 支出控制功能:组织共享信用池、预设模型范围、每密钥限额、护栏(成员预算和模型白名单)及活动仪表盘。本指南按顺序介绍设置流程,包括创建组织、配置预设、通过 Management API 密钥设置每日/每周/每月限额。组织默认支持最多 10 名成员,标准按需付费账户购买信用时收取 5.5% 平台费。


推荐理由:这份教程把团队支出控制拆解为可操作的五个步骤,并对限额、护栏的叠加逻辑给出了清晰定义,可缓解团队协作中支出归属与模型权限的常见混乱。

8月6日8月6日周四

星期四 · 3 条
21:56
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 77/100
Kitesurf:一款在 V8 隔离环境中运行的"代理优先"浏览器

Cloudflare 推出 Kitesurf,一款专为 AI 智能体设计的浏览器,完全运行在 Workers 上,基于 V8 隔离环境,现已在 Browser Run 中免费开放测试。


推荐理由:Kitesurf 将浏览器重新设计为无状态、隔离的 Agent 引擎,CPU 和内存占用仅为 Chromium 的 1/3 到 1/7,这对大规模自动化任务的成本结构可能产生实质影响。
07:52
Tomer Tunguz 博客(VC 分析)精选
AI 评分 63/100
SpaceXAI 单季资本开支 183.7 亿美元,AI 投入接近微软总资本开支四成

SpaceXAI 上季度资本开支 183.7 亿美元,其中 158.3 亿美元投向 AI,接近微软同期总资本开支的 40%。其运营现金流仅覆盖资本开支的 12%,主要靠举债和股权融资,而微软覆盖率达 155%。公司股价较 6 月峰值腰斩,6 月发行的 250 亿美元债券各期限均跌破面值。


推荐理由:将SpaceXAI的AI资本支出与微软等超大规模商作财务对比,用现金流自给率和债券定价揭示不同资金来源的代价,为判断其烧钱速度的可持续性提供了具体数据支点。
03:55
Simon Willison 博客精选
AI 评分 70/100
用 Claude Fable 5 一次性生成完整《Raccoon Heist》游戏

Simon Willison 将 2022 年 GPT-3 和 DALL-E 生成的游戏概念与截图输入 Claude Fable 5(运行于 Claude Code for web),成功构建出可玩的 3D 浏览器游戏。


推荐理由:给出从旧推文到可运行游戏的完整闭环:用 GitHub Pages 实时预览、Playwright 自动抓屏修复,使 agent 能在无人类干预下迭代出可用产物,适合探索 agent 编码游戏的开发者直接复用该流程。

8月5日8月5日周三

星期三 · 6 条
23:02
AYi@AYi_AInotes精选
AI 评分 75/100
SpaceX 宣布 AI 算力上太空,独家采用 Nvidia Vera Rubin大家都在刷SpaceX上市首份财报,没人注意Musk扔的王炸:@SpaceX 要把AI数据中心搬到太空去, 而且不是科幻和概念PPT, 明年就开始发射。就在昨天的财报电话会上, Musk直接宣布: SpaceX未来所有的AI算力, 不管是地面数据中心还是轨道上的, 独家使用Nvidia最新的Vera Rubin架构。2026年底,总算力超过2GW, 2027年底,接近10GW。这是什么概念? 现在全球最大的超算也就几百兆瓦, 10GW是十个超算的规模, SpaceX直接一步迈进全球最大AI基础设施玩家的行列。但这还不是最炸的, 最炸的是他们同步公布的Starmind计划: 一整个轨道AI卫星星座, 2027年开始发射, 每一颗卫星里,直接塞Nvidia Rubin GPU加Vera CPU, 真正的数据中心级太空算力。 地面的数据中心也省事, 直接用同一套设计, 把太阳能板和散热器拆了就行。很多人第一反应是这也太扯了, 但你仔细想,这事儿逻辑硬得可怕。 现在地面上搞AI,最大的瓶颈是什么? 不是GPU,是电,是散热,是地。 一个10GW的数据中心, 要占多少地,要拉多少电,要建多少冷却塔, 审批要多少年, 这些问题在太空里全部不存在。太阳是免费的, 真空是最好的散热器, 轨道上的空间要多少有多少。以前这事儿不成立, 是因为发射成本太高, 现在Starship把发射成本打下来了, 把一公斤东西送到轨道的成本马上就要降到几百美元甚至更低, 太空计算突然就从科幻变成了经济账。而且这不是什么遥远的愿景, 他们已经和@NVIDIAGeForce 联合设计好了Starmind AI1计算载荷,@elonmusk 原话是"这不是遥远的未来,我们预计明年就开始发射"。 计算在轨道上跑,结果通过星链的激光链路传回来, 你在地面上用,根本感觉不到区别。这个消息一出来, @AMD 股价直接跌了8%。这可是SpaceX, 是现在全世界最能把疯狂想法变成现实的公司, 加上Nvidia最新的芯片, 再加上Starship的发射能力, 这三家凑在一起, 等于直接给"轨道数据中心"这个概念盖了章。他们还在申请最多一百万颗卫星的FCC许可, 这个野心, 已经不是和谁竞争的问题了, 是直接把AI算力的上限给掀了。我们这代人从接触电脑开始, 所有的计算都发生在地面上, 在机房里,在数据中心里, 从明年开始, 我们用的AI, 可能有一部分真的是在天上算的。这一天,可能会比所有人想的都近。SpaceX 在财报电话会上宣布,未来所有 AI 算力(地面及轨道)将独家采用 Nvidia Vera Rubin 架构,2026 年底总算力超 2GW,2027 年底接近 10GW。同步公布 Starmind 计划,2027 年起发射搭载 Rubin GPU 与 Vera CPU 的轨道 AI 卫星星座,明年开始发射,算力经星链激光链路回传。消息公布后 AMD 股价跌 8%。

Elon Musk: SpaceX 已承诺独家使用 Nvidia GPU,因为它们是最优秀的。


推荐理由:SpaceX 把数据中心推到轨道,同时解决了地面 AI 的电力、占地和散热瓶颈,这步棋让算力规模不再受地理限制,会影响后续超大规模 AI 投资的选址逻辑。
12:35
01:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。


推荐理由:将目标模型推理与草稿模型训练分离,让两种工作负载可独立扩缩,改变了投机解码训练中资源配比必须硬编码的旧模式,资源规划可按模型和序列长度灵活调整。
00:52
GitHub Blog精选
AI 评分 67/100
GitHub 如何用堆叠式 Pull Request 拆解 AI 生成的巨型代码

GitHub 介绍用堆叠式 Pull Request(stacked PR)解决 AI 编码智能体生成巨型代码难以审查的问题。通过将 1,000+ 行的大 diff 按数据、API、接线、UI 拆成 L1-L4 四个独立分层,每层可分配不同审查者。


推荐理由:详细演示了用 GitHub 堆叠 PR 将 AI 生成的大 PR 拆分为逻辑层,配合 gh-stack CLI 和技能,提供可立即采用的审查优化方案。
00:45
Google Developers Blog(RSS)精选
AI 评分 61/100
Google Cloud API Gateway 推出统一模型路由功能,支持 Gemini、Claude 与 OpenAI OSS-GPT

Google Cloud API Gateway 新增模型路由功能(Public Preview),开发者可在 OpenAPI 3.x 规范中配置虚拟模型名到后端目标的映射,无需硬编码端点或管理开源代理。网关作为无服务器入口层,接受标准 OpenAI 兼容请求,自动将负载转码为目标模型的原生格式并动态路由流量。


推荐理由:将模型路由规则直接内嵌到 OpenAPI 规范中,减少了多模型调度时的入口适配工作,也无需自行维护代理层。
00:33
Google Cloud:Databases(RSS)精选
AI 评分 60/100
Google Cloud 推出 Database Operations Agents,实现自主数据库管理

Google Cloud 在 Agentic Data Cloud 发布中推出两款 AI 数据库智能体:Database Onboarding Agent 负责 Day 0 的配置与部署,Database Observability Agent 负责 Day 1/2 的监控、故障排查与维护。


推荐理由:数据库代理将排错和调优从手动查找变为自然语言交互,DevOps团队可能因此缩短平均恢复时间。

8月4日8月4日周二

星期二 · 9 条
23:12
NVIDIA Blog(RSS)精选
AI 评分 62/100
NVIDIA 开源 cuFile API,推动 GPU 直连存储

NVIDIA 在 FMS 大会上宣布开源 cuFile API 及底层存储软件栈,让 GPU 可直接读写存储,访问延迟降至微秒级。其 Vera CPU 在两级压缩与加密流水线中吞吐量比 x86 CPU 最高提升 3.21 倍,并联合 40 多家厂商推出 Storage-Next 计划。


推荐理由:cuFile 开源让 GPU 直存访问成为可跨平台协作的开放标准,这会改变 AI 基础设施团队评估存储架构的方式,不再只绑定单一厂商的实现。
23:05
Rohan Paul@rohanpaul_ai精选
AI 评分 78/100
Anthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议Anthropic signs $10B computing deal with infrastructure startup Volta, a cloud company that is only months old.A contract that size used to go to Amazon, Microsoft or Google, because only they owned the land, power and balance sheets for frontier training.That held while money was the scarce input, but power is scarce now, and the big three cannot energize a site faster than a newcomer can.So the deal went to Volta Infra, a startup valued at $2.4B after raising about $300M from backers including Nvidia and Michael Dell's family office.The startup owns almost none of the hardware.Its capacity comes from Bitdeer, a bitcoin miner that leased out 121MW at its Norway site for 16 years in a contract worth about $4.7 B.Nvidia supplies the chips and Dell puts the systems together, which leaves the middle company holding the financing, the contracts and the customer.Paying for all of that is heavy for a firm this young, so Volta lined up a $5B program with Azora to fund the buildout.Chief executive Ricard Boada described the arrangement publicly first, a $10B partnership worth roughly $1.7B a year to his company.The risk sits on the other side, where a $2.4B company has promised $10B of service on machines it leases from a miner.Anthropic is buying schedule here rather than servers, and the price of speed now includes counterparty risk no hyperscaler contract ever carried.---bloomberg. com/news/articles/2026-08-04/anthropic-inks-10-billion-computing-deal-with-new-cloud-startupAnthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议,约合每年 17 亿美元。Volta 估值 24 亿美元,硬件几乎全为租用:算力来自比特币矿商 Bitdeer 挪威 121MW 站点,芯片由 Nvidia 供应、Dell 组装。Anthropic 买的是交付速度,代价是承担超大规模云厂商合同从未有过的交易对手风险。

推荐理由:速度成为比资金更稀缺的输入时,大额算力合同可能流向更快供电的中间商,这带来了传统云合同没有的对手方风险,也让硬件商和矿场成为供应链节点。
23:04
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。


推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。
21:03
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
在单颗 AMD MI300X 上运行 DeepSeek V4 Flash

一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。


推荐理由:为 MI300X 提供了可部署的生产栈,包含 FP8 格式修复、推测解码优化和混合 KV 缓存策略,单卡就能服务 256K 上下文。
16:35
MarkTechPost(RSS)精选
AI 评分 74/100
用 NVIDIA SkillSpector、LangGraph、YARA 规则、SARIF 与 CI 策略门构建高级 AI 技能安全审计流水线

本教程演示如何用 NVIDIA SkillSpector 评估 AI 技能的安全态势,构建包含干净、风险、恶意及 MCP 示例的合成技能市场,并通过 LangGraph 检查流水线扫描每个技能。


推荐理由:将安全审计从单次检查升级为包含基线抑制、回归检测和 CI 策略门的可治理管道,适合批量管理 AI 技能的组织。
16:20
公众号:腾讯混元精选
AI 评分 65/100
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。


推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。
12:30
公众号:面壁智能(MiniCPM)精选
AI 评分 78/100
面壁智能开源 ForgeStencil:一周自动优化 100+ 工业与科学软件,全程零人工介入

面壁智能联合 OpenBMB 开源全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 ForgeStencil,由 Kernel Agent 与 App Agent 闭环协作,实现从算子优化到应用集成的全自动流程。


推荐理由:ForgeStencil 把决定工业软件效率的 Stencil 优化从专家手工调教变成 AI 自动闭环,开源后多个行业的真实应用可直接复用其加速实现。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
论文揭示 LangGraph、CrewAI 等五个智能体工作流框架的检查点与恢复语义缺陷

一项研究为智能体工作流持久化层提出“恢复契约”,规定前缀延续、效果恰好一次等六项属性,并用 TLA+ 模型穷举验证了 740 万状态。实测发现 LangGraph 1.2.9 在崩溃后重复执行已持久化工作,CrewAI 1.15.2 违背其书面声明,pydantic-graph 1.x 无法在节点中途崩溃后恢复。研究还给出经 Verus 验证的参考实现 REMIT,修复了分叉与有效性缺陷。


推荐理由:RESUME CONTRACT 用形式化验证找到了 LangGraph 和 CrewAI 的持久层缺陷,为追求状态持久可靠性的 Agent 应用提供了可验证的合同和修复参考。
00:31
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
AirLLM 实现单块 4GB GPU 运行 70B 模型推理

AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。


推荐理由:将 70B 模型推理压缩到 4GB 显存,让不带专用显卡的开发者也能本地测试大模型,但实际推理速度和质量仍需根据用例评估。

8月1日8月1日周六

星期六 · 1 条
08:00
Together AI 研究与产品博客(RSS)精选
AI 评分 81/100
Kimi K3 开发者完全指南:Together AI 上的 1M 上下文、推理档位与工具调用

Together AI 发布 Kimi K3 开发者指南。K3 是月之暗面(Moonshot AI)2.8 万亿参数的开放权重模型,首个 3 万亿参数级的开源模型,Together 直接与 Moonshot 团队合作提供服务。


推荐理由:指南给出 KDA、Stable LatentMoE 架构要点和 API 用法、缓存与计费细节,开发者可据此判断如何在 Together 上落地这个模型。