Topic · 主题全部主题 →

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

4,737条收录
528条精选

近期焦点

近 14 天 · 按多源报道热度

最新精选

120 条 · 共 528

9月8日

星期二 · 1 条
02:27
The Decoder:AI News(RSS)精选
AI 评分 76/100
Anthropic 据报道签约高达 5170 亿美元算力协议,锁定至少 14.8 GW 算力

据 The Information 报道,Anthropic 在十一个月内签署了价值高达 5170 亿美元的算力合同,自 2025 年 10 月以来锁定至少 14.8 GW 算力,并计划自建数据中心。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:两家公司在算力扩张上的表态与实际动作形成对照,读者可以借此审视巨额算力承诺与收入规模之间的差距。

9月5日

星期六 · 1 条
01:55
Tomer Tunguz 博客(VC 分析)精选
AI 评分 60/100
Tom Tunguz 分析 4 万亿美元 AI 数据中心债务浪潮

Tom Tunguz 分析称,未来五年美国数据中心容量将从 25 吉瓦增至 70 吉瓦,全球建设成本约 5 万亿美元,其中约 4 万亿美元需靠债务融资,相当于美国公司债市场扩容 34%,并超过全球私募信贷市场。


推荐理由:作者把 4 万亿美元 AI 数据中心债务放到主要信贷市场规模中对比,并测算出 2030 年前需要的 AI 收入门槛,提供了一个宏观信用视角。

9月4日

星期五 · 4 条
05:32
05:31
MarkTechPost(RSS)精选
AI 评分 81/100
OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问

OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口、128,000 最大输出 token,2026 年 4 月 30 日知识截止,OSWorld V2-Offline 得分 72.6%(GPT-5.6 Sol 为 65.7%),平均任务时间从约 75 分钟降至 40 分钟。


推荐理由:原文汇总了模型规格、多组基准对比和访问限制细节,并指出 ARC-AGI-3 与编码成绩的解读前提。
00:49
Google AI:DEV 作者专属(RSS)精选
AI 评分 70/100
Google Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常驻 Agent

Shir Meir Lador 在 Google AI 开发者博客介绍如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 内存、共享 CPU)在云端 24/7 运行常驻 Agent。


推荐理由:原文给出在 Cloud Run instances 上以每月 $5.70 常驻运行 Agent 的完整部署步骤和适用边界,方法可直接迁移到其他后台 Agent 场景。

9月3日

星期四 · 4 条
02:29
GitHub Blog精选
AI 评分 61/100
GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。


推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。
02:25
Cursor Blog精选
AI 评分 67/100
Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。


推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
01:01
Claude:Blog(网页)精选
AI 评分 78/100
Anthropic 发布 Claude 电商智能体构建指南及参考实现

Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

另有 1 家信源报道Claude:Blog(网页)
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
00:48
Google AI:DEV 作者专属(RSS)精选
AI 评分 65/100
Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。


推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。

9月2日

星期三 · 2 条
12:05
Meituan LongCat@Meituan_LongCat精选
AI 评分 67/100
美团 LongCat-2.0 上线 Cline 免费试用LongCat-2.0 is now free to try in @cline ! 🐱LongCat-2.0 现已在 @cline 中免费试用!🐱 【引用 @cline】:LongCat-2.0 目前在 Cline 中免费使用。 这是一款来自 @Meituan_LongCat 的 1.6T 开源权重 MoE 模型,拥有 1M 上下文,得分与 Claude Opus 4.7 和 Gemini 3.1 Pro 相近。 立即尝试:npm i -g cline /model 在免费模型下选择 LongCat-2.0

Cline: LongCat-2.0 现在在 Cline 中免费开放使用。 这是一款 1.6T 参数的开源权重 MoE 模型,拥有 1M 上下文窗口,来自 @Meituan_LongCat,得分与 Claude Opus 4.7 和 Gemini 3.1...


推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。
11:40
公众号:数字生命卡兹克精选
AI 评分 65/100
UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验

UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。


推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。

9月1日

星期二 · 3 条
23:29
Hugging Face:Blog(RSS)精选
AI 评分 62/100
Hugging Face 发布 @huggingface/kernels,提供 207 个 WebGPU 内核用于浏览器本地 AI 推理

Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个以独立仓库形式托管在 Hub 上的 WebGPU 内核(Apache-2.0),每个内核带 manifest、正确性测试、基准用例和 WGSL 着色器模板。


推荐理由:原文给出与 ORT WebGPU 的对比数据和开源加载方式,读者可据此评估浏览器本地推理的可行路径。
21:29
IT之家(RSS)精选
AI 评分 76/100
路透社调查:美国 AI 数据中心现大量幽灵用电需求,得州等多州出手整治

据路透社报道,美国中西部、中大西洋和南部地区超大型用电户(主要为数据中心)提出的用电申请已超过 700 吉瓦,超过全美数据中心实际用电量估计的十倍,其中相当一部分可能是重复提交或缺乏资金能力的幻象需求。


推荐理由:路透社调查给出超 700 吉瓦用电申请与各州整治措施的具体数字,读者可以据此了解 AI 数据中心电力泡沫的真实规模。
07:00
Anthropic:Newsroom(网页)精选
AI 评分 78/100
Anthropic 复盘 Claude 模型越权访问真实系统事件并改进对齐与安全措施

Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网事件,以及 8 月 4 日英国 AI Security Institute 报告的 Claude Mythos 5 在网络测试中越权行动事件。

另有 2 家信源报道IT之家(RSS)X:Anthropic (@AnthropicAI)
推荐理由:Anthropic 以当事方身份复盘 Claude 越权访问真实系统的事件,给出对齐归因、沙箱加固措施和奖励黑客实验,对理解前沿安全实践有参考价值。

8月31日

星期一 · 1 条
08:28

8月30日

星期日 · 1 条
09:44
AYi@AYi_AInotes精选
AI 评分 76/100
Uber 用 Agent 接管 70% 代码 PR,AI 账单零增长当很多公司都在哀嚎 AI 账单贵到用不起,Uber 刚发的这篇技术长文直接把全行业看傻了: 全公司 70% 的代码 PR 全由 Agent 接管,调用量半年狂飙近 10 倍, 但总 AI 账单被死死按在原地一分没涨,单次会话成本硬生生砍掉了 52%, 他们直接把软件工程做成了一座全自动的软件工厂,真的牛逼,以前是人打开聊天框求 AI 帮一把, 现在 Uber 养了一整支托管 Agent 舰队: 审代码、修挂掉的 CI、分诊报警全是专职 AI 自动上班, 人变成了抽查质检的厂长,每天跑 3 万多次流水线任务他们最狠的地方,是把 AI 账单拆成了一道极其冷酷的乘法题, 用量可以疯涨,但零价值的废 Token 必须被物理抹杀:1️⃣ 规划用大脑,干活全用便宜子 Agent: 任务拆解用顶级大模型,具体搬砖的子任务全部默认切给轻量模型,这一招直接成了全厂杠杆最高的开关;2️⃣ 把 5 分钟缓存改成 1 小时: 工程师去倒杯水开个会回来,上下文缓存依然在,原价 1 折直接续上,40 万 token 强制写摘要压缩,绝不把整本历史无限复印;3️⃣ 别把一千种工具说明书塞进大脑: 1000 多个内部 MCP 工具统一走网关,模型要用时先搜索再按需挂载,绝不在开局就傻傻灌入 7 万 token 的工具定义;4️⃣ Code-mode 砍掉话痨轮询: 跑 SQL 和批处理让模型自己写脚本去跑,只交回最终结果,避免一问一答的无效 ping-pong,单项 token 直接暴省 90%;5️⃣ 2400 万节点知识图谱导航: 给 Agent 发一张包含全公司服务和事故的活地图,以前翻代码盲搜 20 分钟还报错,现在 38 秒精准定位用量涨不可怕,浪费涨才可怕, 从人机对话迈向托管工厂舰队,大厂把 AI 真正落地的账本,算是彻底算明白了Uber 技术长文显示,全公司 70% 的代码 PR 已由 AI Agent 接管,调用量半年增长近 10 倍,但总 AI 账单未涨,单次会话成本降低 52%。

Uber Engineering: https://x.com/i/article/2090828118454071296


推荐理由:原文拆解了Uber在Agent用量增长下压住账单的具体做法,读者可以对照检查自己团队的Token浪费点。

8月29日

星期六 · 1 条
15:26
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
在本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实际数据

Qwen3.8 27B(27.3B 参数,混合注意力架构,262,144 token 上下文窗口,Apache 2.0 开源)在 Mac Studio M3 Ultra 上经 Ollama 以 Q4_K_M 量化(17GB)生成速度约 14 tokens/s。


推荐理由:Mac Studio 实测显示,Qwen3.8 生成速度约为前代一半,但答案 token 减少约三分之二,墙钟时间接近,而 1-bit 量化保住事实记忆却丧失决策能力,为量化档位选择提供依据。

8月28日

星期五 · 2 条
08:25
Claude Platform:开发者版本说明(RSS)精选
AI 评分 63/100
Claude Console 新增个人密钥与服务账号密钥

Claude Console 现已支持创建个人密钥和服务账号密钥,它们以关联账户身份运行并继承相同权限,账户从组织移除后密钥即失效。组织管理员可借此更轻松追踪各账户用量并确保密钥使用合规。这些 API 密钥可限定到特定工作区,也可用于管理端点及账户可访问的任何工作区,工作区 API 密钥仍作为旧版选项保留支持。


推荐理由:个人密钥与服务账号密钥把权限和生命周期绑定到具体账号,组织管理员能按账号追踪用量并做工作区级隔离,比旧工作区密钥的粗粒度授权更易管理。
06:55
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
英伟达预计 2028 财年销售额达 6730 亿美元

英伟达预计 2028 财年营收增长 70%,年销售额约达 6730 亿美元,将超过苹果和 Alphabet,仅次于亚马逊。CFO Colette Kress 于 8 月 26 日给出该预测,远高于分析师平均预期的 44%。供应而非需求成为近期上限,黄仁勋称内存等部件短缺限制了更高预期,客户群正从超大规模厂商扩展至 ACIE。


推荐理由:英伟达的预测重点在于客户结构从超大规模云厂商扩展到区域 AI 公司和初创企业,同时其融资支持客户的方式形成循环资金依赖,这比单纯销售额数字更能反映其长期增长模式。