精选归档 · 第 8 页

141160 条 · 共 631

7月28日7月28日周二

星期二 · 3 条
08:55
OpenRouter:Announcements(RSS)精选
AI 评分 65/100
如何评估不同 LLM 提供商在延迟、吞吐量和正常运行时间上的性能

同一模型在不同提供商端点上的表现因基础设施、量化、负载处理和路由默认设置而异。评估需测量延迟、吞吐量、正常运行时间和精度,并将测量结果转化为路由策略。


推荐理由:做 LLM 路由的开发者必读,OpenRouter 给出了衡量延迟、吞吐和精度的实操框架,把选型从 benchmark 转向真实性能,生产环境可以直接落地试。
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 66/100
AI Harness 对性能的影响超过模型本身:GPT-5.5 与 Opus 4.7 在第三方工具中得分更高

Endor Labs 测试显示,同一模型在不同 harness 中性能差异巨大:GPT-5.5 在 Cursor 中功能正确率 87.2%,远超其在 Codex 原生环境中的 61.5%;Opus 4.7 在 Cursor 中得分 91.1%,高于 Claude Code 的 87.2%。Harness 决定发送的上下文与缓存策略,智能缓存可节省 40-80% 成本并提速 13-31%。


推荐理由:作者引用同一模型在不同 harness 下的分数差与缓存研究,说明 harness 而非模型决定成本和表现,读者可借此审视自己的工具链选择。
00:00
Liquid AI 模型与工程博客(网页)精选
AI 评分 65/100
Liquid AI 发布 LFM2.5-Encoder-230M 与 350M 双向编码器,长上下文下 CPU 推理最快

Liquid AI 发布 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M 两个基于 LFM2 混合架构的双向编码器,支持 8,192 token 上下文,已在 Hugging Face 开放下载。


推荐理由:原文给出双向编码器的架构改动、17 项任务微调评测和长上下文 CPU 吞吐对比,读者可以据此评估其在边缘和本地部署中的适用性。

7月27日7月27日周一

星期一 · 3 条
15:51
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 64/100
当编码不再是瓶颈:Berkeley RDI 提出软件自主开发三级框架

Berkeley RDI等机构提出三级软件自主开发框架:代码自主(AI完成设计与实现,人类决定构建内容并审核PR)、流水线自主(AI运行从设计到部署的全流程,人类仅评估结果)、需求自主(AI自主决定构建内容)。该框架旨在为能力声明、部署选择与问责提供清晰分类。


推荐理由:Berkeley团队提出软件自主开发三层框架,把模糊的“自主编程”拆成清晰阶梯,关键不在能力而在责任转移,开发团队该看看自己到了哪一级。
08:00
vLLM 官方博客(RSS)精选
AI 评分 74/100
vLLM 发布 Kimi K3 Day-0 支持:2.8T 混合 MoE 的部署指南与性能数据

vLLM 官方宣布 Day-0 支持 Kimi K3,这是一个 2.8 万亿参数的 MoE 模型(每 token 激活 896 专家中的 16 个),基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口和原生视觉。


推荐理由:vLLM 团队亲述 Day-0 支持 Kimi K3 的工程细节与部署配方,读者可以据此判断混合线性注意力模型在实际服务中的可行路径。

7月26日7月26日周日

星期日 · 2 条
14:11
Google AI:DEV 作者专属(RSS)精选
AI 评分 68/100
Gemini 3.6 Flash 登陆 Google Cloud 数据库:更快更便宜

Google Cloud 数据库现已支持 Gemini 3.6 Flash,该模型知识截止日期约为今年 3 月底,且成本更低。在 Cloud SQL for Postgres 的基准测试中,Gemini 3.6 Flash 平均延迟 3694.53ms,快于 Gemini 3.5 Flash 的 4918.86ms;在 AlloyDB 中两者响应时间几乎相同。


推荐理由:在Cloud SQL和AlloyDB环境中的实测表明,Gemini 3.5 Flash Lite以7倍速度与接近满分质量,为简单任务提供了更经济的选项,但样本量小且评判模型自带偏好,结论需谨慎采纳。
00:00
Fireworks AI(网页)精选
AI 评分 61/100
Fireworks 发布 Fireworks Nexus:为工程团队提供可路由的开源模型智能层

Fireworks 发布 Fireworks Nexus,将开发者现有 AI 工具接入由开源权重模型(如 Kimi-K3、GLM-5.2)组成的托管层,提供企业级成本管控、FireConnect 一行安装接入和基于难度的智能路由。


推荐理由:原文给出具体组件、开源入口和第三方评测数字,读者可对照自己的工程负载估算替换成本收益。

7月25日7月25日周六

星期六 · 1 条
01:25
Claude:Blog(网页)精选
AI 评分 65/100
Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%

Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。


推荐理由:Anthropic 官方首次分享他们为 Claude 5 代模型移除了 Claude Code 80% 系统提示的实践,五条新规则颠覆了旧有的提示工程常识,每个用 Claude Code 或自建 agent 的开发者都该对照看看自己的系统提示是否在「过度约束」模型。

7月24日7月24日周五

星期五 · 4 条
20:54
OpenRouter:Announcements(RSS)精选
AI 评分 62/100
OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属

OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。


推荐理由:OpenRouter推出分类器功能,允许按任务类型、部门等维度对API调用自动打标并归因成本,适合需要审计agent开销的团队。模板和采样率设计让落地门槛很低。
17:54
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 79/100
Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用

Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。


推荐理由:一个小工具解决了一个被忽视的成本黑洞,Claude Code 的缓存过期,作者自己测了 185 个会话,省下 22% 费用,对于把 Claude 当开发助手的团队来说是个必装工具。
04:03
Runway:News(网页)精选
AI 评分 69/100
Runway 推出 Media Router,首个面向生成式媒体的偏好优化路由模型

Runway 发布 Media Router,这是首个为生成式媒体模型设计的模型路由器,已集成至 Runway Dev 平台。该路由器可根据用户设定的成本、质量和延迟偏好,自动为每次视频、图像或音频生成请求选择最优模型,支持 Gen-4.5、Seedance、GPT Image 2 等第一方及第三方模型。用户只需配置一次偏好并调用单一端点,即可避免手动选型与持续更新代码的麻烦。


推荐理由:Runway Dev 首次把智能路由引入生成媒体,开发者不用再手工选模型,跑量时成本与延迟优势明显,但这是平台内生态能力,对非 Runway 用户意义不大。
00:55
Satya Nadella@satyanadella精选
AI 评分 65/100
微软MAI模型:以更低成本实现前沿能力规模化http://x.com/i/article/2080328073724260352Frontier Diffusion & ControlIn a world where software has real marginal cost for the first time, how do we ensure frontier benefits are diffused across the entire ecosystem?The key is to optimize the cost-to-outcome frontier in real world context. In practical terms, that means using the right model for each task, and optimizing the context, skills, tools, and agent harness around it.This is the motivation behind our MAI model family. These models have been built ground up with clean data lineage and optimized for learning transfer from generalist to specialized skills in enterprise RLEs. We continue to make rapid progress in this pursuit.We can now take saturated frontier capabilities and deliver them at scale and at lower cost through models optimized for high-usage products, while continuing to use frontier models for frontier needs. We are proving this out across our first party products, and thereby creating a template for every other AI native, SaaS, or Enterprise company out there.In our products, frontier models from OpenAI and Anthropic are part of the orchestration system alongside MAI. But the model is only one part of the hill-climbing system. Harness, memory, context, tools, skills, user interactions, etc. all shape the evals and performance of these agentic systems.The other key criteria to ensure that you are in control, is your evals should continue to hill climb even when any given model has been removed. Therefore we build RLEs where models learn inside the product system and are rewarded for completing the tasks customers actually care about. We train models against the actual product harness, interactions, and outcomes they will encounter. And strategically ensure that the harness, memory, context, skills are externalized outside of the model.Product-specific evals and model independence give us the control and a direct hill to climb, and to keep refining until we reach the right quality-cost target. We are now seeing MAI models outperform general-purpose frontier models in many use cases while using a fraction of the tokens.We believe the biggest opportunity is to optimize all of these layers together in the products where the world works every day. And we are beginning to route traffic across our first-party surfaces to MAI whenever our models match or outperform frontier alternatives.We are seeing promising early results across GitHub Copilot, Excel, and Outlook and are beginning to take the same approach across Copilot Chat, PowerPoint, and more. And all these results will only get better as the entire system keeps hill-climbing!What we are doing across our first party products is also what every enterprise customer can be doing in their real world agentic systems with their proprietary evals, their proprietary RLEs, workflows, and context. We are making all this available as part of Foundry and our toolchain.Read more here: https://microsoft.ai/news/hill-climbing-mai-models-for-github-copilot-and-excel/微软CEO Satya Nadella详解MAI模型家族战略:通过优化成本-效果前沿,MAI模型在GitHub Copilot、Excel等产品中已用更少token超越通用前沿模型。核心是构建独立于模型的评估系统,让模型在产品真实环境中学习并完成用户关心的任务。微软正将这一模板通过Foundry平台开放给企业客户。
推荐理由:微软CEO详细阐述MAI模型战略,从通用模型转向产品内优化,透露GitHub Copilot和Excel已开始路由流量到MAI,对微软生态开发者和企业是个风向标。

7月23日7月23日周四

星期四 · 7 条
19:11
Google AI:DEV 作者专属(RSS)精选
AI 评分 61/100
Google Cloud Agent Skills 完整指南:从基础到高级云运维

Google Cloud 推出官方 Agent Skills 开源指令集,旨在让 AI 编码智能体安全、高效地执行多步骤云操作。该仓库基于 agentskills.io 开放标准,目前收录 70 多项技能,涵盖安全审计、无服务器部署、BigQuery 优化等 8 个类别。技能采用渐进式披露模型,通过验证工作流、安全门控和上下文感知机制,防止智能体盲目执行破坏性命令。


推荐理由:这是 Google Cloud Skills 系列教程第一篇,从安装到触发讲得很细,把 Agent Skills 的“渐进式披露”和安全门机制都拆解了,适合想让 AI 编码代理帮你管云资源的开发者。
17:25
Google AI:DEV 作者专属(RSS)精选
AI 评分 73/100
Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。


推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。
13:20
公众号:数字生命卡兹克精选
AI 评分 66/100
北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策

北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。


推荐理由:这份政策把 Agent 时代的核心概念全部写进了红头文件,Harness Engineering、Token 经济、OPC 等首次在官方文件中出现,意味着智能体正式进入政策加速期,每个 AI 从业者都该读一遍。
12:00
公众号:小红书技术(dots.llm)精选
AI 评分 83/100
小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施

小红书引擎架构团队在 OSDI 2026 发表论文,提出面向全闪存的高性能向量近似最近邻检索系统 HELMSMAN。该系统通过 ANNS 定制化存储栈、分层学习式搜索剪枝及 GPU 加速构建流水线,将向量检索服务迁移至 NVMe SSD 阵列。


推荐理由:在保持毫秒级在线延迟的前提下,将百亿向量检索从海量DRAM迁移到NVMe SSD阵列,为推荐与搜索系统提供了成本下降超90%的生产验证方案。
08:00
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 61/100
OpenRouter 上的"AI 超市"效应:GPT-OSS 120b 流量达 Opus 4.8 的 36%,模型市场加速分层

OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。


推荐理由:Tomer用OpenRouter数据和自己的本地实验,把模型市场细分讲得很清楚,对选型有直接参考价值,做本地agent的可以看看他换掉Gemma的理由。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
Agentic Context Management:将智能体记忆与成本问题重构为生命周期与架构挑战

论文提出 Agentic Context Management(ACM)框架,将智能体上下文管理从存储问题重新定义为包含架构、摄取、范围界定、预判、压缩与整合五个原语的生命周期管理。


推荐理由:这篇论文把代理记忆从‘存什么’重新表述为‘管什么’的生命周期问题,五个原语和线性成本论证,对做生产级代理的团队有直接的架构启发。