同一模型在不同提供商端点上的表现因基础设施、量化、负载处理和路由默认设置而异。评估需测量延迟、吞吐量、正常运行时间和精度,并将测量结果转化为路由策略。
部署工程
精选归档 · 第 8 页
第 141–160 条 · 共 631 条
7月28日
Endor Labs 测试显示,同一模型在不同 harness 中性能差异巨大:GPT-5.5 在 Cursor 中功能正确率 87.2%,远超其在 Codex 原生环境中的 61.5%;Opus 4.7 在 Cursor 中得分 91.1%,高于 Claude Code 的 87.2%。Harness 决定发送的上下文与缓存策略,智能缓存可节省 40-80% 成本并提速 13-31%。
Liquid AI 发布 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M 两个基于 LFM2 混合架构的双向编码器,支持 8,192 token 上下文,已在 Hugging Face 开放下载。
7月27日
Berkeley RDI等机构提出三级软件自主开发框架:代码自主(AI完成设计与实现,人类决定构建内容并审核PR)、流水线自主(AI运行从设计到部署的全流程,人类仅评估结果)、需求自主(AI自主决定构建内容)。该框架旨在为能力声明、部署选择与问责提供清晰分类。
vLLM 官方宣布 Day-0 支持 Kimi K3,这是一个 2.8 万亿参数的 MoE 模型(每 token 激活 896 专家中的 16 个),基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口和原生视觉。
7月26日
Google Cloud 数据库现已支持 Gemini 3.6 Flash,该模型知识截止日期约为今年 3 月底,且成本更低。在 Cloud SQL for Postgres 的基准测试中,Gemini 3.6 Flash 平均延迟 3694.53ms,快于 Gemini 3.5 Flash 的 4918.86ms;在 AlloyDB 中两者响应时间几乎相同。
Fireworks 发布 Fireworks Nexus,将开发者现有 AI 工具接入由开源权重模型(如 Kimi-K3、GLM-5.2)组成的托管层,提供企业级成本管控、FireConnect 一行安装接入和基于难度的智能路由。
7月25日
Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。
7月24日
OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。
Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。
Runway 发布 Media Router,这是首个为生成式媒体模型设计的模型路由器,已集成至 Runway Dev 平台。该路由器可根据用户设定的成本、质量和延迟偏好,自动为每次视频、图像或音频生成请求选择最优模型,支持 Gen-4.5、Seedance、GPT Image 2 等第一方及第三方模型。用户只需配置一次偏好并调用单一端点,即可避免手动选型与持续更新代码的麻烦。
7月23日
Google Cloud 推出官方 Agent Skills 开源指令集,旨在让 AI 编码智能体安全、高效地执行多步骤云操作。该仓库基于 agentskills.io 开放标准,目前收录 70 多项技能,涵盖安全审计、无服务器部署、BigQuery 优化等 8 个类别。技能采用渐进式披露模型,通过验证工作流、安全门控和上下文感知机制,防止智能体盲目执行破坏性命令。
Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。
北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。
小红书引擎架构团队在 OSDI 2026 发表论文,提出面向全闪存的高性能向量近似最近邻检索系统 HELMSMAN。该系统通过 ANNS 定制化存储栈、分层学习式搜索剪枝及 GPU 加速构建流水线,将向量检索服务迁移至 NVMe SSD 阵列。
OpenRouter 上的 AI 模型市场已高度细分,OpenAI 一年前的开源模型 GPT-OSS 120b 流量达到 Anthropic Opus 4.8 的 36%。
OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。
论文提出 Agentic Context Management(ACM)框架,将智能体上下文管理从存储问题重新定义为包含架构、摄取、范围界定、预判、压缩与整合五个原语的生命周期管理。