Topic · 主题全部主题 →

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

4,760条收录
532条精选

精选归档 · 第 25 页

481500 条 · 共 532

2月26日2月26日周四

星期四 · 1 条
08:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 86/100
Ling 2.5 Lightning Attention+MLA 混合线性架构改造实践

为提升超长上下文下的计算效率,Ling 2.5架构将Ling 2.0的GQA改造为1:7的Lightning Attention与MLA混合线性注意力。此举旨在利用Lightning Attention提升长序列吞吐,并通过MLA极致压缩KV Cache。为确保改造后性能无损,团队设计了精细的平滑迁移训练策略,包括权重转换、QK Norm融合与Partial RoPE改造等多阶段加训。Scaling Law实验确定了1:7为最优混合比例,最终使万亿参数模型实现了更低的计算成本与更高的长文本推理效率。

另有 1 家信源报道蚂蚁百灵:Developer Blog(网页)
推荐理由:为大模型长上下文优化提供可落地的工程实践参考。

2月22日2月22日周日

星期日 · 1 条
00:00
智谱:研究(网页内嵌数据)精选
GLM-5技术报告

GLM-5参数规模达7440亿,训练Token 28.5万亿。核心创新包括DSA稀疏注意力机制降低算力开销,异步RL基础设施与异步Agent RL算法提升长周期交互与自主决策能力。全面原生适配华为昇腾、寒武纪等七大国产芯片平台,通过W4A8混合精度量化与定制融合算子实现高效部署。模型支持复杂软件工程、终端操作、PPT生成等长程Agent任务,提供交错思考、保留思考等多种推理模式。


推荐理由:智谱发布744B参数GLM-5,全面适配七大国产芯片平台,Agent与编码能力突出

2月19日2月19日周四

星期四 · 1 条
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 60/100
Claude API 推出自动缓存功能,并退役 Sonnet 3.7 与 Haiku 3.5 模型

Claude Messages API 新增自动缓存功能,只需在请求体中添加 cache_control 字段,系统即可自动缓存最后一个可缓存块,无需手动管理断点,并可与现有块级缓存配合使用。


推荐理由:自动缓存把提示缓存从手工档变成自动档,对 Messages API 高频场景的开发者是个实在的省心更新,模型退役通知则是硬切换信号,用旧模型的该迁移了。

2月18日2月18日周三

星期三 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 78/100
使用 Gradio 的 gr.HTML 组件一键构建任意 Web 应用

Gradio 的 gr.HTML 组件允许开发者通过单一 Python 文件快速构建和部署交互式 Web 应用,无需构建步骤。它通过 html、css 和 js_on_load 三个模板,将 Python 状态注入前端并实现与 JavaScript 的双向同步。应用示例涵盖生产力工具(如像素艺术番茄钟)、商业应用(如可拖拽看板)、创意组件(如抽奖转盘)以及专业的 ML 应用(如目标检测查看器)。组件可子类化复用,并能直接集成到模型流水线中,借助快速重载模式,从构思到部署仅需数秒。


推荐理由:ML 开发者可快速构建自定义 Web 应用,单文件部署,无需前端经验。

2月11日2月11日周三

星期三 · 3 条
18:55
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 61/100
inclusionAI 发布高性能量化推理 GEMM 内核库 Humming

inclusionAI 开源了 Humming,这是一个专为量化推理设计的高性能、轻量级即时编译 GEMM 内核库。它支持在 FP16、BF16、FP8 等多种激活数据类型下进行 8 比特以下任意权重类型的推理,兼容多种量化策略与缩放类型,并同时支持稠密 GEMM 和混合专家 GEMM 运算。该库兼容 SM75+ 及以上的所有 NVIDIA GPU,在多种计算场景下能提供业界领先的吞吐量和效率。其依赖极简,仅需 PyTorch 和 NVCC,软件包大小仅约 100 KB,便于超轻量化部署。


推荐理由:蚂蚁 inclusionAI 开源了一个 100KB 级的量化 GEMM 库,支持从 INT1 到 FP8 全家桶,SM75+ 全覆盖,做推理部署的工程师值得花半小时跑一下 benchmark,看看能不能替换掉现有的 Marlin 方案。
18:52
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 65/100
inclusionAI发布新一代即时大模型Ling-2.5-1T

inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合“正确性”与“过程冗余”的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先的开源性能。


推荐理由:蚂蚁把 1T 参数的即时模型开源了,63B 活跃参数加 1M 上下文,主打效率而非堆算力,对国内做开源推理模型的团队来说是个值得对标的基线。
18:52
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 78/100
inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T

inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。


推荐理由:蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。

2月9日2月9日周一

星期一 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 76/100
Transformers.js v4:现已在 NPM 上发布!

Transformers.js 发布第四个主要版本 v4,该版本现已通过 NPM 包管理器提供。这一更新延续了项目通过开源与开放科学推动人工智能技术进步与普及的使命,使开发者能够更便捷地获取并在项目中集成这一机器学习库。


推荐理由:浏览器和 Node.js 直接跑 HF 模型的大版本升级,前端开发者可零门槛接入 AI

2月6日2月6日周五

星期五 · 1 条
00:45
Dwarkesh Patel:Podcast & Blog(RSS)精选
埃隆·马斯克--「36个月内,部署AI最便宜的地方将是太空」

埃隆·马斯克预测,36个月后太空将成为部署人工智能成本最低的地点。他指出,长期专注于软件领域的从业者即将面临硬件层面的严峻挑战。这一判断暗示,随着AI算力需求爆发式增长,地面数据中心的能源消耗与散热限制将推高计算成本,而太空环境凭借丰富的太阳能和天然散热优势,可能在未来三年内成为AI基础设施部署的更经济选择。


推荐理由:Musk预判三年内太空将成为AI算力最优解,软件工程师需直面硬件物理约束

1月30日1月30日周五

星期五 · 1 条
15:55
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 61/100
高效离线推理框架 Flood:吞吐量显著领先,支持多模态与量化

Flood 是一款面向离线应用的高效大语言模型推理框架。它采用流水线并行降低通信开销,并通过分段式KV缓存管理提升连续性。框架支持连续批处理、分块预填充、FP8/INT8量化及多模态模型推理。性能测试表明,其在多种模型和硬件上的吞吐量最高可达 vLLM 的 2.4 倍。其专用内核 SegmentAttention 在处理长序列时,解码速度较 FlashAttention 最高提升 3.16 倍。该项目于 2025 年 3 月开源并快速迭代,已支持前瞻解码等新特性。


推荐理由:蚂蚁的 FLOOD 框架用流水线并行替代张量并行来压通信开销,实测吞吐比 vLLM 高 1.4 到 2.4 倍,做离线推理部署的团队值得花半小时跑一下 benchmark 看看自家场景能不能吃这个红利。

1月29日1月29日周四

星期四 · 1 条
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 67/100
Claude API 结构化输出功能正式上线

Claude API 结构化输出功能现已对 Claude Sonnet 4.5、Claude Opus 4.5 和 Claude Haiku 4.5 全面开放。GA 版本扩展了 schema 支持、改进了语法编译延迟,并简化了集成路径(无需 beta header)。该功能在 Amazon Bedrock 和 Microsoft Foundry 上仍为公开 beta。


推荐理由:结构化输出终于 GA,去掉了 beta 的不确定性,对依赖 JSON 模式的生产应用是个好消息,但功能上不算重大突破,只是工程完善。

1月22日1月22日周四

星期四 · 1 条
00:00
Moonshot AI:Kimi Blog精选
Kimi 供应商验证器

Kimi 发布 K2.5 模型时开源 Kimi Vendor Verifier(KVV),用于验证第三方推理实现的准确性。针对开源模型部署渠道多样化导致的质量失控问题,KVV 提供六项关键基准测试,覆盖参数约束验证、多模态流水线、长输出压力测试、工具调用一致性及编程能力评估。项目与 vLLM/SGLang 社区合作修复根因,并提供预发布验证和实时更新的公开排行榜。完整评估在双 H20 8 卡服务器上约需 15 小时。


推荐理由:Kimi开源Vendor Verifier,系统性解决开源模型第三方部署质量验证难题

1月14日1月14日周三

星期三 · 1 条
00:00
智谱:研究(网页内嵌数据)精选
智谱联合华为开源首个国产芯片训练的多模态SOTA模型

智谱联合华为开源多模态生成模型GLM-Image,为首款基于国产昇腾芯片与MindSpore框架全流程训练的SOTA模型。采用9B自回归与7B扩散解码器混合架构,在CVTG-2K复杂视觉文字生成和LongText-Bench长文本渲染榜单均位列开源第一,支持1024×1024至2048×2048多分辨率生成。API调用成本0.1元/张,代码已开源至GitHub、Hugging Face及魔搭社区。


推荐理由:首个国产昇腾芯片训练的SOTA多模态模型开源,文字渲染能力开源第一,生成一张图仅需0.1元

12月30日12月30日周二

星期二 · 1 条
08:00
xAI:News(网页)精选
xAI推出Grok Business与Enterprise企业版

xAI发布Grok Business和Grok Enterprise企业版。Business版定价30美元/座位/月,支持自助开通,提供团队管理、统一账单及Google Drive集成(保留原文件权限),并承诺用户数据永不用于模型训练。Enterprise版面向大型组织,提供Custom SSO、Directory Sync及高级审计控制;可选的Enterprise Vault插件提供独立数据平面与客户自管加密密钥(CMEK),实现应用级加密隔离。平台支持实时使用监控、安全对话共享及Projects功能。


推荐理由:xAI 推出 Grok 企业版,主打隐私保护与 Agent 能力,月费 30 美元起

12月22日12月22日周一

星期一 · 1 条
08:00
xAI:News(网页)精选
以 AI 支持 DOW 的使命

xAI 被美国战争部(DOW)选中,为其 GenAI.Mil 套件提供 Frontier AI 系统。基于 Grok 模型的解决方案将覆盖 DOW 旗下 300 万军事和文职人员,支持 Impact Level 5(IL5)级别的企业 AI 和关键任务用例,可嵌入从五角大楼到战术边缘的日常工作流,并支持机密作战工作负载。DOW 用户还可独家获取 X 平台实时全球洞察。

另有 1 家信源报道xAI:News(网页)
推荐理由:xAI获美国国防部大单,Grok将覆盖300万军事人员并提供实时情报支持

12月18日12月18日周四

星期四 · 2 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 57/100
OpenRouter 推出 Response Healing:将 JSON 缺陷减少 80% 以上

OpenRouter 推出 Response Healing 新功能,可在响应到达应用前自动修复大语言模型产生的格式错误的 JSON,从而将 JSON 缺陷减少 80% 以上。


推荐理由:如果你无数次被 LLM 返回的残缺 JSON 搞到崩溃,OpenRouter 这个 response healing 能自动修复 80% 的缺陷,以后 debug 可以少肝半小时。
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 61/100
Response Healing:将 JSON 缺陷减少 80% 以上

OpenRouter 推出新功能 Response Healing,可在 LLM 生成的畸形 JSON 响应抵达用户应用前自动修复。该功能旨在将 JSON 格式错误减少超过 80%,直接提升 API 响应的结构完整性与可靠性,减少下游应用的处理负担。


推荐理由:做 Agent 的人最怕 JSON 解析炸掉整个 pipeline,OpenRouter 这个 Response Healing 相当于在网关层加了自动纠错,接入成本几乎为零,值得试试。

12月17日12月17日周三

星期三 · 1 条
19:58

12月11日12月11日周四

星期四 · 1 条
23:47
Hugging Face:Blog(RSS)精选
AI 评分 76/100
llama.cpp 服务器新增多模型管理功能

llama.cpp 服务器新增了类似 Ollama 的多模型管理功能。该功能采用多进程架构,每个模型独立运行,确保单个模型崩溃不影响其他服务。系统支持自动发现本地 GGUF 模型文件、按需加载,并默认采用 LRU 机制管理最多同时加载4个模型。用户可通过请求中的模型字段路由到特定模型,并可使用 API 进行加载、卸载和列表查看。所有加载的模型可继承路由器的统一设置,也支持通过预设文件为每个模型单独配置参数。内置 Web UI 同样支持模型切换。


推荐理由:本地跑模型终于能像 Ollama 一样热切换,开发调试效率大幅提升

12月5日12月5日周五

星期五 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 76/100
介绍 swift-huggingface:完整的 Hugging Face Swift 客户端

swift-huggingface 是一个全新的 Swift 客户端,旨在彻底解决旧库下载模型缓慢、不可靠且不支持断点续传的问题。它提供完整的 Hub API 覆盖,核心改进包括具备进度跟踪和断点续传的可靠下载、与 Python 生态共享缓存以避免重复下载,以及通过灵活的 TokenProvider 模式简化身份验证。该库现已独立发布,并将很快集成到 swift-transformers 中取代原有实现,未来还将支持 Xet 存储后端以实现更快的下载。


推荐理由:Swift 开发者可无缝集成 Hugging Face 模型,下载更可靠且与 Python 共享缓存。