Topic · 主题全部主题 →

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

4,759条收录
530条精选

精选归档 · 第 7 页

121140 条 · 共 530

7月23日7月23日周四

星期四 · 1 条
03:23
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。


推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。

7月22日7月22日周三

星期三 · 5 条
22:49
IT之家(RSS)精选
AI 评分 75/100
OpenAI 拟投资 200 亿美元在美新建数据中心,2030 年算力支出预期上调至近 7500 亿美元

OpenAI 计划在佐治亚州萨凡纳附近建设一座超大规模数据中心,承诺投资 200 亿美元,并已争取到 3.2 吉瓦的能源。该项目预计从 2028 年起部分电力投入使用,满负荷时总成本可能超过 300 亿美元。同时,OpenAI 将截至 2030 年的预计算力支出上调至近 7500 亿美元,高于此前约 6000 亿美元的预期。

另有 2 家信源报道TechCrunch:AI(RSS)IT之家(RSS)
推荐理由:OpenAI 把未来算力赌注押到了 7500 亿美元,佐治亚数据中心只是冰山一角,做基础设施的同行得重新算账了。
22:25
SemiAnalysis@SemiAnalysis_精选
AI 评分 76/100
AMD 投资 50 亿,Anthropic 采购 2GW GPUAMD HAS JUST ANNOUNCED AN ANTHROPIC DEAL WHERE THEY ARE INVESTING UP TO 5 BILLION IN EXCHANGE FOR ANTHROPIC BUYING 2 GW OF AMD MI455 UALOE72 AND FUTURE GPUS. 🚨 This is similar to what we said about Anthropic three days ago.AMD 刚刚宣布与 Anthropic 达成协议,将投资高达 50 亿美元,换取 Anthropic 采购 2GW 的 AMD MI455 UALOE72 及未来 GPU。🚨 这与我们三天前关于 Anthropic 的说法一致。

SemiAnalysis: ANTHROPIC 将成为 AMD 客户,据 AMD AI 高级总监的公开 GitHub 显示 🚨🚨 我们在下方解释该 GitHub 代码及其细节👇️ 1/4🧵


推荐理由:AMD 用 50 亿美金投资换来 Anthropic 的巨量 GPU 订单,这是非 NVIDIA 生态一次真正有分量的突破,做硬件和云服务的值得深挖。
18:10
公众号:小红书技术(dots.llm)精选
AI 评分 62/100
小红书开源 BigMac:多模态大模型训练新范式

小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。

另有 1 家信源报道公众号:小红书技术(dots.llm)
推荐理由:过去多模态训练要么废显存要么慢到崩溃,BigMac 用“嵌套流水线”破掉了这个帕累托前沿,做多模态大模型且被训练效率卡住的团队值得动手试一下。
13:53
OpenRouter:Announcements(RSS)精选
AI 评分 72/100
OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型

OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。


推荐理由:OpenRouter 把语音转录集成进 API,一份 key 搞定聊天和转写,对已经在用的团队省心不少,这篇教程直接可跑。
01:52
OpenRouter:Announcements(RSS)精选
AI 评分 69/100
OpenRouter 推出 Prompt Caching + Sticky Routing,降低多轮 Agent 调用成本

OpenRouter 通过 Prompt Caching 与 Sticky Routing 降低多轮 Agent 的 token 成本。缓存读取价格仅为正常输入的 0.1x-0.5x,其中 Claude Sonnet 4.6 缓存读取为 $0.30/M(正常 $3.00/M)。


推荐理由:Prompt caching 不是新概念,但 OpenRouter 把成本算得明明白白,sticky routing 配合 session_id 解决了缓存漂移的痛点,做 agent 的人该抄作业。

7月21日7月21日周二

星期二 · 1 条
00:19
Replit ⠕@Replit精选
AI 评分 65/100
Replit 新统一工具栏集成数据库与双因素认证Need a database? Two-factor auth? An SEO scanner?Everything your project needs is now in reach with our new unified toolbar.需要数据库?双因素认证?SEO 扫描器? 你的项目所需的一切现在都可以通过我们新的统一工具栏触手可及。

推荐理由:Replit 把数据库、2FA 和 SEO 扫描都塞进一个工具栏,对用它快速出活的开发者是实打实的效率提升,但也就是一次整齐的功能聚合,算不上行业事件。

7月20日7月20日周一

星期一 · 4 条
16:10
公众号:小红书技术(dots.llm)精选
AI 评分 68/100
小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。


推荐理由:MoE 训练推理的负载不均是个老痛点,UltraEP 用实时复制热专家的方式把 GPU 利用率拉到 94% 的理想线,代码和论文都开源了,做大规模分布式训练的团队可以直接参考。
16:01
公众号:小红书技术(dots.llm)精选
AI 评分 76/100
小红书、北大开源 UltraEP:面向大规模 MoE 训推的「最优」负载均衡方案

小红书与北大开源 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家,平均达到理想性能的 94.3%,相比业界 SOTA 训推框架提升 1.49 倍。该方案已在 288B 参数 MoE 模型的完整预训练中部署,保持不低于理想性能 92% 的水平。


推荐理由:动态复制热点专家替代了基于历史窗口的重排,将MoE训推吞吐从理想的一半拉至90%以上,对自研大规模模型的团队而言,是一套可落地的负载均衡方案。
10:07
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
Ollama 获 8800 万美元融资,加速开放模型生态发展

Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 和 8VC 等领投。该平台已服务 890 万开发者,并被 85% 的财富 500 强企业使用,其云端 token 用量月均翻倍。资金将用于支持无缝混合推理、新模型发布当日集成,以及让开发者在不牺牲所有权和隐私的前提下使用最强开放模型。


推荐理由:Ollama 拿到 8800 万美元融资,同时透露 85% 财富 500 强在用,月 token 量翻倍。开放模型从玩具变成企业标配的信号越来越明显,想本地跑模型的开发者都绕不开它。
08:20
公众号:数字生命卡兹克精选
AI 评分 76/100
不会代码也能做产品:一份从0开始的Vibe Coding保姆级教程

本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen等)从零开发并上线产品的完整流程。核心步骤包括购买Coding Plan、下载官方Agent编程产品、注册域名与服务器并同步做ICP备案,然后通过Agent的Plan模式描述需求并让AI自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。


推荐理由:我觉得这是目前最适合非技术人的中文实操指南,把从买服务器到上线的坑都填平了,独家skill也开源了,跟着做能少走很多弯路。

7月19日7月19日周日

星期日 · 1 条
11:06
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,支持 16 个 ASR 模型族

transcribe.cpp v0.1.0 发布,一个基于 ggml 的语音转录库,支持 16 个 ASR 模型族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现 GPU 加速。


推荐理由:本地语音转录一直缺一个好用的跨平台引擎,transcribe.cpp 不仅支持 60+ 模型、跑在 GPU 上,还带了 Python/JS/Rust/Swift 绑定,想把语音功能嵌进应用的开发者可以直接拿来用。

7月17日7月17日周五

星期五 · 3 条
09:05
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。


推荐理由:大西洋月刊这组调查揭示了AI繁荣的隐藏成本,硬件涨价会直接冲击普通消费者的钱包,这个信号比任何模型发布都更值得关注。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 81/100
RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。


推荐理由:淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。
01:32
Claude:Blog(网页)精选
AI 评分 65/100
Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。


推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

7月16日7月16日周四

星期四 · 5 条
20:30
公众号:百度智能云(文心)精选
AI 评分 67/100
秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级

百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。


推荐理由:秒哒3.5把无代码开发推到了iOS端,一键打包、多端共享后端这些能力对非技术创业者是真降门槛。但百度生态外的吸引力有限,适合已有秒哒应用的人直接升级。
18:10
公众号:小红书技术(dots.llm)精选
AI 评分 77/100
HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。


推荐理由:混合注意力模型终于有了可用的位置无关缓存方案,HYPIC 用转移算子缓存和缝合窗口解决了长期兼容难题,对长上下文推理服务的加速意义重大,做推理 infra 的团队可以马上看论文和代码。
18:00
公众号:小红书技术(dots.llm)精选
AI 评分 75/100
小红书联合北大、上交提出 HYPIC,让混合注意力大模型用上位置无关缓存,首 token 延迟降 3.25 倍

小红书联合北大、上交提出 HYPIC,这是首个在混合注意力大模型上实现位置无关缓存的服务系统。在 4 个生产级混合注意力模型、5 个工作负载上,HYPIC 将首 token 延迟(TTFT)平均降低 3.25 倍,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。该系统通过缓存段累积转移算子实现线性层常数时间状态组合,并用缝合窗口修复全注意力层跨段对齐。


推荐理由:此前位置无关缓存无法用于混合注意力模型,HYPIC 通过缓存转移算子与缝合窗口首次实现,RAG 场景 TTFT 降低 3.25 倍,开源代码为推理系统提供了可复用的加速路径。
16:43
IT之家(RSS)精选
AI 评分 78/100
台积电上调2026年资本支出预测至600~640亿美元,A14制程进展顺利

台积电在2026Q2财报说明会上将2026年资本支出预测上调至600~640亿美元,此前预测接近560亿美元。董事长魏哲家表示,预计2028年量产的A14制程(1.4nm)开发进展顺利,移动和HPC客户兴趣强烈,将成为比2nm更大、更持久的工艺。台积电预计2026Q3合并营收446~458亿美元,2026全年美元收入增幅将超过40%。


推荐理由:台积电这次资本支出上调不是财务数字游戏,而是直接宣告了AI算力在未来三年的供给曲线,做AI硬件的同行和投资人必须正视这轮扩产。
08:21
公众号:数字生命卡兹克精选
AI 评分 68/100
远程操控Agent干活方案:Codex主力 + UU远程兜底

作者分享了一套远程使用Agent的组合方案:以Codex的远程控制功能作为主力,通过ChatGPT App连接家中24小时开机的Mac Mini,同步所有开发任务、规则和Agent记忆;遇到扫码登录、图形界面操作等Codex难以处理的场景时,用网易UU远程在手机上直接操控电脑完整桌面。UU远程完全免费,支持多设备协同,无需局域网或公网配置。


推荐理由:卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。