精选归档 · 第 31 页

601620 条 · 共 619

9月23日9月23日周二

星期二 · 1 条
21:41
Sam Altman:Blog(RSS)精选
充裕的智能

计划打造每周可新增1吉瓦算力的AI基础设施工厂,通过芯片、电力到机器人的全栈创新,支撑治愈癌症、全球个性化教育等宏大应用。项目将主要落地美国,未来数月公布合作伙伴,年底披露融资方案。


推荐理由:Sam Altman阐述OpenAI基础设施扩张愿景,计划每周新建1吉瓦算力

9月17日9月17日周三

星期三 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 73/100
近期三次基础设施故障的事后分析

八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。


推荐理由:Anthropic 主动公开三个基础设施 bug 的完整复盘,这种坦诚在大厂里极少见。做 AI 产品的人都该读一下,它把「模型质量下降」从玄学拉回了工程现实,尤其是 XLA 编译器那层的坑,踩过才知道多深。

9月10日9月10日周三

星期三 · 1 条
15:01
Thinking Machines Lab:官方博客(RSS)精选
AI 评分 60/100
破解LLM推理中的非确定性

LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。


推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。

9月9日9月9日周二

星期二 · 1 条
11:40
FireRedTeam:原创语音与多模态项目精选
AI 评分 63/100
FireRedTeam 开源 FireRedChat 全自托管全双工语音交互方案

FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。


推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。

9月3日9月3日周三

星期三 · 1 条
22:03
Linear:Now(RSS)精选
AI 评分 61/100
Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单

Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。


推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。

9月2日9月2日周二

星期二 · 1 条
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 64/100
Claude Platform 发布 Code Execution Tool v2 公测版,支持 Bash 命令与文件操作

Claude Platform 推出 Code Execution Tool v2 公测版,取代原先仅支持 Python 的工具,新增 Bash 命令执行和直接文件操作能力,包括用其他语言编写代码。


推荐理由:Anthropic把代码执行工具从Python解放到了Bash和任意语言,这不再是玩具,而是能在沙箱里跑真实脚本的实用功能,做自动化的开发者可以直接拿来用了。

8月27日8月27日周三

星期三 · 1 条
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 61/100
Claude Platform 发布 PHP SDK 测试版

Claude Platform 于 8 月 27 日推出 PHP SDK 测试版。该 SDK 允许开发者通过 PHP 语言调用 Claude API,构建基于 Claude 的应用程序。


推荐理由:Anthropic 给 PHP 开发者递了橄榄枝,beta 版 SDK 让 PHP 项目接入 Claude 更容易了,虽然量级不大但补上了生态缺口。

8月5日8月5日周二

星期二 · 1 条
05:25
Hao AI Lab@haoailab精选
AI 评分 67/100
FastWan视频生成模型实现70倍加速,5秒出片Try FastWan at https://fastwan.fastvideo.org/!FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为"稀疏蒸馏"的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。

Hao AI Lab: (1/n) 🚀 With FastVideo, you can now generate a 5-second video in 5 seconds on a single H200 GPU! Introducing FastWan se...


推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。

7月23日7月23日周三

星期三 · 1 条
17:00
Modal 官方工程博客(RSS)精选
AI 评分 69/100
Modal 实测:用开源 ASR 模型将批量语音转写提速 100 倍、成本降 100 倍

Modal 工程团队在平台上部署 NVIDIA parakeet-tdt-0.6b-v2 与 canary-1b-flash 开源 ASR 模型,对约一周(7×24 小时)ESB 基准音频做批量转写,结果比所测专有 API 快 112 倍或便宜 200 倍,且错误率略低,实现了一分钟内以 1 美元转写一周音频。


推荐理由:原文给出可复现的批量转录优化方法与端到端实测数据,读者可以据此在自己的语音转写服务中权衡成本与吞吐。

7月10日7月10日周四

星期四 · 2 条
08:00
00:00
Liquid AI 模型与工程博客(网页)精选
AI 评分 65/100
Liquid AI 发布端侧基础模型 LFM2,含 0.35B/0.7B/1.2B 三个规格

Liquid AI 发布新一代基础模型 LFM2,主打端侧部署,在 CPU 上解码与 prefill 速度最高达 Qwen3 的 2 倍,训练效率较上一代提升 3 倍。


推荐理由:官方发布端侧模型系列,给出与 Qwen3 等同尺寸模型的速度和基准对比数据,适合关注本地部署选型的读者参考。

7月2日7月2日周三

星期三 · 1 条
17:00
Modal 官方工程博客(RSS)精选
AI 评分 61/100
Modal 如何用 evals 和推理时算力扩展生成既美观又可扫的 QArt 二维码

Modal 团队复盘其 QArt codes 服务的工程过程,通过 evals 和推理时算力扩展将二维码扫描率提升到 95% 的 SLO,同时改善美观度并将 p95 端到端延迟控制在 20 秒内。


推荐理由:Modal 团队复盘 QArt codes 从不可扫到 95% 扫描率的工程路径,evals 构建与推理时并行扩展的方法可迁移到其他生成模型应用。

6月23日6月23日周一

星期一 · 1 条
00:00
Prime Intellect(网页)精选
AI 评分 61/100
Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与行星尺度流水线并行推理运行

Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,基于 DeepSeek-R1-0528 生成经过验证的推理轨迹,并启动行星尺度的流水线并行分布式推理运行。


推荐理由:原文给出流水线并行推理与 TOPLOC v2 验证机制的细节,开源社区可据此了解如何用消费级 GPU 参与大规模推理贡献。

5月30日5月30日周五

星期五 · 1 条
20:00
Modal 官方工程博客(RSS)精选
AI 评分 61/100
Modal 上线 B200 和 H200 GPU

Modal 宣布 B200 和 H200 GPU 开放给所有账户使用,无需联系销售,B200 定价 $6.25/hour,H200 定价 $4.54/hour,一行代码即可在 Function 中指定。


推荐理由:原文给出 B200 与 H200 的价格、规格对比和实测延迟数据,读者可据此评估迁移到新 GPU 的收益。

5月28日5月28日周三

星期三 · 1 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 56/100
OpenRouter 推出推理流摘要、加密货币发票等多项新功能

OpenRouter 上线了推理流摘要(Reasoning Streams)功能,支持流式推理过程摘要,同时新增加密货币发票支付、最终用户 ID(End-User IDs)、速率限制保护以及密钥锁定等特性。


推荐理由:如果你在用 OpenRouter 做应用,这几个更新挺实用,推理流输出让代理开发更可控,加密支付和端用户 ID 也降低了商业化门槛。

11月29日11月29日周五

星期五 · 1 条
00:00
Prime Intellect(网页)精选
AI 评分 66/100
Prime Intellect 发布 INTELLECT-1:首个全球分布式训练的 10B 参数模型

Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。


推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。

9月30日9月30日周一

星期一 · 1 条
00:00
Liquid AI 模型与工程博客(网页)精选
AI 评分 64/100
Liquid AI 发布首批 Liquid Foundation Models:LFM-1B/3B/40B

Liquid AI 发布第一代 Liquid Foundation Models(LFM),包含 1.3B、3.1B 和 40.3B MoE(激活参数 12B)三个语言模型,官方称在各规模上取得同级领先质量。


推荐理由:官方发布了三档模型的基准数据和内存表现,并说明非开源决定与边缘部署定位,读者可据此评估是否试用。

9月19日9月19日周四

星期四 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 72/100
引入上下文检索:大幅提升RAG系统准确性的新方法

传统RAG系统在编码时易丢失上下文,导致检索失败。新方法“上下文检索”通过“上下文嵌入”和“上下文BM25”两项子技术,在检索前为文本块添加解释性上下文,能将检索失败次数减少49%,结合重排序后降幅可达67%,显著提升了下游任务性能。对于小于20万token的小型知识库,可直接将其完整内容放入提示词,结合Claude的提示词缓存功能,能降低超过2倍的延迟和高达90%的成本。对于大型知识库,上下文检索则提供了可扩展的解决方案。


推荐理由:Anthropic 把 RAG 检索失败率砍了 67%,方法不复杂但数据扎实,做知识库的开发者可以直接抄 cookbook 上手,是那种读完当天就能改进生产环境的实用帖。

5月12日5月12日周日

星期日 · 1 条
00:00
Eugene Yan:Writing精选
AI 评分 82/100
Applied LLMs:一年 LLM 应用开发的经验总结

Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。


推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。