精选归档 · 第 4 页

6180 条 · 共 591

8月21日8月21日周五

星期五 · 2 条
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 64/100
本地AI模型已能胜任89%日常查询,数据中心将走向个人化

斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。


推荐理由:作者借 Koomey 定律类比,把本地模型与云端效率数据放进历史框架,帮助读者理解端侧 AI 的演进节奏。
01:06
Hugging Face:Blog(RSS)精选
AI 评分 61/100
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。


推荐理由:约300M参数的draft模型换最高3.18倍吞吐,贪心输出不变,LFM2.5-2.6B在M4 Max达139 tok/s,本地agent门槛被拉低。

8月20日8月20日周四

星期四 · 1 条
01:56
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 73/100
突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。


推荐理由:文章提出按上下文长度与并发需求分场景选择 prefill/decode 配置,并用 Humming 压缩和 Online C128 释放 HBM,使 H20 也能服务 1M 上下文,为受限硬件上的大规模推理提供了可复用的工程思路。

8月19日8月19日周三

星期三 · 2 条
09:11
公众号:智谱(GLM)精选
AI 评分 79/100
GLM-5.3上线:AA智能指数60分并列开源第一,成本更低

GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。


推荐理由:GLM-5.3 把前沿智能的单任务成本压到同档最低,模型选型时成本与智能可以放在同一优先级比较,而不必默认高价闭源旗舰。
06:27
Anthropic:Research(发表成果 · 网页)精选
AI 评分 73/100
Claude 如何加速蛋白质设计与分析化学研究

Anthropic 公布两项实验:Claude(Mythos Preview 和 Opus 4.8)针对 15 个靶点设计蛋白质结合剂,成功 14 个,命中率达 22.6%-35.1%。


推荐理由:把湿实验命中率与行业常规 10-15% 对比,Claude 从零设计蛋白结合体的效率已接近或超过专家,可压缩药物发现早期的计算与人工周期。

8月18日8月18日周二

星期二 · 3 条
08:01
公众号:数字生命卡兹克精选
AI 评分 71/100
一个实用的深度思考Prompt:用"双向钢人论证"让AI帮你挖出最本质的答案

作者基于Reddit上“让Claude真正开始思考”的帖子,引入逻辑学中的“钢人论证”(steelman)概念,并自创了一个“双向钢人Prompt”。该Prompt通过重述真实问题、强化正反双方观点、找出关键变量、逼AI给出明确判断四步,旨在避免模型谄媚,帮助用户找到问题最本质的答案。作者以自己选择公司司庆日的真实案例演示了使用效果。


推荐理由:这个 Prompt 把钢人论证做成可复制步骤,先重述问题、强化正反观点、再定位决定结论的变量,比直接要建议更能绕过模型顺意回答。
08:00
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 64/100
本地小模型也能媲美云端前沿模型:Qwen3.8-27B 的另类飞行路径

本地运行的 Qwen3.8-27B 在 Artificial Analysis 智能指数上以 52 分位列 135 个模型之首,超过 7530 亿参数的 GLM-5.2。在 25 项风投任务评测中,它与云端 DeepSeek V4 输出质量同为 8.0 分,但需多花 7.2 倍 token 思考,速度慢约 9 秒。小模型靠更长的链式推理弥补知识差距,而非直接给出答案。


推荐理由:作者用同一套 VC 任务实测云端与本地模型,给出质量、速度与思考 token 的具体数据,展示小模型靠推理补知识差距的路径。

8月17日8月17日周一

星期一 · 1 条
07:01

8月15日8月15日周六

星期六 · 1 条
02:22
Google Gemini@GeminiApp精选
AI 评分 66/100
Gemini 3.7 Flash 全面上线 Pro 与 Ultra 用户Gemini 3.7 Flash is now available to all Pro and Ultra users in Gemini chat.This model update delivers improved reasoning and accuracy for multi-step tasks like intelligently connecting the dots across dozens of files and emails into one master document.Give it a try today on the web or in the app!Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。

Google Gemini: Gemini Spark 现已运行于 Gemini 3.7 Flash。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets 中,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更加精准可靠,并通过对 @Goog...


推荐理由:Gemini 3.7 Flash 把多步推理与跨文件整合能力下放到轻量模型,对经常需要合并数十份文件或邮件的用户来说,是一个成本更低的处理选项。

8月14日8月14日周五

星期五 · 4 条
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。


推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
02:19
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。


推荐理由:最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。
00:00
METR:Notes(网页)精选
AI 评分 68/100
METR 分析 LLM 是否加速了科学发现:漏洞发现激增,算法优化未见明显拐点

METR 汇总多类公开数据寻找发现速度的拐点,发现漏洞发现明显加速:cURL CVE 从 2025 年的 9 个增至 2026 年的 36 个(15 个 AI 标记),Firefox 从 210 增至 342,Microsoft CVE 年化约为 2025 年的 2.5 倍。


推荐理由:原文用多领域公开数据对比 AI 对发现速度的影响,读者可以看到漏洞发现明显加快而算法优化尚未加速的反差。

8月13日8月13日周四

星期四 · 3 条
08:00
Epoch AI:研究、数据与评测精选
AI 评分 60/100
Epoch AI 估算 AI 芯片性价比每年增长约 49%

Epoch AI 估算 2023 年 Q1 至 2025 年 Q4 每季度购买的 AI 芯片综合性价比,从约 5.6×10^11 升至约 1.4×10^12 bit-operations per second per dollar(2025 年不变美元),指数拟合平均每年增长约 49%(90% CI:36%–66%),倍增时间 1.7 年。


推荐理由:Epoch AI 用自建的芯片销量和价格数据量化了每季度购买 AI 芯片的性价比增长,并说明了 Nvidia 高利润率对均价的影响。
01:57
Google Research:Blog(网页)精选
AI 评分 66/100
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。


推荐理由:知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。
00:46
Mustafa Suleyman@mustafasuleyman精选
AI 评分 66/100
微软首发自研推理模型MAI-Thinking-1Our first reasoning model, MAI-Thinking-1, is built from scratch. Now available in Microsoft Foundry. Kudos to the team! More below.我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。

推荐理由:微软首个自研推理模型进入 Foundry,使用 Azure 的团队在推理模型选型上多了一个自研选项,来源可完全在微软体系内验证。

8月12日8月12日周三

星期三 · 3 条
08:00
vLLM 官方博客(RSS)精选
AI 评分 72/100
vLLM 提供 Qwen3.8-2.4T-A95B Day-0 支持

vLLM 宣布对 Qwen3.8-2.4T-A95B 提供 Day-0 支持,该模型是基于 Qwen 3.5 架构的 2.4 万亿参数稀疏 MoE 模型,含 512 个专家,92 层混合骨干中每 4 层使用一次 full attention,其余 69 层为线性注意力。


推荐理由:原文给出架构细节、量化方案和硬件要求,读者可以据此评估部署这个 2.4T 参数开源权重模型的成本与配置。
01:47
The Decoder:AI News(RSS)精选
AI 评分 80/100
研究人员发现可读取ChatGPT等模型加密推理过程的API漏洞

Alexander Panfilov团队发现OpenAI、Anthropic、Google等主要AI提供商API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话发现62个API密钥、33个邮箱和33个密码。通过越狱,Anthropic的Haiku 4.5可逐字转写Opus 4.8的原始推理;解码10000条推理轨迹的API成本约720美元。


推荐理由:不是另一个理论漏洞,而是真实可复现的推理链提取,它直接揭示了模型在「想什么」与「说什么」之间的断裂,让密码泄露和欺骗意图从暗箱走向可审计的证据。
01:17
Google Blog:AI(RSS)精选
AI 评分 69/100
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。


推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。