精选归档 · 第 7 页

121140 条 · 共 174

5月9日5月9日周六

星期六 · 2 条
23:32
阿绎 AYi@AYi_AInotes精选
AI 评分 82/100
Redis创始人用C语言引擎将大模型"装进"个人电脑Damn,Redis创始人用一个C文件,干翻了大厂烧几十亿的GPU集群。Antirez,那个写出Redis的传奇黑客,昨天开源了ds4。一个专门为DeepSeek V4 Flash写的原生推理引擎,只有几千行C代码。它做到了一件很多人都觉得不可能的事: 把拥有1M上下文窗口、能跑完整coding agent循环的准前沿模型,完整跑在一台普通的128GB MacBook Pro上。YC CEO Garry Tan看完直接转发,只说了一句话: “正在下载… 1M上下文+可用的coding agent能力,全在一台128GB MacBook上,这太疯狂了🤯”这已经不是一个普通的量化项目那么简单了铁汁们, 属于顶级黑客用极致的系统工程,把闭源实验室烧几十亿才能玩的东西,压到了每个人的笔记本里。他的三个黑客级操作,每一个都颠覆了行业常识:1. 不对称2-bit量化: 只对MoE里占90%体积的专家部分做2-bit压缩,所有关键路径保持全精度。 质量损失极小,Antirez本人亲测“coding agent工作良好,能可靠调用工具”。2. 把KV Cache扔到SSD: 很多人都觉得KV Cache必须放内存,1M上下文会直接炸掉128GB内存。 他直接把KV Cache搬到了苹果的高速SSD上,用磁盘当扩展内存,彻底突破了硬件天花板。3. 纯Metal原生优化: 没有任何多余的封装, 没有通用框架的开销, 所有代码只为Apple Silicon写, 只为DeepSeek V4 Flash写。实测性能:M3 Max 128GB上稳定27 tok/s。不算快,但对本地跑agent循环来说,完全够用了。你不用再给OpenAI付API费,不用再担心数据泄露,不用再忍受网络延迟。所有的AI能力,完完全全在你自己的电脑里。卧槽,这才是真正的革命, 过去AI的权力攥在少数几家大厂手里,他们有GPU集群,定价格,甚至说删就删。现在,一个黑客用几千行C代码,就把这个权力还给了每一个开发者。开源AI真的是不可阻挡的, 大厂烧几十亿训练出来的模型,只要权重一开源,全世界的黑客就会用你想象不到的方式,把它优化到每一个能跑的设备上。今天是MacBook,明天是手机,后天是手表,太让人兴奋了!2026年5月9日,AI终于从云端的神坛,落到了每个人的笔记本里。或许这一天,会被写进历史!Redis创始人Antirez开源了专为DeepSeek V4 Flash设计的原生推理引擎ds4。该引擎仅用几千行C代码,通过三项关键技术:对MoE专家进行不对称2-bit量化、将KV Cache移至高速SSD突破内存限制、为Apple Silicon进行纯Metal原生优化,成功在128GB MacBook Pro上流畅运行具备1M上下文窗口的模型,实测达27 tok/s。此举将原本依赖云端GPU集群的前沿AI能力,通过极致工程优化 democratize 至个人设备,展现了开源社区推动技术平民化的强大潜力。

Garry Tan: Downloading now... 1M token context window with supposedly usable coding agent capability all on a 128GB Macbook Pro is ...


推荐理由:Antirez用几千行C代码把DeepSeek V4 Flash塞进128G Mac,本地跑1M上下文coding agent,这才是真正的AI民主化时刻,开发者必试。

5月8日5月8日周五

星期五 · 5 条
11:16
IT之家(RSS)精选
AI 评分 80/100
AI 终端智能化分级国标出炉:L1~L4 等级,涉及手机、电脑、眼镜、电视、耳机等

工信部等部门联合发布《人工智能终端智能化分级》系列国家标准。该标准采用“2+N”架构,基础部分明确了AI终端的定义、分级体系与测试方法。智能化水平从低到高分为L1响应级、L2工具级、L3辅助级和L4协同级四个等级,其中L4级标准将在后续修订中完善。首批标准覆盖手机、电脑、电视、眼镜、汽车座舱、音箱、耳机共7个品类,小米、华为、荣耀等为主要起草单位,旨在为各类智能终端的智能化水平提供统一评价依据。


推荐理由:中国首个AI终端智能化分级国标落地,L1到L4四个等级把手机、电脑、眼镜的智能水平钉在墙上,以后厂商再也不能模糊宣传,选型有了一把公用尺子。
08:06
Rohan Paul@rohanpaul_ai精选
AI 评分 78/100
atomic.chat为LLaMA.cpp引入多令牌预测技术,显著加速本地模型推理atomic[.]chat just made Gemma 4 26B faster inside LLaMA.cpp.making token generation about 40% faster in its MacBook Pro M5 Max test.Great news for local llms, because LLaMA.cpp and GGUF sit close to the local AI user base, where support often spreads into desktop apps, coding agents, and private on-device assistants.MTP (maltai token prediction) is like a smaller assistant drafting the next few words, while the main model checks whether those words are acceptable. If the draft is correct, the system accepts several tokens quickly. If the draft is wrong, the system rejects the wrong part and falls back to normal generation.atomic.chat通过为LLaMA.cpp引入多令牌预测技术,大幅提升了本地大型语言模型的推理效率。该技术利用小型辅助模型预先生成后续令牌草案,由主模型进行验证。在MacBook Pro M5 Max上测试时,使Gemma 4 26B模型的令牌生成速度加快约40%,整体运行速度提升1.5倍。这项优化进一步巩固了LLaMA.cpp和GGUF格式在本地AI生态中的核心地位,为桌面应用、编程助手和私有设备助手等场景提供了更高效的部署方案。

atomic.chat: Multi-Token Prediction (MTP) for LLaMA.cpp! Running Gemma4 local model 1.5x faster. We patched LLaMA.cpp. Quantized Gemm...


推荐理由:在笔记本上把 Gemma 26B 的生成速度拉高 40% 是个真实的体验提升,atomic.chat 把 MTP 带入 LLaMA.cpp 生态,本地 AI 玩家可以直接拿去用。
07:16
IT之家(RSS)精选
AI 评分 70/100
苹果首款 AI 可穿戴设备:内置摄像头的 AirPods 已进入 DVT 阶段,预计最快 9 月搭载新 Siri 亮相

据报道,苹果内置摄像头的AirPods已进入设计验证测试(DVT)阶段,最快有望于今年9月作为其首款AI可穿戴设备发布。该产品左右耳机配备低分辨率摄像头,用于捕捉环境视觉信息,以支持升级版Siri实现视觉问答等功能。其整体外观类似AirPods Pro 3,但耳机柄因容纳摄像头而加长。产品原计划2026年发布,因Siri升级延迟而推迟,此次升级得益于与谷歌Gemini的技术合作。苹果还在探索其导航提醒等用途,并为缓解隐私担忧内置了数据上传指示灯。


推荐理由:苹果把摄像头塞进 AirPods 做 Siri 的眼睛,这比智能眼镜更务实,但隐私指示灯能有多显眼是个疑问,做 AI 硬件的该看看苹果怎么绕开 Meta 的坑。
03:06
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
DeepSeek 4:适用于 Metal 的 Flash 本地推理引擎

DeepSeek 4 Flash 本地推理引擎正式发布,这是一个专为苹果 Metal 框架优化的开源项目。它允许开发者在配备 Apple Silicon 芯片的 Mac 上高效运行 DeepSeek 4 模型,实现本地离线推理。引擎通过 Metal Performance Shaders 显著提升了计算性能,降低了延迟与内存占用。该项目已在 GitHub 开源,并在 Hacker News 上获得了关注。


推荐理由:antirez 写的引擎让 DeepSeek 4 在 Mac 本地跑出近乎 Flash 的速度,而且代码极其精简,做本地推理的开发者应该立刻克隆下来跑一下。
01:30
Apple Machine Learning Research(RSS)精选
AI 评分 69/100
实用学习型图像压缩的关键要素

学习型编解码器相比传统硬编码方法的显著优势在于能直接针对人类视觉系统进行优化,但目前尚未出现兼具感知质量与实用性的图像编解码方案。本研究通过全面分析关键建模选择,旨在填补这一空白,探索在感知质量与运行效率间的联合优化方案,并在消融实验中引入了若干新技术。研究进一步采用性能感知的神经架构优化方法,为构建真正实用化的学习型图像压缩系统提供了系统性的设计指南与实验基准。


推荐理由:Apple 这篇调研把感知质量和运行效率同时拉进实做框架,做 codec 或端侧推理的人值得认真读一下。

5月6日5月6日周三

星期三 · 1 条
07:27
Chubby♨️@kimmonismus精选
AI 评分 76/100
OpenAI加速开发AI智能体手机,瞄准2027年量产Major leaks about the new OpenAI Phone:-OpenAI is reportedly accelerating development of its first AI agent phone, with mass production potentially starting in the first half of 2027.-One possible reason is strategic timing: the device could support a stronger IPO narrative by year-end, positioning OpenAI not just as a model company, but as a consumer hardware platform.-Competition in AI-native smartphones / agent phones appears to be heating up, increasing pressure to move faster.-MediaTek currently looks best positioned to become the sole processor supplier.-The phone is expected to use a customized Dimensity 9600, manufactured on TSMC’s N2P process node in the second half of 2026.-The most important hardware spec may not be raw compute, but the ISP, with an enhanced HDR pipeline designed to improve real-world visual sensing for AI agents.-Other expected specs include: Dual-NPU architecture for heterogeneous AI workloads LPDDR6 + UFS 5.0 to reduce memory and storage bottlenecks pKVM + inline hashing for stronger security If development remains on schedule, total shipments across 2027–2028 could reach around 30 million units.据报道,OpenAI正加速其首款AI智能体手机的开发,目标在2027年上半年量产。此举可能旨在强化其年底IPO的叙事,并将自身定位拓展至消费硬件平台。联发科有望成为独家处理器供应商,提供基于台积电N2P制程定制的天玑9600。关键硬件规格包括增强HDR管线的图像信号处理器,以提升AI视觉感知能力,以及双NPU架构、LPDDR6与UFS 5.0等。若按计划推进,2027至2028年总出货量可能达到约3000万台。

郭明錤|Ming-Chi Kuo: 【Industry Check Update】OpenAI appears to be fast-tracking its first AI agent phone, with mass production targeted as ear...


推荐理由:OpenAI 开始认真做手机了,而且冲着 IPO 去,这不是一个模型公司的副业,而是把自己变成消费硬件平台的关键一步,所有做 AI 硬件的都得重新看牌桌。

5月5日5月5日周二

星期二 · 2 条
20:56
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
Google Chrome 被曝未经用户同意悄然安装 4 GB AI 模型

据隐私倡导网站报道,Google Chrome 浏览器在未经任何提示或用户同意的情况下,于后台自动下载并安装了一个名为“Nano”、体积达 4 GB 的人工智能模型。该行为旨在增强本地AI功能,但完全隐蔽的安装过程占用了用户设备存储空间,且未提供任何选项或通知,引发了对其数据隐私风险及软件更新透明度的广泛担忧。此事件在Hacker News上获得高度关注,突显了公众对科技公司单方面安装行为的普遍不安。


推荐理由:浏览器里偷偷塞进4GB的AI模型,这件事揭开了一个很多人忽视的趋势,你的设备正在变成AI宿主,而且根本不需要征得同意。

4月30日4月30日周四

星期四 · 1 条
00:36
Tomer Tunguz 博客(VC 分析)精选
AI 评分 57/100
AI推理市场的专业化分化

AI推理市场正快速分化,各模态如文本、图像、视频和音频发展出独立推理技术栈。自ChatGPT发布后,NVIDIA数据中心收入三年内增长17倍,凸显市场爆发。分化根本原因在于工作负载差异:图像视频生成需高计算力,长上下文消耗更多内存,边缘设备则受功耗限制。市场按延迟分为实时、近实时和批量三层;按模态分为文本、图像视频音频;按部署分为云端和边缘。Hugging Face上已有超9万个图像生成模型,整个AI推理市场规模预计约1000亿美元,这种专业化趋势正为各细分领域创造领导者机会。


推荐理由:Tomer 把推理市场跟数据库市场做类比,碎片化的逻辑讲得很透,做 AI 基础设施的朋友能直接用来梳理自己的赛道,普通人知道这么回事就行。

4月29日4月29日周三

星期三 · 4 条
22:17
Tencent Hy@TencentHunyuan精选
AI 评分 67/100
腾讯开源Hy-MT1.5-1.8B-1.25bit翻译模型,440MB体积支持手机离线运行We're open-sourcing Hy-MT1.5-1.8B-1.25bit — a 440MB translation model that runs fully offline on your phone, supports 33 languages, and outperforms Google Translate.At 1.8B parameters, it matches commercial translation APIs and 235B-scale models on standard benchmarks. By quantizing to 1.25-bit, memory drops from 3.3GB (FP16) to 440MB — 25% smaller and ~10% faster than prior 1.67-bit approaches, with no accuracy loss.Covers 33 languages, 5 dialects, and 1,056 translation directions including minority languages like Tibetan and Mongolian.Our translation model has won 30 first-place rankings in international MT competitions and is already deployed across multiple Tencent products.🏆📲Demo APK (Android): https://huggingface.co/AngelSlim/Hy-MT1.5-1.8B-1.25bit-GGUF/resolve/main/Hy-MT-demo.apk 🤗Hugging Face:: https://huggingface.co/AngelSlim/Hy-MT1.5-1.8B-1.25bit 🔗GitHub: https://github.com/tencent/AngelSlim 📄Paper: https://arxiv.org/abs/2601.07892腾讯开源了Hy-MT1.5-1.8B-1.25bit翻译模型,其参数量为18亿,经量化后仅440MB,可在手机上完全离线运行。该模型支持33种语言、5种方言及1056个翻译方向,包括藏语、蒙古语等少数语言。在标准测试中,其性能媲美商业翻译API和2350亿参数的大模型。通过量化至1.25比特,模型内存占用从FP16格式的3.3GB大幅降低,比之前的1.67比特方法体积缩小25%、速度提升约10%,且无精度损失。该模型已在国际机器翻译竞赛中获得30项第一,并部署于腾讯多个产品中。

推荐理由:440MB的模型能在手机上跑33种语言翻译,还宣称比谷歌翻译强,这个量化技术让离线翻译不再是‘能看不能用’,出差党可以试试看。
20:33
Qwen@Alibaba_Qwen精选
AI 评分 60/100
闪存QLA:基于TileLang构建的高性能线性注意力内核🚀 Introducing FlashQLA: high-performance linear attention kernels built on TileLang.⚡ 2–3× forward speedup. 2× backward speedup. 💻 Purpose-built for agentic AI on your personal devices.💡Key insights: 1. Gate-driven automatic intra-card CP. 2. Hardware-friendly algebraic reformulation. 3. TileLang fused warp-specialized kernels.FlashQLA boosts SM utilization via automatic intra-device CP. The gains are especially pronounced for TP setups, small models, and long-context workloads.Instead of fusing the entire GDN flow into a single kernel, we split it into two kernels optimized for CP and backward efficiency. At large batch sizes this incurs extra memory I/O overhead vs. a fully fused approach, but it delivers better real-world performance on edge devices and long-context workloads.The backward pass was the hardest part: we built a 16-stage warp-specialized pipeline under extremely tight on-chip memory constraints, ultimately achieving 2×+ kernel-level speedups.We hope this is useful to the community!🫶🫶 Learn more: 📖 Blog: https://qwen.ai/blog?id=flashqla 💻 Code: https://github.com/QwenLM/FlashQLAFlashQLA是基于TileLang构建的高性能线性注意力内核,专为个人设备上的智能体AI设计。其核心创新包括门控驱动的自动片内计算并行、硬件友好的代数重构以及TileLang融合的Warp专用内核,通过提升流处理器利用率,在前向传播上实现2-3倍加速,反向传播实现2倍加速。该技术在小模型、长上下文工作负载和张量并行设置中效果显著,虽然在大批次处理时内存I/O开销略高,但在边缘设备和长上下文场景中实际性能更优。反向传播通过16级Warp专用流水线在严格片上内存限制下实现了核心级加速。相关资源已开源。

推荐理由:2 倍加速的背后是 Warp 特化流水线和自动 Copy 策略,像给手机 GPU 开了条专用跑道,做端侧 Agent 的可以直接拉代码试试。
20:33
Qwen@Alibaba_Qwen精选
AI 评分 66/100
闪速QLA:基于TileLang构建的高性能线性注意力内核🚀 Introducing FlashQLA: high-performance linear attention kernels built on TileLang.⚡ 2–3× forward speedup. 2× backward speedup. 💻 Purpose-built for agentic AI on your personal devices.💡Key insights: 1. Gate-driven automatic intra-card CP. 2. Hardware-friendly algebraic reformulation. 3. TileLang fused warp-specialized kernels.FlashQLA boosts SM utilization via automatic intra-device CP. The gains are especially pronounced for TP setups, small models, and long-context workloads.Instead of fusing the entire GDN flow into a single kernel, we split it into two kernels optimized for CP and backward efficiency. At large batch sizes this incurs extra memory I/O overhead vs. a fully fused approach, but it delivers better real-world performance on edge devices and long-context workloads.The backward pass was the hardest part: we built a 16-stage warp-specialized pipeline under extremely tight on-chip memory constraints, ultimately achieving 2×+ kernel-level speedups.We hope this is useful to the community!🫶🫶 Learn more: 📖 Blog: https://qwen.ai/blog?id=flashqla 💻 Code: https://github.com/QwenLM/FlashQLAFlashQLA是基于TileLang开发的高性能线性注意力内核,专为提升个人设备上智能体AI性能而设计。它实现了2-3倍的前向传播加速和2倍的反向传播加速。其核心技术包括门控驱动的片上自动计算与通信重叠、硬件友好的代数重构,以及TileLang融合的Warp专用内核。该设计通过自动片上通信重叠显著提升了流处理器利用率,在张量并行、小模型和长上下文任务中效果突出。尽管在大批量处理时,其将GDN流程拆分为两个内核的策略会带来额外内存开销,但在边缘设备和长上下文实际场景中性能更优。反向传播部分通过构建16级、严格片上内存限制下的Warp专用流水线,实现了超过2倍的内核级加速。

推荐理由:Qwen 把线性注意力的推理效率压到了新台阶,2-3 倍加速对想做本地 Agent 的开发者是实打实的,不是论文灌水,是能跑在设备上的代码。
00:37
Hugging Face:Blog(RSS)精选
AI 评分 70/100
介绍 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态模型

NVIDIA 发布了 Nemotron 3 Nano Omni 模型,这是一个专为处理长上下文多模态任务设计的轻量级模型。该模型能够同时理解并处理文档、音频和视频数据,旨在赋能新一代多模态智能体。其核心变化在于将长上下文能力与多模态理解结合到一个小型化模型中,提升了在复杂跨模态场景下的处理效率与应用灵活性。


推荐理由:NVIDIA 把多模态长上下文塞进 Nano 级别模型,文档、音频、视频 Agent 通吃,做端侧多模态应用的团队值得认真看看这个架构思路。

4月28日4月28日周二

星期二 · 1 条
11:27
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 55/100
inclusionAI/Ling-2.6-flash

inclusionAI发布了Ling-2.6-flash模型。该模型是其开源语言模型系列的最新成员,旨在通过开源与开放科学推动人工智能的进步与民主化。此次发布延续了团队降低AI技术使用门槛、促进更广泛社区参与开发的使命。


推荐理由:蚂蚁 inclusionAI 的 Ling-2.6-flash 上线 HuggingFace,名字带 flash 大概率是轻量推理模型,但官方描述几乎空白,没有 benchmark 也没有用例,建议等社区实测再决定是否投入精力。

4月27日4月27日周一

星期一 · 1 条
12:18
IT之家(RSS)精选
AI 评分 71/100
郭明錤:OpenAI 联手高通 & 联发科开发手机芯片,自研手机项目预计 2028 年量产

天风国际分析师郭明錤称,OpenAI正与联发科、高通合作开发手机芯片,立讯精密为独家系统联合设计和制造合作伙伴,项目预计2028年量产。OpenAI旨在通过自研手机完全掌控软硬件,以提供由AI智能体驱动的全新体验:用户无需操作多个App,可直接通过手机执行任务。为实现此愿景,手机需能持续理解用户上下文,采用端侧小模型与云端大模型协同的架构。此举将推动AI手机换机潮,利好芯片合作伙伴,并有望帮助立讯精密在AI原生硬件时代实现超越。


推荐理由:郭明錤的供应链料向来准,这次OpenAI做手机的阵容(联发科、高通、立讯)规格拉满,不是PPT项目。2028还远,但对手机行业来说,AI原生硬件的军备竞赛已经开始了。

4月23日4月23日周四

星期四 · 3 条
22:18
The Decoder:AI News(RSS)精选
AI 评分 72/100
OpenAI 发布开源模型,可去除文本中的个人数据

OpenAI 推出开源模型 Privacy Filter,专门用于检测和编辑文本中的个人数据。该模型能自动识别敏感信息并进行处理,以帮助减少隐私泄露风险,适用于需要数据脱敏的场景。


推荐理由:OpenAI这个开源隐私过滤器能在本地自动脱敏8类个人数据,对需要清洗训练数据的团队是个实用的基建工具,不过它不保证合规,别当法律盾牌用。
08:00
Google Developers Blog(RSS)精选
AI 评分 59/100
使用 LiteRT 与 NPU 构建现实世界中的设备端人工智能

LiteRT 是一个生产就绪的框架,旨在帮助移动开发者充分发挥神经处理单元(NPU)的效能,以突破传统 CPU 或 GPU 在性能与电池续航上的瓶颈。该框架通过提供统一的 API 来屏蔽底层硬件复杂性,已成功助力 Google Meet、Epic Games 等行业领先者高效部署复杂的 AI 模型,实现实时视频处理、动画生成与语音识别等高级功能。此外,平台还提供基准测试工具并具备跨平台兼容性,能够支持 AI 应用无缝部署于移动设备、AI PC 及工业物联网硬件等多种终端。


推荐理由:Google 把 LiteRT 从实验品推到生产级,统一 NPU 调用 API,做端侧 AI 的开发者终于不用逐家适配芯片了。虽然不是新概念,但 Google Meet 和 Epic Games 已经在用,说明不是 PPT。
08:00
Hugging Face:Blog(RSS)精选
AI 评分 57/100
如何在 Chrome 扩展中使用 Transformers.js

本文介绍在 Chrome 扩展中集成 Transformers.js 库的具体方法,涵盖从环境配置、模型加载到前后端通信的关键步骤。通过示例代码演示了如何利用该库在扩展中实现本地机器学习推理,同时处理扩展权限限制与安全策略。文中还对比了 Web Worker 与 Service Worker 两种部署方案,并提供了性能优化建议,帮助开发者在浏览器扩展环境中高效运行 Transformer 模型。


推荐理由:Hugging Face 官方出的 Transformers.js 浏览器插件教程,想在 Chrome 里跑端侧推理的前端开发者可以直接抄,省掉自己踩坑的时间。