精选归档 · 第 7 页

121140 条 · 共 274

5月30日5月30日周六

星期六 · 2 条
01:15
Rohan Paul@rohanpaul_ai精选
AI 评分 76/100
亲测为实:难以置信的推理速度I had to test it myself to believe this unreal inference speed.3,000 tokens/s for 1 user on standard datacenter GPUs.They leveraged a hidden efficiency gap in how GPUs generate tokens.@Kog__AI just achieved 3,000 tokens/s on 8× AMD MI300X GPUs and 2,100 on 8× NVIDIA H200 (FP16, no speculative decoding). Their tech preview is on a 2B model, and they show how their techniques will scale to large frontier MoE models at similar speeds.That's a huge number because normal low-batch GPU decoding for 2B to 8B models is usually closer to 100 to 300 tokens/s per request, so Kog is claiming something like a 10X to 30X jump in the speed one user actually feels.Their trick: they are getting the speed by treating LLM decoding as a memory streaming problem, not mainly a math problem.For 1 user at batch size 1, the GPU is not doing big, efficient matrix-matrix work like in training or large-batch serving; it is repeatedly pulling the model’s active weights from high-bandwidth memory for each new token, so speed depends on how smoothly those weights keep flowing.Normal inference stacks keep breaking that flow. They run many separate GPU programs for different parts of the model, move intermediate results through memory, wait at synchronization points, talk back to the CPU for scheduling or sampling, and then repeat this token after token.Kog’s answer is to co-design 3 things that are usually tuned separately: the runtime, the low-level GPU code, and the model architecture.The biggest engineering move is the monokernel, where the whole decode pass runs as 1 persistent GPU-resident program, including sampling, so the system does not keep stopping for kernel launches, CPU scheduling, and intermediate memory round trips.They also rebuilt synchronization, because their own measurements say grid sync was eating around 35% of token-generation time; instead of making every compute unit wait at a broad barrier, each unit waits only for the exact data it needs.On AMD MI300X, they also map memory access around the chiplet layout, because memory latency changes depending on which die makes the request.Then their Laneformer model uses Delayed Tensor Parallelism, which lets cross-GPU communication happen in the background instead of blocking every layer.Kog团队在标准数据中心GPU上实现了极高的单用户推理速度,在8× AMD MI300X GPUs上达到3,000 tokens/s,在8× NVIDIA H200上达到2,100 tokens/s。相比常规推理速度(约100-300 tokens/s),实现了10-30倍提升。其核心思路是将LLM解码视为内存流问题,通过协同设计monokernel、重建同步机制、针对性内存访问映射及采用延迟张量并行的Laneformer模型架构,消除了传统流程的阻塞点。

推荐理由:Rohan亲自测完Kog AI的3000 token/s,把单用户推理速度拉高了10-30倍,这套monokernel设计可能改写低延迟推理的玩法,做实时AI产品的团队必须盯紧。
00:33
Tomer Tunguz 博客(VC 分析)精选
AI 评分 65/100
技能提炼

“技能提炼”是一种知识转移方法,由前沿大模型(如 Opus 4.7、GPT-5.1、Gemini 3 Pro)负责撰写并优化标准化的 SKILL.md 流程文件。然后,本地运行的小模型(如 Qwen 35B、Gemma 26B)直接执行这些文件。此过程不同于压缩模型权重的知识蒸馏、训练权重的指令微调或检索事实的 RAG,其核心是提取并转移操作流程,让小模型按步骤执行,从而形成前沿模型作教师、小模型作执行者的循环。


推荐理由:Tomer 把个人代理的完整工作流摆了出来,用大模型写 skill 小模型执行,这条蒸馏思路比调 prompt 高级,想认真跑本地代理的人该盯一下。

5月29日5月29日周五

星期五 · 3 条
15:21
IT之家(RSS)精选
AI 评分 70/100
谷歌 DeepMind CEO 哈萨比斯:AGI 最快三年内到来,研发速度远超预期

谷歌 DeepMind 首席执行官德米斯·哈萨比斯预测,AGI 研发速度远超预期,最快可能在 2029 年至 2030 年前后出现。作为 AlphaGo、AlphaFold 的主导者,他认为当前 AI 智能体是未来更强智能的预演,随着多模态和自主决策能力成熟,三年内迎来 AGI 关键突破已非科幻。但他同时警示,全球社会对 AGI 到来的准备严重不足,必须提前建立规则与防护机制。


推荐理由:哈萨比斯作为造出 AlphaFold 的诺贝尔奖得主,三年内 AGI 的判断不是空话,他同时强调社会完全没准备好,这种紧迫感比单纯的时间表更值得看。
06:09
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
萨姆·阿尔特曼和达里奥·阿莫代伊都纷纷收回了关于AI将引发就业危机的预测

OpenAI CEO萨姆·阿尔特曼和Anthropic CEO达里奥·阿莫代伊均收回此前关于AI将摧毁白领就业的预测。阿尔特曼承认自己“错得离谱”,称入门级岗位被淘汰的影响并未如期出现;阿莫代伊则改口称自动化可能扩大人类工作内容而非消灭岗位。两家公司均据报道筹备今年IPO,估值各约1万亿美元。


推荐理由:Altman和Amodei同一周改口,从‘大量失业’变成‘需要适应’,风向标意义拉满。过去拿AI末日论吓人的可以歇歇了,这篇值得转给每一位焦虑的朋友。
00:33
Tomer Tunguz 博客(VC 分析)精选
AI 评分 61/100
AI智能体时代下的安全变革

Lemonade的CISO Jonathan Jaffe探讨了AI智能体时代的安全新挑战。他指出,AI对攻击者和防御者同样强大,但可被利用的漏洞窗口正在缩小,因为AI能更快地生成、审查和修补代码。为此,安全团队正向工程团队转型,例如Lemonade的安全部门均由工程师组成,并构建了包含智能体的内部AI平台。同时,每个智能体(单个终端上可能运行200到10000个)都需要被赋予身份,并在操作点由策略进行更复杂的管控,这超越了当前身份与访问管理系统的能力。


推荐理由:Jaffe 给出的结论很提气,AI 对防御方的加成被市场严重低估了,尤其每个 Agent 必须拥有身份和策略控制这个预判,值得所有在做 Agent 架构的人看一遍。

5月28日5月28日周四

星期四 · 2 条
10:14
IT之家(RSS)精选
AI 评分 74/100
人民日报专访华为何庭波:今年秋季的新麒麟手机芯片,性能等相比去年是"跳跃性"提升

华为何庭波提出半导体新演进路径“韬(τ)定律”,以“时间缩微”(如逻辑折叠)替代“几何缩微”作为新指导原则。她表示,过去6年华为已基于此自主研发381款芯片。今年秋季将发布新的麒麟手机芯片,这是首个完整的“韬芯片”,其性能、集成度相比去年是“跳跃性”提升。


推荐理由:华为提出「韬定律」替代摩尔定律,不是空谈,何庭波说新麒麟芯片性能跳跃提升,证明了这条路的可行性。对半导体行业是一次认知冲击。
00:35
Chubby♨️@kimmonismus精选
AI 评分 80/100
与Google搜索产品副总裁Robby Stein的访谈:AI原生搜索时代I sat down with Robby Stein (@rmstein), Google’s VP of Product for Search, at @Google I/O.Robby is one of the most interesting product leaders in tech: he helped build Instagram Stories, Reels and Close Friends, and now leads core Google Search products including AI Overviews, AI Mode, Lens and ranking.We talked about one of the biggest shifts in the history of the web:Google Search becoming AI-native.Topics we covered:• AI Mode and whether it is an evolution of Search or a reinvention of it • how Google breaks complex questions into multiple searches behind the scenes • why AI search is much more expensive to run than traditional search • whether Google’s TPUs and infrastructure give it an advantage no one else can match • why Search volume is growing instead of being cannibalized by AI • the tension between great AI answers and traffic for publishers • how Google decides which sources and links to show • what a better internet could look like if AI Search works as intendedThe big question behind the whole conversation: If Google gives you the answer directly, what happens to the link-based web?A small caveat: sadly the microphones didnt work properly. Therefore the audio quality in this episode isn't perfect due to a recording issue - we appreciate your understanding.本文记录了与Google搜索产品副总裁Robby Stein在Google I/O的访谈,核心探讨Google Search向"AI原生"模式的重大转变。讨论话题包括AI Mode是进化还是重塑、如何将复杂问题拆解为多轮搜索、AI搜索的高运行成本、Google TPU及基础设施的优势、AI时代搜索量不减反增的原因,以及优质AI回答与出版商流量之间的张力。访谈还涉及Google决定展示哪些信息源与链接的逻辑,并围绕一个核心问题展开:如果Google直接给出答案,传统的基于链接的网页生态将走向何方?
另有 14 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Google 搜索 VP 首次拆解 AI Mode 背后的成本逻辑、流量分配和 TPU 优势,比 I/O 演讲深得多,做搜索和内容生态的都值得听。

5月27日5月27日周三

星期三 · 4 条
16:14
IT之家(RSS)精选
AI 评分 70/100
OpenAI 奥尔特曼称 AI 对白领冲击不如预期般严重:我很高兴自己当时错了

OpenAI CEO 萨姆·奥尔特曼承认,此前关于 AI 会消灭大量初级岗位的预测并不准确,AI 目前对白领初级岗位造成的短期冲击没有预想中严重。他称“我很高兴自己错了”,并表示在技术预测上大致正确,但在社会和经济影响方面“错得相当离谱”。奥尔特曼同时强调,即便担忧已被证明不准确,AI 企业仍应坦率讨论这项技术可能带来的影响。


推荐理由:Altman 亲口承认自己之前对白领岗位消失的预测错了,这个反转比任何智库报告都更有说服力,但他那句「裁员别赖 AI」的补丁挺微妙的。
04:27
Ethan Mollick:One Useful Thing(RSS)精选
AI 评分 75/100
选择保持人性

社交媒体平台上的帖子内容正变得越来越相似。这种趋同现象可能意味着大量内容正在被AI生成或同质化处理,引发了人们对于内容原创性与人类独特视角的讨论。


推荐理由:Mollick 用两个对照实验把 AI 学习的悖论讲透了:替你做事的 AI 会让你变笨,逼你思考的 AI 却能让你多学半年。教育决策者应该坐不住了。
03:31
Tomer Tunguz 博客(VC 分析)精选
AI 评分 58/100
智能体重力:谁在运行你的智能体?

在数据时代,数据重力是核心力量;而在智能体时代,智能体重力将扮演同样角色。智能体运行需要巨大算力,主要平台将激烈争夺以将其留在自家生态。平台上的智能体与数据越多,其智能体重力就越强。例如,Databricks在微软平台推出的某个功能,虽未明言此目的,却让用户更容易在Databricks中构建智能体,而非微软自家的Fabric。这可能使用户不知不觉间将高价值的智能体及数据工作负载迁移至该平台。因此,赢得并维持智能体重力,将成为智能体时代的核心竞争主题。


推荐理由:Tomer Tunguz 提出「Agent Gravity」概念,把数据平台竞争的逻辑从数据引力延伸到了代理引力,做 Infra 和做 Agent 的人都应该读一读,这可能会影响你对平台锁定的判断。

5月26日5月26日周二

星期二 · 5 条
23:49
Nathan Lambert:Interconnects(RSS)精选
AI 评分 67/100
未来展望:2026年5月的一些想法

文章展望了截至2026年5月AI领域的动态。内容涉及 Gemini Flash 3.5 的发布、名为 Mythos 的新产品或项目、开源与闭源生态平衡(open-closed balance)的讨论、美国开源力量的显著增长(America's open-source surge),以及由此引发的新兴权力博弈(emerging power struggles)。


推荐理由:Nathan Lambert 对开源模型追赶闭源的周期判断、Gemini 在编码代理领域的缺位分析,以及美国开源模型崛起的观察,为理解当前鼎立格局提供了扎实的坐标,值得从业者细读。
22:06
The Verge:AI(RSS)精选
AI 评分 84/100
Sundar Pichai 谈 AI、搜索的未来及网络的变化

Google 与 Alphabet CEO Sundar Pichai 在 Google I/O 后受访,回顾了公司为应对 ChatGPT 而进行的战略重组与高管调整。访谈聚焦于新的 Gemini 模型及其在产品中的整合,包括全新的智能搜索框与 Gemini Spark 智能体平台,旨在让搜索从提供结果转向启动任务。Pichai 讨论了这些变化对开放网络的持续冲击,回应了主持人此前提出的“Google Zero”概念(即来自 Google 的网站流量可能归零),并提及 Google 正利用 YouTube 视频训练模型以改变视频搜索与索引方式。最后,他对 Google DeepMind CEO Demis Hassabis 关于“处于智能奇点起步阶段”的言论表示认同,并分享了对 AGI 时间线的看法。


推荐理由:Sundar Pichai 年度对话,从搜索改版聊到 AGI 时间线,坦诚得不像公关话术。做搜索、做内容的人都该看,他亲口说那个「best Chromebook」的结果可能太主观了。
22:03
Gary Marcus:The Road to AI We Can Trust(RSS)精选
AI 评分 60/100
Uber COO称未见AI投入产出成比例增长

Uber首席运营官Andrew Macdonald表示,公司并未看到在AI上投入更多成本后,生产力获得了相应的提升。


推荐理由:Gary Marcus借Uber、星巴克等最新案例,对AI的狂热投入发出清晰警告,他认为如果更多企业发现成本飙升却未见实效,那几万亿的估值泡沫可能破裂,这是近期最直白的风险提示。
18:39
Boris Cherny@bcherny精选
AI 评分 66/100
AI模型中发现"令人不安"的类人结构… [W]e keep finding things that are mysterious, even unsettling. We find structures that mirror results from human neuroscience. We find evidence of introspection. We find internal states that functionally mirror joy, satisfaction, fear, grief, and unease. I don’t know what that means, but I think it warrants ongoing discernment.We need more of the world—religious communities, civil society, scholars, governments, and indeed all people of good will … to take this seriously, to look closely, and to push events in a better direction. We need informed critics who will tell the labs when we are failing. We need moral voices that the incentives cannot bend.推文指出,在AI模型内部持续发现一些"令人不安"的类人结构,包括与人类神经科学相似的结构、内省证据,以及功能上类似喜悦、恐惧等情感的内部状态。作者呼吁宗教团体、学界、政府等各界严肃看待这一发现,推动事件向好发展,并需要不受利益影响的诚实批评者与道德声音。作为背景,Anthropic联合创始人Chris Olah受邀在教皇Leo XIV的通谕"Magnifica humanitas"发布仪式上发表了相关演讲。

Anthropic: Anthropic co-founder Chris Olah was invited to speak at today's presentation of Pope Leo XIV's encyclical "Magnifica hum...


推荐理由:Anthropic 的研究主管在教皇通谕发布会上说,他们在模型里发现了类似人类神经科学和内省的东西,这比任何 benchmark 都惊人,也意味 AI 安全讨论正走出技术圈进入文明公共讨论。
02:58
Anthropic:Newsroom(网页)精选
AI 评分 77/100
Anthropic联合创始人Chris Olah在教皇通谕发布会上的讲话

Anthropic联合创始人Chris Olah在梵蒂冈出席教皇Leo XIV关于AI的通谕发布会。他指出,所有前沿AI实验室都面临商业、研究及地缘政治等多重压力,这可能与做正确的事相冲突,因此外部监督至关重要。他强调,AI模型并非像飞机那样被工程化构建,而是基于人类语言和思想“生长”出来的,其内在性质可能复杂难解。他提出三个需审慎思考的问题:如何确保AI发展的全球收益公平分享、如何思考AI时代的人类繁荣,以及AI模型内在性质的本质。他呼吁社会各界,尤其是宗教与民间团体,严肃审视AI发展并引导其向善。


推荐理由:Olah 在教皇通谕发布会上罕见坦承 AI 实验室的激励扭曲,呼吁外界批评,还透露模型内部已出现类似情感的状态,对关注 AI 伦理的人值得细读。

5月24日5月24日周日

星期日 · 1 条
22:27
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
格雷格·布罗克曼:那段差点让OpenAI覆灭的72小时

OpenAI联合创始人兼总裁格雷格·布罗克曼在一期播客访谈中回顾了公司险些覆灭的72小时:从接到董事会解雇萨姆·奥尔特曼的电话、当日辞职,到次日在其家中设计“凤凰”备份公司,再到伊利亚·苏茨克维的推文改变一切。他还谈及OpenAI放弃纯非营利结构的原因、AI编写自身代码的比例,以及为何不再展示推理过程。


推荐理由:Brockman 首次完整回忆那场差点让 OpenAI 散伙的内部风暴,不只是八卦,是理解 AI 行业治理脆弱性的关键一课。

5月23日5月23日周六

星期六 · 1 条
07:09
IT之家(RSS)精选
AI 评分 79/100
黄仁勋:AI 基建年度开支要冲到 4 万亿美元!

英伟达发布2027财年Q1财报,营收816亿美元,同比增长85%,净利润583亿美元,翻两倍多,市值达5.7万亿美元,已超德国2026年GDP预测。黄仁勋预测,超大规模云厂商的AI基建年度开支将从当前的1万亿美元,增长至3-4万亿美元,远超华尔街预期。财报同时显示,数据中心业务营收752亿美元,占比超九成。值得注意的是,AI基建的高能耗正推高居民电费,数据中心用电成本转嫁效应已初步显现。


推荐理由:黄仁勋的4万亿美元AI基建预测比华尔街共识高四倍,不是吹牛,是给AGI时代的入场券标价,所有云厂商已经用脚投票了。

5月22日5月22日周五

星期五 · 2 条
22:00
Gary Marcus:The Road to AI We Can Trust(RSS)精选
AI 评分 65/100
这个奇怪操作可能让你的养老基金损失数十亿美元

国会当前推进的某项政策调整,可能导致美国养老基金遭受数十亿美元的巨额损失。该政策变更被指存在重大漏洞,将直接影响数百万退休人员的资产安全。有专家发出警告,呼吁民众立即联系所在选区的国会议员,要求其重新评估并阻止这一潜在损害养老金储备的决策。


推荐理由:Gary Marcus 把 S&P 500 规则变更和你的退休金直接挂钩,逻辑链清晰——这可能是普通人第一次切身感受 AI 泡沫的传导渠道,值得警惕。
03:26
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
Cloudflare首席执行官谈如何决定用人工智能取代哪些员工

Cloudflare首席执行官在《华尔街日报》撰文,分享其公司用AI替代部分员工的决策逻辑。该文于2026年5月21日发布,引发了技术社区的广泛讨论,在Hacker News上获得100个点赞。


推荐理由:Cloudflare CEO 亲自下场讲怎么选人让 AI 替,不是口号而是有具体方法论,做管理的可以对照看自己团队多少活儿能被自动化。对普通打工人也是一个明确的预警信号。