精选归档 · 第 16 页

301320 条 · 共 403

5月10日5月10日周日

星期日 · 2 条
22:33
阿绎 AYi@AYi_AInotes精选
AI 评分 80/100
教育科技门槛一夜归零:AI助力单人低成本开发3D教学应用holy shit,The barrier to educational technology has vanished overnight.这回教育科技的门槛,一夜之间归零了, why?来往下看,最后附上了任何人都可以做的零代码工作流教程 💻• 2020年:做一个同等质量的3D教育App,需要3D建模师×2 + UI设计师×1 + 生物学家×1 + 前端工程师×3 + 产品经理×1,耗时6个月,成本80万美元。• 2026年:一个懂生物的普通人,用GPT Images 2 + Gemini 3.1 Pro,48小时,成本不到10美元。没有团队,没有融资,没有技术门槛, 你甚至都不需要会3D建模,不需要会写React,不需要懂Three.js。你只需要懂生物学,知道什么是对学生重要的。AI会帮你把所有的技术活全部干完。damn,这简直就是生产关系的效率革命, 以前教育科技是大公司和亿万富翁的游戏。 现在,任何一个老师,任何一个父母,任何一个对某个领域有热情的人,都能做出比教科书好100倍的教学工具。过去只有伊顿公学和哈佛附中才有虚拟实验室, 现在,任何一个能上网的家庭,花10美元就能给自己的孩子做一个专属的。 教育不平等,第一次有了被反向拉平的可能!可1:1复制的零代码工作流,任何人都能做,老规矩评论区自取👇AI工具GPT Images 2和Gemini 3.1 Pro的出现,彻底颠覆了教育应用的开发模式。过去需多人团队、数月时间和高昂成本才能完成的3D教育应用,如今一个具备领域知识(如生物学)的普通人,仅用约48小时和不到10美元即可实现。这消除了对编程、3D建模等技术能力的依赖,使教师、家长等个体也能独立创造高质量互动教学工具。此举有望推动过去仅属于精英机构的教学资源(如虚拟实验室)普及,为缩小教育不平等提供了新的技术路径。

Dilum Sanjaya: Fun interactive science app ideas | Part 3 Played around with generating 3D biological structures and made an app to exp...


推荐理由:阿易这视频展示了 GPT Images 2 和 Gemini 3.1 Pro 的组合,48 小时从想法到可交互 3D 教学 App,零代码工作流直接可以抄,教育技术门槛真的归零了,做内容的别错过。
01:29

5月9日5月9日周六

星期六 · 2 条
03:43
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 63/100
在OpenAI安全运行Codex

OpenAI通过沙盒隔离、人工审批流程、严格网络策略与原生代理遥测四层防护机制,确保Codex代码生成模型的安全运行。沙盒环境完全隔离执行代码,所有生产请求需经人工审核批准,网络策略限制外部依赖访问,实时遥测系统监控代理行为异常。该安全框架使企业能够合规采用AI编程助手,在保障代码安全性的同时维持开发效率。


推荐理由:OpenAI 公开了内部安全运行 Codex 的完整流程,从沙箱隔离到审批策略,企业落地 AI 编码的可以直接拿去抄作业。

5月8日5月8日周五

星期五 · 5 条
16:23
Hugging Face:Blog(RSS)精选
AI 评分 58/100
MedQA:基于AMD ROCm与LoRA微调Qwen3-1.7B的临床问答模型

该项目使用AMD Instinct MI300X(192 GB HBM3显存)和ROCm,通过LoRA微调Qwen3-1.7B模型实现医学问答。训练仅用2000条MedMCQA样本,约5分钟完成,仅更新约220万参数(占模型总参数的0.1443%),全程采用fp16精度,无需量化。HuggingFace生态(Transformers、PEFT、TRL、Accelerate)在ROCm上无缝运行,无需修改代码即可直接替代CUDA。模型已上传至HuggingFace Hub并提供在线Demo。


推荐理由:一个月前的教程了,但如果你是 AMD 党想跑医疗微调,这篇把坑都踩完了,代码直接能复现,LoRA 适配器也挂在 Hub 上,拿来就能用。
08:06
Rohan Paul@rohanpaul_ai精选
AI 评分 78/100
atomic.chat为LLaMA.cpp引入多令牌预测技术,显著加速本地模型推理atomic[.]chat just made Gemma 4 26B faster inside LLaMA.cpp.making token generation about 40% faster in its MacBook Pro M5 Max test.Great news for local llms, because LLaMA.cpp and GGUF sit close to the local AI user base, where support often spreads into desktop apps, coding agents, and private on-device assistants.MTP (maltai token prediction) is like a smaller assistant drafting the next few words, while the main model checks whether those words are acceptable. If the draft is correct, the system accepts several tokens quickly. If the draft is wrong, the system rejects the wrong part and falls back to normal generation.atomic.chat通过为LLaMA.cpp引入多令牌预测技术,大幅提升了本地大型语言模型的推理效率。该技术利用小型辅助模型预先生成后续令牌草案,由主模型进行验证。在MacBook Pro M5 Max上测试时,使Gemma 4 26B模型的令牌生成速度加快约40%,整体运行速度提升1.5倍。这项优化进一步巩固了LLaMA.cpp和GGUF格式在本地AI生态中的核心地位,为桌面应用、编程助手和私有设备助手等场景提供了更高效的部署方案。

atomic.chat: Multi-Token Prediction (MTP) for LLaMA.cpp! Running Gemma4 local model 1.5x faster. We patched LLaMA.cpp. Quantized Gemm...


推荐理由:在笔记本上把 Gemma 26B 的生成速度拉高 40% 是个真实的体验提升,atomic.chat 把 MTP 带入 LLaMA.cpp 生态,本地 AI 玩家可以直接拿去用。
07:30
GitHub Blog精选
AI 评分 72/100
提升 GitHub Agentic Workflows 的 Token 使用效率

GitHub 发现运行于每个拉取请求的智能体工作流会累积高昂的 API 成本。团队通过监测自身生产工作流,定位了效率低下的环节,并构建了专门的智能体进行优化。这一举措旨在显著降低由大语言模型调用产生的 Token 消耗与相关费用,直接提升了工作流的经济性与运行效率。


推荐理由:GitHub 把自己生产环境的 agentic workflow 扒了一遍,从 token 消耗里找浪费,再让 agent 自动修。不是 paper,是真踩过的坑,做 Copilot 集成的团队可以抄作业。
03:30
GitHub Blog精选
AI 评分 79/100
Agent pull requests 无处不在:如何审查它们

这份指南提供了审查由AI代理生成的pull requests的实用方法,重点包括审查时应关注的代码变更点、问题常见隐藏位置(如逻辑错误或安全漏洞),以及如何在代码合并前捕捉技术债务。它通过具体步骤帮助开发者系统评估自动化提交,确保代码质量,避免缺陷流入生产环境。指南强调主动审查策略,以应对AI代理在软件开发中日益普及的趋势。


推荐理由:AI代理生成的PR越来越多,审查它们不再是可选项。这篇官方指南从发现隐患到控制技术债务,给出了马上能用的检查清单,每个用Copilot的开发者都该看。

5月7日5月7日周四

星期四 · 2 条
05:30
GitHub Blog精选
AI 评分 56/100
Validating agentic behavior when "correct" isn't deterministic

GitHub 探讨如何为 Copilot 编码智能体构建“信任层”。文章提出,在“正确”答案非确定性的场景下,可通过领域分析来验证智能体的自主行为,避免使用脆弱的脚本或黑盒判断。该方法旨在提升 AI 编码助手的可靠性与透明度,确保其行为符合预期标准。


推荐理由:做coding agent最头疼的就是如何验证产出质量,GitHub这篇把他们的内部方法论开源了,用dominance分析替代脆弱的脚本,对正在折腾AI编程工具的团队是实打实的参考,值得逐帧学习。
03:22
Hugging Face:Blog(RSS)精选
AI 评分 65/100
vLLM V0 到 V1:在线强化学习中优先确保后端行为正确性

为确保 vLLM 从 0.8.5 到 0.18.1 的重大重写后,在线强化学习训练结果与 V0 参考运行一致,团队优先修复后端行为而非调整 RL 目标。关键修复包括:将日志概率模式设为 processed_logprobs 以匹配采样器分布;禁用 V1 特有的前缀缓存和异步调度等运行时默认值;调整权重更新路径以匹配 V0 的缓存保留行为;并确保 rollout 后端使用 fp32 精度的 lm_head 进行最终投影。这些措施消除了策略比率均值偏差,使 V1 在 KL 散度、熵等指标上与 V0 达成一致。


推荐理由:vLLM V1迁移时踩的四个坑全在这里,从logprob语义到fp32投影头,修完才调RL目标,做在线RL的团队可以直接抄这份配置清单。

5月6日5月6日周三

星期三 · 2 条
18:16
阿绎 AYi@AYi_AInotes精选
AI 评分 79/100
这个创造了Claude Code的男人Boris Cherny大神,完整公开了自己的工作流,并直播演示了一半的编码工作在手机上完成🤪这个创造了Claude Code的男人Boris Cherny大神,完整公开了自己的工作流,并直播演示了一半的编码工作在手机上完成🤪不是回消息,是同时跑5到10个Claude实例, 用手机启动任务,去喝咖啡,回来代码写好了🤣他刚公开了自己的完整工作流,看完之后我发现, 核心就三件事,但每一件都跟大多数人的直觉相反:第一,永远选最贵最聪明的模型 听着像烧钱,实际上反过来,聪明模型一次想清楚,笨模型来回试错烧掉的token远超差价。 他的原话:"计划做得好,代码自然好。"第二,整个团队维护一个纯文本知识库 不是Notion,不是花哨的文档系统,就是一个txt文件。Claude每犯一次错,记一笔,每周更新好几次,这个文件就是团队的长期记忆,Claude不会在同一个地方摔倒两次。第三,永远让Claude看到自己代码的运行结果 能跑代码,能看浏览器渲染, 他的比喻很准:"你让一个画家蒙着眼睛画画, 画完不让他看,然后怪他画得丑?"他的清晨流程:醒来,手机上启动三个任务, 该干嘛干嘛,晚点回来检查。规划模式起步 → 敲定计划 → 自动接受修改 → 完成多个Claude实例,一个周密计划,一个共享知识库,没了。Boris Cherny公开其高效AI编码工作流,核心基于三点反直觉原则:1. 坚持使用最昂贵、最聪明的模型(如Claude),因其能一次性清晰规划,避免笨模型反复试错消耗更多token;2. 团队仅维护一个纯文本知识库文件,记录Claude的每次错误并每周更新,形成长期记忆;3. 始终让Claude查看自身代码的运行结果(包括执行和渲染)。其工作模式是在手机上并行启动多个Claude实例,基于规划模式制定方案后自动执行修改,从而高效完成任务。

推荐理由:Boris Cherny 的 Claude Code 工作流是「反直觉但真能省钱省时间」的实操手册,三条原则每一条都可以抄进团队规范,看完立刻能上线。
03:28
Claude:Blog(网页)精选
AI 评分 71/100
金融服务行业Claude部署指南发布

Anthropic发布金融服务行业Claude部署指南,详细介绍了Claude系列产品在金融研究、交易、承销、理赔及月末结算等场景的应用方案。指南包含产品矩阵、10个预置金融智能体模板(如招股书生成器、KYC筛查器等),并分享了AIG、澳大利亚联邦银行等机构的实践案例。同时,提供基础、试点、扩展三阶段实施路线图,旨在协助企业决策者与工程师规划AI落地路径,提升运营效率。


推荐理由:Claude 官方首次系统性给出金融行业的部署指南,从产品矩阵到预建代理模板再到三阶段路线图,做金融 AI 落地的可以直接拿过来对齐。

5月5日5月5日周二

星期二 · 6 条
23:03
Runway:News(网页)精选
AI 评分 55/100
60倍速冷启动:将同级GPU视为权重服务器

Runway平台团队开发的NCCLBack系统,通过P2P权重传输将模型冷启动时间从数分钟缩短至数秒。其核心创新在于让新启动的GPU推理节点直接从集群内已加载权重的同级GPU获取模型参数,而非从云存储重复下载。该系统利用GPU互连(如InfiniBand、NVLink)高达200-400 Gbps的带宽,相比传统存储下载的2-10 Gbps实现了数量级提升。通过Redis协调与NCCL广播原语,NCCLBack确保了数据传输的效率和正确性,使得大规模集群部署新模型时,冷启动时间不随节点数量线性增长,基本保持恒定。


推荐理由:Runway 工程师把 GPU 冷启动从分钟压到秒级,原理是让已加载权重的 GPU 直接「喂」给新同伴,而不是各自从存储下载。做大规模推理部署的团队值得细读。
08:00
OpenAI Developers(RSS)精选
AI 评分 69/100
OpenAI 发布 Realtime Prompting Guide:实时语音智能体提示指南

OpenAI 发布 Realtime Prompting Guide,指导如何为实时语音智能体编写提示词,涵盖 Realtime 2 推理、前置指令(preambles)、工具调用和精确实体捕获(exact entity capture)等关键功能。该指南旨在帮助开发者更有效地构建和优化基于语音的 AI 交互体验。


推荐理由:OpenAI官方出的实时语音代理提示指南,把preamble设计和工具调用讲透了,做语音应用的开发者可以直接照着调。
02:59
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 58/100
OpenAI 如何大规模交付低延迟语音 AI

OpenAI 重建了其 WebRTC 技术栈,以支持实时语音 AI 服务。新系统实现了低延迟、全球规模扩展和无缝的对话轮转。此次重构旨在为 ChatGPT 的语音模式等产品提供更流畅、更自然的实时语音交互体验,解决了大规模部署时面临的延迟与稳定性挑战。


推荐理由:OpenAI 把语音 AI 的低延迟秘诀摊开了,做实时语音产品的可以看看他们的 WebRTC 优化思路,虽然不太能直接抄,但方向值得参考。
01:16
Simon Willison 博客精选
AI 评分 75/100
Redis 数组类型交互式体验平台上线

Redis创始人Salvatore Sanfilippo提交了为Redis新增数组数据类型的PR,引入了包括ARCOUNT、ARDEL、ARGREP等在内的18个新命令。其中最引人注目的是ARGREP命令,它利用新集成的TRE正则表达式库,可直接在服务器端对数组值进行正则搜索。目前该功能已在一个分支中实现,开发者Simon Willison借助Claude Code构建了一个交互式在线沙盒,通过运行在浏览器中的WASM版Redis子集,供用户体验这些新命令。Salvatore还撰文详细介绍了在AI辅助下开发此功能的历程。


推荐理由:Redis 加数组类型可能改变很多缓存设计,Simon 这个 WASM playground 是把 PR 变成可试产品的最快路径,后端同学可以直接上手体会 ARGREP 的快乐。
00:14
阿绎 AYi@AYi_AInotes精选
AI 评分 71/100
一个100行的文件,干翻了所有LLM编码prompt一个100行的文件,干翻了所有LLM编码promptGitHub Trending第一,一周暴涨4.4万星🔥,目前已破11万星!没有框架、没有依赖、零配置。 就一个 CLAUDE.md 文件,把 Andrej Karpathy 反复吐槽的 LLM 编码坏习惯,浓缩成4条铁律。扔到项目根目录,Claude Code 启动自动读取,代码质量直接起飞。以前你要写几百字长prompt反复纠正它。 现在一次配置,全项目终身生效。 四条规则,每一条都精准戳中开发者痛点:1. 先思考再编码,不准默默做假设,模糊就提问,困惑立刻停下 2. 简约至上,只写最小可工作代码,不准搞没人要的抽象和灵活性 3. 手术式修改,只碰你要求的部分,不准顺便重构邻居代码 4. 目标驱动执行,先写成功标准,每一步都要可验证再也不会让它加个输入框,顺便重写整个表单。 再也不会让它改个bug,悄悄删掉三行关键注释。 再也不会让它写个工具函数,给你搞出五层抽象+十个配置。为什么爆成这样? 因为全世界的开发者都受够了。受够了哄模型、受够了反复说“别过度设计”、受够了它自作主张改代码。这个仓库的爆火,本质是一场集体反叛,我们不再指望模型自己变聪明,我们直接给它定规矩。最狠的是它的杠杆效应: 成本为零,diff更干净,返工更少,token浪费直接砍掉一半。还能把团队规范直接追加在后面,实现全局统一。这才是AI时代真正的生产力。 不是越来越复杂的Agent框架, 而是用最简单的方式,解决最痛的问题。🔥 仓库直达:https://github.com/forrestchang/andrej-karpathy-skills 快去试试,看看 Claude 到底能听话到什么程度👀一个名为CLAUDE.md的百行文件在GitHub上迅速走红,一周内获得超4.4万星。它没有依赖和配置,仅将Andrej Karpathy总结的LLM编码坏习惯浓缩为四条核心规则:先思考再编码、简约至上、手术式修改、目标驱动执行。开发者只需将其置于项目根目录,Claude Code等工具便能自动读取并遵循,从而显著提升代码质量,减少返工和token浪费。此举被视为对当前需要反复纠正AI模型的开发体验的集体反叛,以零成本方案为AI编码设定明确规范。
推荐理由:一个100行文件干翻一堆Agent框架,本质是开发者受够了哄模型,不如直接定规矩。如果你也用Claude Code,花一分钟扔进去,Token浪费砍半不是夸张。

5月3日5月3日周日

星期日 · 1 条
00:12
阿绎 AYi@AYi_AInotes精选
AI 评分 70/100
优化Claude使用策略:从昂贵聊天到高效生产工具$200/月的Claude Max 如果还天天撞限额? 那你就是从根上都用错了。我也是用了几个月才明白,咱们90%的人都在拿Opus烧钱聊天。我照着这套方法跑了下,基本零限额,效率反而翻倍。核心逻辑只有一个: 别把Claude当聊天机器人, 把它当精密生产工具。最浪费钱的行为,就是用Opus脑暴、试错、反复改需求。正确的顺序永远是: Haiku做规划、迭代思路、搭框架,所有东西都定死了, 最后一步再切Opus写最终版本。就这一条,直接帮你砍掉60-70%的token消耗。千万别搞那种几百条消息的超长聊天。 每一条新消息,Claude都会重读前面所有的上下文,越往后越费token,输出还会越来越乱。三个短聊天永远比一个长聊天好, 用Projects继承全局指令,无缝衔接。最神的是双文件记忆法。 在Claude Code的Cowork文件夹里建两个Markdown文件,Instructions.md写死你的所有规则和偏好, 再加一句“随时把我的新偏好更新到Memory.md”。以后你再也不用重复说“别用em dash”“不要写多余的注释”,Claude会自己记下来,越用越懂你。最后记住模型分层原则, 90%的任务根本用不着Opus。 Haiku干杂活、整理资料、写初稿,Sonnet做执行、写代码、调逻辑,Opus只负责最后10%的核心工作和最终润色。买额外credits通常也比直接升阶划算。这可不是普通的省钱小技巧,等于是是把Claude从昂贵玩具变成生产力放大器的完整操作系统。很多人花了最多的钱,却用出了最差的效果,就是因为搞反了顺序。兄弟们,现在就去把你的超长聊天全关掉,建那两个文件,明天你就会回来感谢我的😎推文指出,许多用户误将Claude Opus作为日常聊天机器人,导致频繁触及限额。核心解决方案是转变思维,将其视为精密生产工具。关键策略包括:使用Haiku进行规划与迭代,仅在最终步骤切换至Opus;避免冗长对话,采用多个短对话并结合Projects功能;通过"双文件记忆法"在Claude Code中建立指令与记忆文件,让系统自动学习用户偏好。遵循模型分层原则,让Haiku和Sonnet处理大部分任务,Opus仅用于核心工作与最终润色,从而显著降低消耗并提升效率。

Miles Deutscher: http://x.com/i/article/2047065639546941440


推荐理由:把Claude Max从烧钱玩具变成生产力放大器,关键不是你花了多少钱,而是你用Opus写了多少废话。看完这篇,明天你的限额焦虑应该能治好一半。