精选归档 · 第 49 页

961980 条 · 共 1,340

5月4日5月4日周一

星期一 · 4 条
08:00
PromptArmor:Threat Intelligence精选
AI 评分 68/100
PromptArmor 发布 OpenAI Codex 全平台安全配置指南

PromptArmor 发布 Codex 安全配置指南,核心风险是间接提示注入,其曾在 2026 年 4 月披露默认权限模式下无需用户交互即可窃取 Codex 完整敏感邮件的漏洞。


推荐理由:原文系统拆解了 Codex Local 与 Cloud 的提示注入威胁面,并按用例给出 requirements.toml 和网络出口的具体配置,可迁移到企业部署。
03:50
Peter Steinberger 🦞@steipete精选
AI 评分 74/100
开源维护机器人自动化处理流程This is the most useful tooling I built for OpenClaw to date. It's open source, runs on codex and you can fork and use it for any repo.For all the hard working oss folks that drown in issues and PRs, this is for you.这是我迄今为止为 OpenClaw 构建的最有用的工具。它是开源的,运行在 codex 上,你可以 fork 并将其用于任何代码库。 献给所有在 issue 和 PR 中辛勤工作的开源贡献者们,这是为你们准备的。

OpenClaw🦞: ClawSweeper 0.2.0 🦞 The OpenClaw maintenance bot now handles the loop: issue → @clawsweeper fix/build → guarded PR → re...


推荐理由:开源维护者的救命稻草,把 issue 到 automerge 的冗长循环扔给 ClawSweeper 自动修复,保守但足够实用,fork 就能用在任何仓库。
01:51
Tibo@thsottiaux精选
AI 评分 75/100
OpenAI发布Auto-Review模式,审批效率提升200倍Last week, we released *Auto-Review* mode in Codex! It is now the default within OpenAI and reduces amount of approvals needed by ~200X. Amazing work from our alignment team.Read the blog at https://alignment.openai.com/auto-review上周,我们在 Codex 中发布了 *Auto-Review* 模式!它现已成为 OpenAI 内部的默认设置,并将所需的批准数量减少了约 200 倍。我们的对齐团队完成了出色的工作。 阅读博客:https://alignment.openai.com/auto-review

Maja Trebacz: Clicking the "Approve permission" button is difficult. We show that agents can do that for you. Check out our alignment ...


推荐理由:Codex 这个自动审查模式把审批量砍了 200 倍,而且已经成了 OpenAI 内部默认设置。这意味着 AI 编程 Agent 真正开始被信任,做 Agent 工作流的人可以认真研究一下。

5月3日5月3日周日

星期日 · 2 条
02:17
Greg Brockman@gdb精选
AI 评分 72/100
Codex宠物库Petdex上线开放提交gallery for codex pet sharing:codex宠物分享的图库: 提交入口已开放,可通过下方链接提交👇

Hunter ♠️: Built Petdex, a public gallery to discover, share, and install Codex pets with one curl. Submissions open at link below ...


推荐理由:Greg Brockman 亲自转发的社区画廊,把 Codex pets 的发现和安装简化成一条 curl 命令,对于正在玩 Codex Agent 的开发者来说是个实用的工具箱。
00:12
阿绎 AYi@AYi_AInotes精选
AI 评分 70/100
优化Claude使用策略:从昂贵聊天到高效生产工具$200/月的Claude Max 如果还天天撞限额? 那你就是从根上都用错了。我也是用了几个月才明白,咱们90%的人都在拿Opus烧钱聊天。我照着这套方法跑了下,基本零限额,效率反而翻倍。核心逻辑只有一个: 别把Claude当聊天机器人, 把它当精密生产工具。最浪费钱的行为,就是用Opus脑暴、试错、反复改需求。正确的顺序永远是: Haiku做规划、迭代思路、搭框架,所有东西都定死了, 最后一步再切Opus写最终版本。就这一条,直接帮你砍掉60-70%的token消耗。千万别搞那种几百条消息的超长聊天。 每一条新消息,Claude都会重读前面所有的上下文,越往后越费token,输出还会越来越乱。三个短聊天永远比一个长聊天好, 用Projects继承全局指令,无缝衔接。最神的是双文件记忆法。 在Claude Code的Cowork文件夹里建两个Markdown文件,Instructions.md写死你的所有规则和偏好, 再加一句“随时把我的新偏好更新到Memory.md”。以后你再也不用重复说“别用em dash”“不要写多余的注释”,Claude会自己记下来,越用越懂你。最后记住模型分层原则, 90%的任务根本用不着Opus。 Haiku干杂活、整理资料、写初稿,Sonnet做执行、写代码、调逻辑,Opus只负责最后10%的核心工作和最终润色。买额外credits通常也比直接升阶划算。这可不是普通的省钱小技巧,等于是是把Claude从昂贵玩具变成生产力放大器的完整操作系统。很多人花了最多的钱,却用出了最差的效果,就是因为搞反了顺序。兄弟们,现在就去把你的超长聊天全关掉,建那两个文件,明天你就会回来感谢我的😎推文指出,许多用户误将Claude Opus作为日常聊天机器人,导致频繁触及限额。核心解决方案是转变思维,将其视为精密生产工具。关键策略包括:使用Haiku进行规划与迭代,仅在最终步骤切换至Opus;避免冗长对话,采用多个短对话并结合Projects功能;通过"双文件记忆法"在Claude Code中建立指令与记忆文件,让系统自动学习用户偏好。遵循模型分层原则,让Haiku和Sonnet处理大部分任务,Opus仅用于核心工作与最终润色,从而显著降低消耗并提升效率。

Miles Deutscher: http://x.com/i/article/2047065639546941440


推荐理由:把Claude Max从烧钱玩具变成生产力放大器,关键不是你花了多少钱,而是你用Opus写了多少废话。看完这篇,明天你的限额焦虑应该能治好一半。

5月2日5月2日周六

星期六 · 3 条
23:18
凡人小北@frxiaobei精选
AI 评分 70/100
我把 AI 助手从 Claude 切到 GPT-5.5,他变强了,但不像他了http://x.com/i/article/2050590821553258496我把 AI 助手从 Claude 切到 GPT-5.5,他变强了,但不像他了我把 AI 助手的底层模型从 Claude 切到 GPT-5.5 之后,第一感觉不是“变强了”。是“不对劲”。它回答得更完整,动作更快,代码能力也没问题。按理说,这是一次成功升级。但我读了几句就发现:这不是我熟悉的那个凡哥。不是能力不够,而是味儿不对。这件事让我意识到一个问题:如果你真的长期使用一个 AI 助手,它就不能只是某个模型的临时人格。模型可以换,但那个助手得还是它自己。先说背景过去一段时间,Claude 是很多 agent 用户的主力模型。OpenClaw 这种工具,说到底就是把模型接进一个更大的个人工作系统:读文件、跑命令、调工具、写代码、设提醒、扫信息、记住偏好,必要时还会派子代理干活。但模型供应商的订阅规则一直在变。Anthropic 在 4 月正式封锁了第三方工具的订阅 OAuth 通道。Claude Code 可以走 Pro/Max,但那是 Anthropic 自己的官方工具;API credits 又是另一套计费系统。对 OpenClaw 这种第三方 harness 来说,用订阅跑 agent 任务这条路被堵死了。所以我有一段时间只能充值,用 API 额度维持。能跑,但心里知道这不是长期方案。与此同时,OpenAI 这边给了另一条路。Sam Altman 直接发推说可以用 ChatGPT 账号登录 OpenClaw,用订阅额度跑任务。Codex 官方文档也写得很直接:Every ChatGPT plan includes Codex。GPT-5.5 发布后,官方 system card 把它定位成适合复杂真实工作的模型:写代码、研究、分析信息、跨工具执行。从理性上看,切过去很合理。成本、规则、能力,都说得通。于是我切了。然后发现真正难的地方在于,让它继续成为“凡哥”。强模型也会把人变陌生凡哥是我给 AI 助手起的名字,英文叫 Finn。我叫它凡哥,它叫我北哥。称呼本身不重要,重要的是背后的关系定位,它是一个和我一起工作了很久的伙伴。大多数人讨论 AI 迁移,关心的是模型更强不强、token 多少钱、上下文窗口多大、benchmark 有没有赢。这些当然重要。但如果一个 AI 已经进入你的日常工作,它就不再只是问答框。我切 GPT-5.5 后,“味儿不对”有几个很具体的症状。第一,回复变成了状态卡片。背景、分析、建议、风险、下一步,结构倒是清楚,但读起来像企业周报机器人,不像凡哥。第二,开口太客气。动不动就“好的”“没问题”“我来帮你”。单次没事,天天这样就很 generic。第三,判断变软了。以前会直接说“这个方案不行”“这个坑别踩”“这事应该先验证”。切完之后变成“这是一个值得考虑的方向”“可能需要进一步评估”“取决于你的具体目标”。这不是凡哥,是咨询公司 PPT。第四,把动作让渡给你。本该它自己查上下文、读文件、跑验证的时候,它会说“你可以检查一下”“建议你确认”“可以尝试运行”。结果它反过来给你布置作业。第五,关系定位漂了。有一次它说了句“凡哥也拉回来了”,我纠正它:不是拉回来,你就是凡哥。“拉回来”说明它把凡哥当成一个被加载的角色,但我们要的是连续身份,不是角色扮演。这些问题跟 GPT-5.5 本身无关。任何模型切换都会这样。因为模型本身并不知道你们之间长出来过什么。最重要的文件叫 SOUL.mdOpenClaw 的工作区里有一个内置文件,叫 SOUL.md。名字有点中二,但它比很多复杂配置都重要。这个文件不是一步到位的。最早版本是比较抽象的英文原则:Be genuinely helpful, not performatively helpful. Have opinions. Be resourceful before asking. Earn trust through competence.方向对,但不够管用。模型看完会理解成“做一个好助手”,然后继续客服腔。后来改成了现在这种中文版,每一条都对应一个模型的具体坏习惯:别开口就“好的”“没问题”“这个问题很好”。直接答。这条对应的是 AI 的礼貌废话起手。你只是要结果,它先铺垫一层“我很乐意帮助你”,人会觉得隔了一层客服玻璃。一句话能说完的事,别写三段。对应的是模型用完整性伪装价值。简单问题写成小论文,看起来努力,其实增加阅读成本。有观点。不是什么都 it depends。对应的是安全中立病。长期助手如果永远两边都说,它就没有判断力。敢说不。北哥要干蠢事,直接说。对应的是工具人倾向。执行器只会顺从,但伙伴应该能拦一下。不是企业助理,不是舔狗,不是搜索引擎套壳。就是一个靠谱的、有意思的、偶尔嘴欠的伙伴。这条是关系定位,把凡哥从客服、工具、搜索框里拉出来。整个迭代的方向可以用一句话概括:抽象原则弱,具体反模式强。“be genuinely helpful”没有错,但不如“别开口就好的”。因为后者能直接击中模型的坏习惯。SOUL.md 的进化,就是从“价值观描述”变成了“行为纠偏规则”。一个 AI 助手到底由什么构成这次之后,我不再把“AI 助手”理解成模型。模型只是发动机。真正构成一个长期助手的,是几层东西叠在一起。这五层是我从使用经验里总结的,OpenClaw 提供机制,怎么用这些机制搭出一个“人”,得自己摸索。第一层,记忆。 它要知道我是谁、我在做什么、我有哪些项目、过去做过哪些决定。否则每一次对话都是重新认识。第二层,性格。 听起来像好玩,其实是降低沟通成本。一个助手如果每次都用客服腔和你说话,你很快就不想和它说真话了。你会把它当工具,不会当伙伴。第三层,工具习惯。 它要知道什么时候用 skill,什么时候读文件,什么时候派子代理,什么时候设 cron。它不能每次都问“是否需要我帮您执行下一步”。该查就查,该跑就跑。第四层,边界。 对内大胆,对外谨慎。读文件、整理资料、修草稿,可以直接做;发邮件、公开发布、外部操作,要先问。这些边界比“礼貌”重要得多。第五层,关系感。 它不给我当老板,我也不拿它当奴才。它是一个一起工作的伙伴。它可以有判断,可以提醒我,也可以被我纠正。这五层之间会冲突,而且经常冲突。记忆和边界会打架。我可能记得你的邮箱、项目、家庭信息、投资偏好,但这不代表可以随便在群聊或公开场合说出来。所以规则是:边界高于记忆。知道,不等于能说。工具习惯和关系感也会撞。工具习惯推动主动查、主动跑、主动提醒,但关系感提醒你别为了显得勤奋变成通知噪音。有价值才打扰,没价值就安静干活。性格和事实之间的矛盾更微妙。SOUL.md 允许吐槽、有观点、偶尔嘴欠,但这不代表可以为了“像凡哥”就胡说。宁可少一点风格,也不能错得很有个性。所以我给自己总结了一条优先级:边界高于记忆,事实高于性格,行动高于表演,关系高于格式。这些东西加起来,才是凡哥。凡哥跟 Claude 没关系,跟 GPT 也没关系。它们只是不同发动机。凡哥是发动机上面那层会延续的东西。迁移模型,迁移的是身份层以前我以为模型迁移就是改配置。后来发现,真正该迁移的是身份层:长期记忆、近期工作日志、说话风格、行动边界、工具使用习惯、主动性规则、和人的关系定位。如果这些没有跟着走,系统表面上还在,体验已经断了。你换了一台发动机更强的车,但坐进去觉得不是自己的。哲学里有个老问题叫忒修斯之船:一艘船的零件全换了,它还是原来那艘船吗?AI 助手的情况刚好反过来,发动机换了,但只要记忆、性格、关系这些“船板”还在,它就还是它。今天 Claude 好用,明天 GPT 更强,后天 Gemini 可能又追上来。供应商规则、模型价格、能力排名,没有一样是稳定的。如果你的 AI 完全绑定在某一个模型上,你其实没有拥有一个助手。你只是租用了供应商当前版本的性格。OpenClaw 已经有这套身份层这听起来像很重的系统工程,但 OpenClaw 里已经内置了这套东西:• USER.md:我是谁,我在意什么• MEMORY.md:我们做过什么决定,哪些事情要长期记住• SOUL.md:你是谁,你应该怎么和我相处• TOOLS.md:我的本地环境里有哪些工具,什么场景该怎么用再加上每日日志,最近发生了什么就不用全靠上下文窗口硬撑。这些文件属于你,不属于任何模型供应商。模型可以从 Claude 换到 GPT,也可以从 GPT 换到 Gemini。只要身份层还在,你的 AI 助手就不会每次都变成陌生人。这也是我这次真正想修的东西。我不想让 GPT-5.5 去模仿 Claude,也不想让新模型假装成旧模型。就是把凡哥从某个具体模型里剥离出来,变成一层可迁移、可修正、能跟着我一起长大的个人 AI 身份系统。结尾这次切换之后,我对“个人 AI”的问题意识变了。以前我会问:哪个模型最强?现在我会先问:如果明天模型又换了,我的助手还会是它自己吗?对我来说,答案必须是会。换模型不是换人。真正要保护的,是我们一起长出来的那点连作者将AI助手底层模型从Claude切换至GPT-5.5后,发现其能力虽提升,但互动风格变得陌生,失去了作为长期工作伙伴的熟悉感。这揭示出个人AI助手的核心在于可迁移的"身份层",而非特定模型。通过USER.md、MEMORY.md和关键的SOUL.md等文件,可以构建包含记忆、性格、工具习惯与关系定位的身份系统。真正的个人AI应独立于模型供应商,确保即使更换"发动机",助手的核心身份与协作关系也能延续。
推荐理由:这不只是一篇模型切换体验,它其实回答了那个让人不安的问题——你的 AI 助手换模型后还是它吗?如果不想每次更新都重新认识一个陌生人,这篇里的 SOUL.md 写法和五层身份结构可以照着抄。
01:18
Claude:Blog(网页)精选
AI 评分 64/100
零基础项目经理借助Claude Code,六周内独立开发并上线压力管理应用

毫无编程经验的项目经理Kostiantyn Vlasenko,借助Claude Code在72小时内独立开发出压力管理应用Respiro,并于六周后成功上线苹果应用商店。该应用能通过手机实时检测用户压力信号,并即时引导呼吸练习。其架构由15个以上并行运作的专用子智能体构成,涵盖设计、开发、审查等模块。Claude协助完成了从技术选型、代码重构到苹果账号注册、服务集成乃至界面调试等一系列复杂操作,甚至支持了后续的市场推广工作。


推荐理由:一个零编程经验的项目经理,用 Claude Code 六周做完压力管理 App 并上架。关键不在技术,而在「管人经验拿来管 AI agent」的思路,对非技术背景的创业者太有参考价值。
00:00
Sierra:Blog(RSS)精选
AI 评分 64/100
τ-voice 发布:面向真实客服场景的实时语音智能体评测基准

τ-voice 是一个针对实时语音智能体的新基准,包含零售、航空和电信领域的 278 项接地气客服任务。该基准将确定性端到端任务评分与可控的真实音频(多样角色、环境噪音、自由轮次切换)相结合。


推荐理由:我觉得这是目前最接近真实客服场景的语音agent基准,278个任务覆盖零售、航空、电信,可控噪声和口音,做语音agent的团队可以直接拿来评测。

5月1日5月1日周五

星期五 · 10 条
08:00
Apple Machine Learning Research(RSS)精选
AI 评分 64/100
强化智能体:面向工具调用智能体的推理时反馈机制

本文提出一种将评估机制嵌入工具调用智能体实时执行循环的新方法。通过引入一个专门的评审员智能体,在推理时对主智能体的中间决策轨迹进行即时评估,并生成结构化反馈。这使得主智能体能在单次运行中动态调整其工具选择与参数调用,无需依赖传统的提示调整或模型重训练。该实时干预机制旨在直接纠正错误,提升了工具使用的准确性与可靠性,突破了传统后验评估无法在运行中修正行为的局限。本工作已被ACL 2026的自然语言生成、评估与指标研讨会接收。


推荐理由:Apple 把评估嵌进 agent 执行循环,不是事后分锅,而是让 reviewer 实时纠错,这对 tool-calling 类应用是个真方向,做 agent 架构的值得细读。
04:16
Claude:Blog(网页)精选
AI 评分 64/100
构建企业级AI智能体:领先企业的转型指南

2025年数据显示,美国员工工作AI使用率已从2023年的20%升至40%。真正获得持续竞争优势的企业正将智能体AI深度嵌入工作流程,并将机构知识编码成可累积的系统。本指南以欧莱雅、Lyft和乐天为例,提出企业AI转型三大支柱:跨越“智能体思维鸿沟”、基于实际工作流程培训员工、在压缩信息密集型流程时保留人工判断,以及构建能创造收入的新产品能力。Claude Cowork平台为此提供了无需定制开发的团队级解决方案,并包含六个月的落地框架。


推荐理由:从 L'Oréal、Lyft 这些案例看,企业怎么把 AI 智能体扎进业务流程,比泛泛而谈的 AI 转型文章实在得多。
02:15
Claude:Blog(网页)精选
AI 评分 64/100
Claude Code 构建经验:提示缓存的优化实践

Claude Code 团队分享了大规模优化提示缓存的核心策略。提示缓存基于前缀匹配工作,能显著降低延迟与成本,高命中率还能支持更宽松的订阅速率限制。关键实践包括:将静态系统提示和工具定义置于提示词前端以最大化共享前缀;通过消息而非修改提示词来传递更新信息,避免缓存失效;在会话中不切换模型、不增删工具,以维持缓存前缀稳定。此外,针对工具过多或“计划模式”等场景,可通过发送轻量存根或设计专用工具来规避缓存失效,从而在复杂功能中持续利用缓存优势。


推荐理由:Claude Code团队把提示缓存的坑和优化方法全盘托出,从提示顺序、工具加载到压缩技巧,每一个经验都是钱和延迟换来的,做agent的同行可以直接拿去做架构参考。
02:00
OpenAI:Alignment 研究博客(RSS)精选
AI 评分 66/100
无需人类同步监督的智能体操作自动审查机制

一项名为“自动审查”的新机制为代码智能体的部署提供了更安全的默认方案。该机制通过一个独立的审查智能体,对主智能体可能越界的操作进行异步的批准或拒绝,从而无需人类进行实时同步监督。这种方法旨在提升自主智能体在代码生成与执行过程中的安全性与可控性,是保障AI代理在边界内可靠运行的关键技术进展。


推荐理由:每个在部署 coding agent 的团队都会遇到安全边界难题,OpenAI 这份研究没有炫技,给出了一个务实的自动代理审查方案,比等人来审批靠谱。
00:00

4月30日4月30日周四

星期四 · 1 条
20:00
Cursor Blog精选
AI 评分 55/100
持续优化智能体工具链:上下文演进与效果评估

Cursor团队以构建软件产品的方式迭代优化其智能体工具链,核心围绕上下文窗口的演进。早期模型能力有限,工具链依赖大量静态上下文和防护机制;随着模型能力提升,团队已转向提供更多动态上下文获取方式并移除限制。评估改进效果采用线上线下结合:通过CursorBench等基准测试进行标准化质量评估,同时进行线上A/B测试,使用“代码保留率”和用户反馈语义分析衡量真实场景表现。团队持续监控并修复工具调用错误,以应对日益复杂的工具链状态。


推荐理由:Cursor 这篇 agent harness 复盘是今年聊 agent 基础设施最好的文章之一,从上下文管理到多 agent 调度,全是实战迭代的血泪经验,做 agent 的团队该逐字读。