精选归档 · 第 18 页

341360 条 · 共 1,340

7月16日7月16日周四

星期四 · 5 条
08:21
公众号:数字生命卡兹克精选
AI 评分 68/100
远程操控Agent干活方案:Codex主力 + UU远程兜底

作者分享了一套远程使用Agent的组合方案:以Codex的远程控制功能作为主力,通过ChatGPT App连接家中24小时开机的Mac Mini,同步所有开发任务、规则和Agent记忆;遇到扫码登录、图形界面操作等Codex难以处理的场景时,用网易UU远程在手机上直接操控电脑完整桌面。UU远程完全免费,支持多设备协同,无需局域网或公网配置。


推荐理由:卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。
08:00
Modal 官方工程博客(RSS)精选
AI 评分 63/100
Modal 重写沙箱平台,1 分钟内启动 100 万个并发沙箱

Modal 宣布从零重写核心沙箱平台,新系统可并发运行数百万个沙箱,并演示了在 1 分钟内创建全部 100 万个沙箱,平均每秒创建约 1.85 万个。


推荐理由:原文由 Modal 工程团队亲述架构重写思路与实测数据,读者可以了解大规模沙箱系统如何绕开中心化协调的瓶颈。
07:04
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
开源编程智能体内存方案发布,通过 SSH 同步

一个面向编程 AI 智能体的开源内存项目在 GitHub 发布,支持通过 SSH 同步记忆数据。该项目允许智能体跨会话保留上下文,无需依赖特定云服务,用户可自托管。代码已开源,便于开发者集成与定制。


推荐理由:给Claude Code、Cursor这些编程代理加了个可同步的持久内存,通过SSH就能跨机器共享上下文,做多机协作开发的可以试试。

7月15日7月15日周三

星期三 · 10 条
17:13
公众号:火山引擎精选
AI 评分 69/100
Doubao-Seed-Evolving 升级:支持 1M 上下文,长程任务能力超越 Doubao-Seed-2.1-pro

火山引擎升级 Doubao-Seed-Evolving,新增 1M 超长上下文支持,可单次处理大型代码仓库、长篇文档等大规模信息。该模型在长程任务中表现更稳定,开发者众测质量评分超越 Doubao-Seed-2.1-pro,且消耗 tokens 更少、工具调用轮次更简洁。现已上线火山 Agent Plan,单月套餐限时 9.9 元起,参与体验奖励计划可享调用成本立减 20%。


推荐理由:1M上下文将大型代码仓库和长文档纳入单次处理范围,长程任务稳定性的提升更直接地影响智能体复杂步骤的可靠性,统一ID则省去了频繁切换模型版本的工程开销。
17:12
公众号:京东JoyAI精选
AI 评分 67/100
全国首个"模型券"即时补贴平台上线京东云

北京经开区在全国率先试点运行“模型券”即时补贴平台,由京东科技集团提供技术支持。企业购买模型服务时可在京东云优惠价基础上叠加补贴,以1000元券包为例实际支付最低可降至350元,补贴比例最高达65%。平台支持多模型调用,企业完成四项线上流程即可即时抵扣,算力券补贴功能也将加快上线。


推荐理由:补贴从事后申报变为消费时自动抵扣,对现金流敏感的中小企业,降低初次调用门槛的意义大于折扣比例本身。
16:41
IT之家(RSS)精选
AI 评分 70/100
金山办公推出 WPS Comate AI 办公客户端

金山办公在2026 AI生产力大会上推出面向员工的AI办公客户端WPS Comate,可连接组织数据与流程。该产品提供AI岗位专家、Skill技能生态、自动化任务等六大模块,并支持云端与本地双任务模式,个人用户可直接下载体验。


推荐理由:金山办公把WPS Comate从聊天工具升级成能连接组织数据、自动执行任务的AI办公平台,对国内WPS用户群是个实际提效选项,但具体落地效果和第三方集成深度还有待验证。
10:42
AYi@AYi_AInotes精选
AI 评分 78/100
Airtap iMessage 新功能:发条短信让 AI 替你操作手机刚演示完帮我刷 TikTok,转头就跑通了星巴克点单,AI真的无感的刚我点好了一杯美式,感觉Airtap 这步迈得比预想的狠啊。你不用装 TikTok,也不用装星巴克 App,甚至不用开任何新软件,给手机通讯录里的号码发条 iMessage,它能直接替你选品加购走到结账页,全程靠视觉模拟真人点屏幕,不是对接专属 API。原推说 “手机 = 装 App 的逻辑要重想”,现在这个判断又实了一步。 也就是说它不仅能替你处理信息,还能替你替你完成交易, 当然最后支付还得你自己接手,毕竟真金白银的账号没人敢直接交出去,信任这道坎所有 Agent 厂商肯定是都绕不过去的,我觉得当触发服务的门槛,从下载注册一个 App 降到发一条短信,那原来的agent的入口逻辑,真的在一点点碎掉~Airtap 推出 iMessage 新功能,用户只需给美国号码发一条 iMessage,其云手机上的 AI Agent 就能通过视觉模拟点击,替用户完成 TikTok 刷视频、星巴克点单等操作,无需安装对应 App。其架构分为三层:大脑(理解指令)、AutoPilot(视觉操控屏幕)、云手机(24小时在线)。但支付等敏感操作仍需用户手动完成,信任与授权仍是所有 Agent 厂商的难题。

AYi: 卧槽真的有点炸裂兄弟们,我在国内连 TikTok 都装不了,结果在手机里发了条 iMessage,一个远在美国的 AI Agent 竟然替我注册了一个TikTok号,还帮我刷完了 10 条 TikTok 热门视频,把视频总结都直接发了回来,...


推荐理由:阿易实测 Airtap 从刷 TikTok 到点星巴克,把 Agent 从信息处理推到交易环节,虽然最后支付还得手动,但不用装 App 就能办事这条路,真的在敲碎原有产品入口逻辑。做产品的值得盯着,信任问题也是所有 Agent 绕不过去的。
10:40
公众号:通义实验室(千问)精选
AI 评分 73/100
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。


推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
10:31
公众号:通义实验室(千问)精选
AI 评分 78/100
Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?

阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。


推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。
10:10
公众号:卡尔的AI沃茨精选
AI 评分 71/100
开源 LLM TODO Skill"阿福":用 Claude Code 和 Codex 实现知识管理到排期自动化

作者基于 API 版 Fable5 和 Codex 开发了开源 TODO Skill“阿福”,用于将收件箱中的待办资料自动转为 Markdown 任务卡,识别信息不完整项(如视频链接需通过 yt-dlp 和本地 Whisper 提取字幕),并支持批量排期、AI 分组合并、拖拽调整周视图及同步到 Mac 日历或飞书日历。项目已开源在 GitHub,安装仅需一条命令。


推荐理由:卡尔把三年知识管理教训封装成一个能自动扫描、合并排期的 TODO Skill,如果你也被碎片信息淹没,这个工具比任何大纲都实用。
08:10
公众号:数字生命卡兹克精选
AI 评分 64/100
每天Vibe Coding 16小时,作者分享Fable 5与GPT-5.6 Sol的AI开发流程

作者每天Vibe Coding约16小时,认为Claude Fable 5在大型方案初版设计上“当世独一档”,GPT-5.6 Sol能有效纠错并优化方案。核心流程为:Fable 5出方案初版 → GPT-5.6 Sol审查纠错 → 在Codex中开启“目标模式”全自动化执行,最长曾连续运行17小时。


推荐理由:卡兹克把每天16小时Vibe Coding磨出的流程讲透了,Claude出方案、GPT纠错、Codex目标模式全自动执行,这条流水线能让你的开发瓶颈从写代码转移到测试和方案设计上,值得一试。
00:37
Hacker News:AI 热帖精选
AI 评分 73/100
Juggler:一款开源 GUI 编程智能体,由 JUCE 创建者开发

Juggler 是一款开源 GUI 编程智能体,提供可视化工作台,支持可检查的工具调用、分支线程和可编辑上下文。会话以树状结构组织,而非线性聊天记录,用户可创建子线程、回溯、比较和编辑。所有关键信息以 Finder 风格 Miller 列展示。Juggler 支持本地、远程或同时运行,桌面应用与浏览器可连接同一会话。模型支持包括 Claude Code、OpenAI、Gemini、Ollama、OpenRouter、Z.AI、Deepseek 等。后端使用 Go 和 Wails,UI 为 HTML/JS。


推荐理由:我觉得 Juggler 把 AI 编码的交互从聊天记录变成了可编辑的树,这下能细致管理多个修改分支了,而且完全开源,做软件的值得试一下。

7月14日7月14日周二

星期二 · 4 条
17:59
公众号:小红书技术(dots.llm)精选
AI 评分 64/100
小红书企业级 AI 个人助理:从 0 到全员覆盖的架构实践

小红书以 3 人 3 天推出内测版本,约一个月实现全员覆盖,核心是 AI Native 项目运作机制。技术选型基于 OpenClaw 二次开发,通过 Seal AI Zone 隔离集群与 NEX 沙箱解决安全,Self-GC 使输入 Token 下降 10%~15%、Auto 模式路由使成本降低 69%,并自研 LLM Wiki 三层记忆架构与 Skill Hub 生态。


推荐理由:从物理隔离到三层记忆,这套方案把 OpenClaw 定制为企业个人助理,沙箱和成本控制细节对同类实践有直接参考价值。
17:57
Google AI:DEV 作者专属(RSS)精选
AI 评分 66/100
Google ADK 2.4.0 发布:Agent 可直接触发动态工作流

Google 发布 ADK 2.4.0,允许将 Workflow 直接注册为 Agent 的工具列表中的一等工具,使协调 Agent 能自动调用动态工作流。该模式通过 @node 装饰器定义动态执行节点,支持在运行时根据用户输入的任务列表迭代调用子 Agent 生成执行计划。示例使用 gemini-3.5-flash 模型实现任务协调,代码已开源至 devrel-demos 仓库。


推荐理由:ADK 2.4 把动态工作流直接注册成 Agent 的工具,补齐了多智能体编排里缺失的那块拼图,做复杂 Agent 的可以直接抄这个模式,代码拿来就能跑。
17:10
公众号:卡尔的AI沃茨精选
AI 评分 75/100
实测LibTV Agent:100个AI视频工作流重组为Skill,实现创意自由

LibTV推出Agent功能并内置Skill Hub,提供100多个覆盖武侠电影、皮克斯动画广告、电商口播等类型的视频Skill。用户输入想法后,Agent会分析需求并询问方向,自动生成视频分镜并串联成完整节点工作流,每个节点可查看和修改提示语。生成后LibTV会启动自查机制,自动检测并返修有问题的镜头。故事板视图提供图片与视频资产总览,支持在成片中直接打开剪辑时间线进行精细调整。用户还可自行创建Skill,上传三个文件即可,无需编程。实测中,Agent能输出剧情连贯、带粤语配音的成片,并支持双语字幕生成。


推荐理由:LibTV把成熟的视频流程做成可复用的Skill,并开放自定义上传,让创作者无需从节点开始,直接输出接近成片的作品,对于想缩短想法到成片距离的人,这是一个值得上手的效率工具。
00:00

7月13日7月13日周一

星期一 · 1 条
00:35
AYi@AYi_AInotes精选
AI 评分 75/100
腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户这个我看第一眼直接卧槽,效果有点炸裂, 腾讯这几个月到底发生了什么,前面组织架构调整,老登高管退位,年轻一代掌权的结果吗? 兄弟们看这个,腾讯Hy3 把你摄像头直接调起来了, 手往镜头前一伸,整只手的骨架实时描出来,张开手掌,粒子炸开融解, 握拳,又被吸回去重新拼成图。双手一拉,整团粒子跟着变形, 帧率飙到一百多,硬是一格没掉腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备自检和主动说明不足的能力。

AYi: 最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 ,...


推荐理由:腾讯Hy3 不拼参数拼干活效率,直接集成十亿用户,这是国产模型第一次把 Agent 底座铺到日常生活里,比刷榜重要得多。