精选归档 · 第 50 页

9811,000 条 · 共 1,340

4月30日4月30日周四

星期四 · 9 条
14:52
Alibaba Cloud@alibaba_cloud精选
AI 评分 65/100
Qwen3.6-Plus上线Together AI平台Qwen3.6-Plus is now available on @togethercompute. Ship it.Qwen3.6-Plus 现已在 @togethercompute 上线。快来使用吧。

Together AI: Introducing Qwen3.6-Plus from @Alibaba_Qwen, a 1M-context model built for real-world agents, agentic coding, and multimo...


推荐理由:Qwen 这次步子不小,直接把百万上下文、多模态推理和 agent 能力整合进一个模型,做 coding agent 的终于不用再拼拼凑凑了。
06:20
Google Research:Blog(网页)精选
AI 评分 57/100
谷歌研究团队应用实证研究辅助工具的四个领域

自去年秋季推出实证研究辅助(ERA)工具以来,谷歌研究团队已将其应用于多个科学领域以解决实际问题。在流行病学中,它助力流感与新冠预测;在宇宙学里,协助分析星系数据以探究暗能量;在大气监测方面,提升了二氧化碳排放的追踪精度;在神经科学领域,则用于解析大脑活动数据。这些实践表明,ERA能帮助科学家生成专家级的实证软件,其成果超越了黑箱模型,可发现兼具可解释性与机制准确性的解决方案,从而有效加速科学发现进程。


推荐理由:Google 把自家 ERA 工具在流行病学、宇宙学、气候监测、神经科学四个方向的实战案例摊开讲,虽然不是新模型发布,但对做 AI for Science 的人来说,这是一份难得的「AI 科研助手到底能干嘛」的全景参考。
02:43
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 74/100
秒级更新万亿参数--大规模分布式强化学习中的点对点权重传输技术

LMSYS团队针对SGLang中的强化学习工作负载,提出了一种基于RDMA的点对点权重更新机制,作为传统NCCL广播方法的补充。该设计利用源端CPU引擎副本和Mooncake TransferEngine进行P2P RDMA传输,将拥有1T参数的Kimi-K2模型的权重传输时间从53秒大幅缩短至7.2秒,提速7倍。其代价是每个训练等级需在CPU内存中额外占用一个32G的推理引擎副本。此优化最大限度地减少了网络冗余,允许推理服务器更快恢复rollout过程,且兼容所有主流开源模型。


推荐理由:LMSYS 把分布式 RL 训练的权重同步从 NCCL 广播改成 RDMA P2P,1T 参数模型传输快了 7 倍,做大规模 RL infra 的团队该认真看看这个工程方案。
02:41
Claude:Blog(网页)精选
AI 评分 66/100
企业级部署指南:如何利用Claude Cowork推动全员AI协作

Anthropic发布《企业级Claude Cowork部署指南》,旨在帮助非技术岗位员工规模化应用AI。该指南基于内部团队及Thomson Reuters等客户实践,提供了从试点到全面推广的完整路径。核心内容包括一个五级成熟度模型、试点用例评估方法以及为期六个月的组织级部署路线图。Claude Cowork作为桌面应用,能深度集成本地文件、Slack、Google Drive及浏览器,并结合Claude for Excel/PPT实现跨文档工作流,适用于金融、法律、销售等多行业的生产场景。


推荐理由:Claude Cowork 把 agent 能力从开发者命令行搬到全公司桌面,配了五级成熟度模型和六个月落地路线图,企业 IT 负责人和产品经理值得拿这份指南当部署参考。
02:36
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
代理商现在可以创建 Cloudflare 账户、购买域名并进行部署

Cloudflare宣布其代理商合作伙伴现可直接创建Cloudflare账户、购买域名并部署服务。这一功能整合了账户创建、域名注册和项目部署流程,简化了代理商的管理与操作步骤。此举旨在提升合作伙伴的自主性和效率,进一步扩展Cloudflare的生态系统与服务覆盖范围。


推荐理由:Cloudflare 把账户注册、买域名、部署全开放给 Agent,等于给 AI 发了张建站许可证,做自主 Agent 和自动化运维的人可以直接拿来用。
00:00
Augment Code 博客(网页)精选
AI 评分 67/100
Augment Code 实测 Karpathy 风格规则让编码 Agent 更省时省成本,但代码质量未提升

Augment Code 在 AGENTS.md 中加入约 2.5k 字符的 Karpathy 风格编码规则,用 Auggie、Claude Code 和 Codex 对 40 个 OpenClaw PR 各跑 6 次对照测试。


推荐理由:原文以 40 个 OpenClaw PR 的对照实验给出 Karpathy 规则对三个编码 Agent 的效率与质量影响,结论可迁移到自己的 AGENTS.md 配置。

4月29日4月29日周三

星期三 · 11 条
23:40
Claude:Blog(网页)精选
AI 评分 58/100
智能体时代的产品开发:Claude Managed Agents 如何解放产品经理

Claude产品经理Jess Yan分享了处于测试版的Claude Managed Agents如何改变其工作流程。这套可组合的API能大规模构建和部署云端智能体,使她能在短时间内将想法转化为可运行的原型。她的日常工作由此分流:使用Claude进行开放式探索,然后利用Claude Code基于Managed Agents编写定制智能体来自动化特定任务,如采用分析和舆情监控。这些智能体接管了以往难以规模化的操作性工作,让她能将更多时间投入到与团队和用户的创造性合作中。


推荐理由:Anthropic PM公开用Claude Managed Agents搭建数据分析、舆情监控和演示生成agent的真实流程,对于想要用agent重构产品开发节奏的团队有实际参考价值,但不算爆炸性更新。
20:00
OpenRouter:Announcements(RSS)精选
AI 评分 60/100
OpenRouter 推出 CLI 创建账户功能,集成 Stripe 计费

运行 stripe projects add openrouter/api 即可从命令行创建 OpenRouter 账户、获取 API 密钥并配置 Stripe 计费。AI 智能体同样可自动化完成该操作,无需手动注册。


推荐理由:OpenRouter 把注册和计费全塞进一条 CLI 命令,Stripe Projects 加持,agent 都能自己开户了,重度 API 玩家可以省点事,不过就一工具链缝合,不打开也知道。
20:00
Cursor Blog精选
AI 评分 75/100
使用 Cursor SDK 构建可编程智能体

Cursor 正式推出 SDK 公开测试版,开发者仅需几行 TypeScript 代码即可构建和部署智能体。该 SDK 提供与 Cursor 应用相同的运行时、框架及前沿模型(如 GPT-5.5)支持,并允许将智能体部署于本地或 Cursor 云的专用虚拟机。借助其生产级云基础设施,如安全沙箱和持久状态管理,智能体正从个人工具演变为组织的可编程基础设施。许多团队已将其集成至 CI/CD 流水线、工作流自动化及核心产品中。


推荐理由:Cursor 把自家产线拆出来给外部用,对于想把 AI 代理嵌入 CI/CD 或产品的团队,省掉了自建完整 agent 栈的麻烦,对做自动化编码的开发者是个必看的更新。
10:37
Greg Brockman@gdb精选
AI 评分 73/100
Codex超级应用七项核心能力详解a great codex tutorial:一个很棒的Codex教程: 这些是7种知识工作能力… 在超级应用Codex内部 00:00 介绍 02:19 能力1 - 完整文件访问 07:41 能力2 - 持久记忆 10:46 能力3 - 插件 13:52 能力4 - 技能 19:22 能力5 - GPT图像访问 21:03 能力6 - 浏览器与计算机使用 23:58 能力7 - 自动化 25:31 额外功能 - 编年史 27:21 总结

Riley Brown: Learn 95% of Codex in 28 minutes These are the 7 knowledge work capabilities... inside Codex, the super-app 00:00 Intro ...


推荐理由:Greg Brockman 亲自推荐,Riley Brown 这个 28 分钟速览把 Codex 的 7 大能力拆得干净利落,想做复杂自动化的开发者看完就能直接上手。
09:35
阿绎 AYi@AYi_AInotes精选
AI 评分 76/100
蚂蚁发布Ling-2.6系列模型,以极致token效率推动AI生产落地竞赛说个暴论,2026 年 AI 行业的转折点,不是 GPT-5.5,也不是 o3,是蚂蚁@AntLingAGI 刚刚发布的 Ling-2.6-1T。我用 Ling-2.6-1T 跑了一个查理芒格的 100 个思维模型的硬核任务, 结果真的太炸了,具体大家看视频演示。当大家都在卷参数、卷推理分、卷更长上下文, 只有它反其道而行之,把 token 效率 当成了第一公民。最震撼的是这组数据:在 Artificial Analysis 全评测中, 它展现出极高的智能-输出比(生成 16M tokens),整体 token 成本可降至可比模型的约四分之一, 综合智能却接近 GPT-5.4 的非推理水平,直接落在所有模型都梦寐以求的“高智能 + 极低生产成本”象限。 这才是真正的生产级 AI,而不是实验室刷榜玩具。Agent 时代最大的痛点从来不是模型不够聪明,而是用不起。一个复杂任务调用十几次模型、几十次工具、拉几百 K 上下文,token 成本指数级爆炸,很多 Agent 方案一到规模化就死掉, Ling 把这个天花板直接抬高了数倍。它走的是和 o1 类模型完全相反的路线:别人靠慢思考堆 token 刷榜, 靠 MoE 优化的 Fast-Thinking 机制实现又快又准。写代码、搭 UI、编排 Agent、多步工作流——我们每天 90% 的事, 根本不需要深度多跳推理,需要的是精确、稳定、快、便宜。而这些,Ling 全部做到了:SWE-bench Verified SOTA 级表现(72.2+)、AIME26 高分、指令遵循和工具调用榜单全面领先。蚂蚁的底气很简单:背靠支付宝 13 亿用户 + 全世界最复杂的金融支付场景,天然拥有海量真实 Agentic 数据。Ling 系列从一开始就不是为了刷榜,而是为了每天处理上亿次生产请求而生。更狠的是它的打法:OpenRouter 已上线一周免费 API(262K 上下文), 官方确认即将开放权重——这明显在抢生态,和当年 DeepSeek 路数一样,但这次握着的是生产级效率这个最大杀器。这意味着2026 年的游戏规则彻底变了:不再是谁参数多谁牛,而是谁能在真实生产成本下跑赢。过去的刷榜竞赛已进入尾声, 真正的生产落地竞赛才刚刚开始。蚂蚁集团发布Ling-2.6系列模型,通过MoE架构与Fast-Thinking机制,将推理激活率降至7%,在实现接近GPT-5.4非推理水平综合智能的同时,大幅降低token成本。该模型在SWE-bench Verified等真实Agent场景测试中表现领先,旨在解决Agent规模化应用的成本痛点。目前已在OpenRouter提供免费API并即将开源,推动行业焦点从刷榜转向生产落地。其高效率特性尤其适合高频任务,在部分任务中速度比Claude Sonnet 4.6快6倍、成本低50倍。

阿绎 AYi: 后续来了兄弟们,卧槽真的太炸了,同样的任务,同样的配置,速度比Claude Sonnet 4.6还快 6 倍,成本低约 50 倍, openrouter 和 官方 API 均限时免费 1 周使用时间,白嫖的机会,冲啊兄弟们! 我上周那条讲E...


推荐理由:把 token 成本砍到对手四分之一而智能分不降,Agent 规模化终于有了真正的成本解决方案,做 Agent 的必看。
09:35
Tomer Tunguz 博客(VC 分析)精选
AI 评分 63/100
AI销售中的三个核心问题

AI销售策略正从询问软件预算转向三个核心问题:软件总预算、劳动力总预算,以及客户期望三年后两者的比例。这一转变将销售对话提升至战略层面。当前数据显示,销售、支持和工程部门的人力与软件成本比分别为10:1、4:1和最高25:1,高比率意味着巨大的AI替代潜力。新的销售流程分为两步:先切入现有软件预算,再拓展至AI所释放的劳动力预算,最终目标是重新定义企业对成本结构的认知。


推荐理由:Tunguz 用一张劳动力/软件支出比率表把 AI 销售的底层逻辑讲透了,做 ToB SaaS 或 Agent 产品的人看完会重新想自己的定价天花板在哪。
08:00
Together AI 研究与产品博客(RSS)精选
AI 评分 73/100
Together AI 上线 DeepSeek-V4 Pro,支持 512K 上下文

Together AI 上线 DeepSeek-V4 Pro,Serverless 推理提供 512K token 上下文窗口,模型级支持 1M 上下文,可迁移至专用基础设施获得完整 1M 上下文与预留容量。


推荐理由:原文给出架构、上下文窗口、推理模式和逐项定价,读者可据此评估该模型是否适合长上下文工作负载。
00:00