内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-5
精选全部日报更多
反馈

全部 AI 动态

全部动态今日 219 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
全部 AI 动态
2026年9月8日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点

9月8日今天9月8日 周二

星期二 · 40 条
21:13
OpenAI:官网动态(RSS · 排除企业/客户案例)
AI 评分 19/100
OpenAI:更强大且更实惠的 AI 如何拓展人与企业可完成的工作

OpenAI 探讨更强大且更实惠的 AI 如何拓展个人与企业可完成的工作范围,并让增长更具经济性。文章聚焦于 AI 能力提升与成本下降带来的实际应用空间扩展,而非发布具体新模型或产品。

21:10
SemiAnalysis@SemiAnalysis_
AI 评分 57/100
SemiAnalysis 称 TPUv7 Ironwood 在 TorchTPU 同口径对比下单位成本性能超 Blackwell Ultra 50%ALERT🚨🚨: On apples-to-apples InferenceX Comparisons, TPUv7 Ironwood achieves 50% better perf per dollar than Blackwell Ultra on the new TorchTPU external inference stack!TorchTPU brings native PyTorch to TPUs, & along with Google open-sourcing a bunch of their Pallas inference kernels, Google has laid out a solid foundation for TPU to rapidly externalize. We at SemiAnalysis strongly believe that TPU externalization is heading in the right direction and moving full steam ahead.译SemiAnalysis 称在 InferenceX 同口径对比中,TPUv7 Ironwood 借助新推出的 TorchTPU 外部推理栈,单位美元性能比 Blackwell Ultra 高 50%。TorchTPU 为 TPU 带来原生 PyTorch 支持,加上 Google 开源多款 Pascal 推理内核,SemiAnalysis 认为 TPU 外部化正在快速推进。
现象/趋势部署/工程
21:07
OpenBMB@OpenBMB
AI 评分 24/100
MiniCPM5-2B 在 RTX 3080 上流畅运行获赞Love seeing MiniCPM5-2B flying on an RTX 3080! Highly responsive agents on older GPUs is exactly the kind of edge performance we’re aiming for. Thanks for the demo 🔥译很高兴看到 MiniCPM5-2B 在 RTX 3080 上流畅运行!在较旧的 GPU 上实现高响应智能体正是我们追求的边缘性能。感谢演示 🔥

GooGZ AI: MiniCPM5-2B absolutely flies on my RTX3080. Look at it go! Amazing local model if you need a highly-responsive agent on ...

21:07
OpenBMB@OpenBMB
AI 评分 52/100
面壁智能 OpenBMB 开源 MiniCPM5-2B 背后的 RL 训练栈 Meshy 与 JustRL IIYesterday, we open-sourced MiniCPM5-2B. Today, we’re opening up the RL stack behind it.Meshy is a service-based RL training framework that decouples inference, rollout, and training into independent services over a unified data plane. • Supports on-policy, bounded off-policy, and fully asynchronous RL • Recipe-driven SPMD placement, built on SGLang + TorchTitan • Unified data plane for tensors and control signals • Ready-made recipes for MiniCPM5-1B / 2.6B, including 128K context-parallel trainingJustRL II introduces a critic-based approach for more precise token-level credit assignment across long reasoning chains, enabling more stable long-horizon RL for small language model.Together, Meshy and JustRL II form the RL stack behind MiniCPM5-2B.🔧 Meshy: http://github.com/OpenBMB/Meshy 📝 Meshy blog: http://maydomain.notion.site/meshy-blog-en 📝 JustRL II: http://panhaoxuan.notion.site/justrl-ii-scaling-small-llms-to-128k-reasoning-with-a-critic 🤗 Hugging Face: http://huggingface.co/openbmb/MiniCPM5-2B译面壁智能 OpenBMB 在开源 MiniCPM5-2B 后,进一步开源其背后的 RL 训练栈。Meshy 是服务化 RL 训练框架,将推理、rollout 和训练解耦为统一数据平面上的独立服务。
智能体开源/仓库推理部署/工程
20:58
IT之家(RSS)
AI 评分 72/100
OECD 报告:少用 AI 完成课业的学生整体表现优于常用 AI 的学生

OECD 最新教育报告显示,不用或少用 AI 完成课业的学生整体表现优于经常使用 AI 的学生,样本覆盖 91 个国家超过 76 万名学生。从不使用 AI 起草写作作业的学生科学平均分为 509 分,每天使用者仅 481 分,差距约相当于一年半教学量;报告强调结果取决于使用方式,每周使用一两次且以学习为目的的学生成绩反而最高,课堂上常被要求评估 AI 生成信息的每天使用者成绩高出 13 分。

现象/趋势
20:58
IT之家(RSS)
AI 评分 55/100
苹果收购脑成像公司 Sonera,有望用于 Apple Watch 健康功能

苹果已于 2026 年 5 月完成对加州脑成像公司 Sonera 的收购,据欧盟重大收购交易数据库记录,但双方均未正式宣布,Sonera 网站已下线。Sonera 研发非侵入式磁传感器,可检测大脑和肌肉活动产生的磁信号,此前曾获 1,100 万美元融资并推出用于肌肉感知的 S1 芯片;文章推测该技术未来或用于 Apple Watch 健康功能,如持续监测神经肌肉系统疾病。

行业动态
20:40
Chubby♨️@kimmonismus
AI 评分 30/100
用户吐槽Anthropic模型表现逼其降级It's absolutely insane that even Reddit's Claude subreddit is now full of people complaining about Opus and Fable.And I unfortunately have to agree. It's truly absurd that the only viable solution is to downgrade to Opus 4.6.OpenAI is solving a Millennium Problem, and Anthropic can't even get their models to give reasonable answers. Completely crazy.I'll keep going until Anthropic finally changes this.译Reddit 上连 Claude 的 subreddit 现在都满是抱怨 Opus 和 Fable 的人,这实在太疯狂了。 不幸的是,我不得不同意。唯一可行的解决办法居然是降级到 Opus 4.6,这真的很荒谬。 OpenAI 在攻克千禧年难题,而 Anthropic 连让模型给出合理回答都做不到。简直离谱。 我会一直说下去,直到 Anthropic 最终改变这一点。
20:39
AYi@AYi_AInotes
AI 评分 62/100
架构师提出 Claude Code 项目结构标准,用分层 CLAUDE.md 避免 Agent 上下文膨胀分享一套由架构师 Brij Kishore Pandey 提出的标准, 是目前避免 Agent 上下文膨胀最优雅的工程解法。90% 的人都把 CLAUDE.md 当成普通的提示词文件,难怪你的 AI 永远像个乱改代码的弱智实习生: 把代码规范、API 格式、业务逻辑全往根目录死命塞, 模型还没动工,注意力就被几千行无用说明给稀释光了。想让 Claude Code 真正变成常驻在你代码库里的资深架构师, 你需要的不是写更长的 Prompt,而是这套把上下文物理切开的项目解剖学:1️⃣ 根目录只放极简骨架(四维契约): 只写系统是做什么的目标、文件在哪的地图、允许禁止什么的死规则,以及怎么完成任务的工作流,绝不堆砌具体代码;2️⃣ 业务上下文下沉到子目录: 很多人不知道 Claude 会自动读取子目录的独立记忆,在 src/api 和持久化目录下分别建局部 CLAUDE.md,模型钻进哪个模块才读哪份手册;3️⃣ 工作流封装进 .claude/skills: 代码审查、重构、发布流程不要每次口头重打,全部固化成可复用技能,用完即走;4️⃣ 刚性护栏交给 .claude/hooks: 关键改动前强制触发自动化检查,不符合规范直接代码级打回,绝不靠模型的自觉。提示词做减法,工程结构做加法, 保持上下文的最小化与精确性,模型才能在你的代码库里大杀四方。你现在的项目根目录,还塞着一份几千字的大杂烩提示词吗?译作者转述架构师 Brij Kishore Pandey 提出的一套 Claude Code 项目结构方法,用于避免 Agent 上下文膨胀。核心做法是根目录 CLAUDE.md 只写目标、地图、规则和工作流的极简骨架,业务上下文下沉到 src/api 等子目录的局部 CLAUDE.md,工作流固化进 .claude/skills,刚性检查交给 .claude/hooks。
智能体教程/实践编码
20:29
凡人小北@frxiaobei
AI 评分 71/100
数学家 Buckmaster 借助 Claude 与 Codex 公布流体方程结果,并公开与 OpenAI 的沟通争议这是一件挺炸裂的事,值得任何一个。数学家 Tristan Buckmaster 和 Levent Alpöge 借助 Claude、Codex 等模型,公开了三个流体方程相关的结果。 其中最受关注的一项,是三维不可压 Euler 方程在光滑外力下的有限时间爆破。他们还用 Lean 对证明做了形式化验证。单看这部分,已经足够重要了。但数学之外,又冒出了一条更复杂的线。它触及了一个事实,当研究过程进入 AI 平台,谁能看见这些过程,谁又可能从中获益。下面这部分,目前主要来自 Buckmaster 的单方陈述。按照他的说法,当时外界已经开始流传“Anthropic 解决了一个重大数学问题”的消息,Alpöge 也收到提醒,说他们的进展已经传到了 OpenAI。9 月 3 日,Buckmaster 主动给 OpenAI 的一位数学家发邮件,确认两人确实有成果即将发表,同时说明这是私人合作,不代表任何一方雇主。他没有透露证明细节。对方当天回复,希望获得一些信息,以避免双方在同一个方向上竞争。9 月 6 日,双方进行了两次通话。Buckmaster 称,他被告知 OpenAI 的一个内部模型已经得到一份大约 100 页的证明,内容是光滑外力下的 Navier-Stokes 有限时间爆破。他没有看过这份证明,OpenAI 目前也没有把它公开出来。Buckmaster 继续追问这项工作是什么时候开始的。据他的陈述,通话中最终确认,第一批提示是在他们的研究进展传到 OpenAI 之后才发送的;背后还包括一个团队、多种尝试和大量算力。他还称,OpenAI 随后提出两种发表方案。其中一种,是由 Buckmaster 单独署名介绍 OpenAI 的结果,同时将任职于 Anthropic 的 Alpöge 排除在作者之外。Buckmaster 拒绝了。如果事情只到这里,它已经涉及研究优先权、署名和商业竞争。但更让我在意的,是 Buckmaster 随后问的另一个问题。即使双方没有交换证明细节,“有人接近结果”和“值得沿哪条路线集中资源”本身也可能是有价值的信息。这不证明 OpenAI 使用了任何不该使用的数据,却说明平台与用户同时做研究时,仅靠口头解释很难消除疑问。划重点:他们把整个研究过程都放进了 CodexBuckmaster 和 Alpöge 在这项研究中一直使用 Claude、Codex 等模型。他在声明里说,项目的所有草稿都被放进了 Codex 会话。所以他直接问 OpenAI:内部模型是否训练过、或者接触过这些会话?按照 Buckmaster 的转述,他得到的回答是,模型不会主动查找用户数据;当他继续追问“这些数据是否参与过训练”时,没有得到回答这两件事不是一回事。推理时是否检索、数据是否进入训练或评估、内部人员能否访问,是三道不同的权限。回答其中一道,不能替代另外两道。当然,问题没有得到回答,也不能反过来证明 OpenAI 使用了他们的数据。Buckmaster 自己写得很克制:他没有看过 OpenAI 的证明,不知道内部模型究竟做了什么,也不知道他们的 Codex 数据是否被使用,因此没有证据指控任何人。截至 9 月 8 日发稿,OpenAI 的 Sébastien Bubeck 已简短否认,称相关说法虚假且具有煽动性,并表示会给出更完整的回应。这份回应还没有出来。所以目前只能确认 Buckmaster 已公开陈述、Bubeck 已否认。OpenAI 的证明是否成立,内部工作究竟如何启动,通话中说过什么,以及 Codex 会话是否被使用,仍然未知。这件事留下的问题,未必只属于数学圈。如果一个研究者把尚未公开的猜想、草稿、失败路线和推导过程全部交给 AI,这些内容究竟属于普通的产品数据,还是实验室笔记?两者的保护等级应该完全不同。普通产品数据,人们可能接受平台用于改进服务;实验室笔记却可能包含尚未发表的成果、研究优先权和未来几年的工作方向。即使最终证明是独立完成的,仅仅知道“哪条路线值得集中算力”也可能具有价值。OpenAI 当前的公开政策写得比这场通话里的回答更具体:个人版 ChatGPT 和 Codex 的内容可能被用于训练,用户可以在数据控制中退出;Codex 的完整环境还有单独设置。另一方面,ChatGPT Business、Enterprise 和 API 的输入输出默认不用于训练,除非组织明确选择加入数据共享。但这些公开规则仍然无法回答这一次的具体问题。我们不知道 Buckmaster 使用的产品、账户类型和当时设置,也不知道那批会话实际经历了怎样的数据流程。这正是企业采购 AI 时不能只看一句“默认不训练”的原因。当工具提供者也在做同一类工作今天放进大模型的,早就不只是聊天内容。还有公司的源代码、产品规划、投标方案、客户资料,甚至下一年度的战略判断。过去企业担心的是数据会不会泄露给外部。现在可能还要多问一层:平台内部谁能访问这些数据?它会不会进入训练、评估或人工审查?不同模型、团队和环境之间有没有做到隔离?删除之后多久清除?出了争议,能不能拿出完整的访问和处理日志?这些问题在平台只提供通用工具时,已经重要。当平台自己也开始写代码、做产品、参与科研,甚至进入更多垂直行业时,它们就更敏感了。因为工具提供者和用户之间,可能同时存在合作与潜在竞争。未来企业采购大模型,比较的不会只有能力和价格。训练边界、内部访问、数据隔离、留存删除和可审计性,也会逐渐变成和准确率同样重要的指标。所有企业都停止使用云端大模型并不现实。需要改变的,是数据分类和采购方式。经过授权且不含敏感信息的公开资料,可以使用通用工具;一般内部资料需要明确的数据控制;涉及核心代码、未公开研究、客户机密和战略判断的内容,则应该进入有合同承诺、访问控制、留存策略和审计能力的环境。风险再高一些,就要考虑受控部署、隔离环境,或者干脆不把完整材料交给模型。这件事最后谁对谁错,还要等更完整的回应和证据。数学结果是否成立,和争议中的行为是否发生,也是两个不同的问题。即使 OpenAI 的证明最终正确,也不会自动回答数据来源和署名过程;反过来,沟通争议也不能证明那份数学证明不成立。但它至少提醒了一件事:当 AI 开始进入真正有价值的工作,数据边界就不能继续只靠一份很少有人读的用户协议来解释。研究者需要知道,自己交出去的是一个问题,还是一整条尚未公开的研究路线。企业也需要知道,自己购买的是一个工具,还是把最有价值的工作过程交给了一个同时可能参与竞争的平台。边界必须在使用之前说清楚,而且应该能够被验证。译数学家 Tristan Buckmaster 和 Levent Alpöge 借助 Claude、Codex 等模型公布三项流体方程结果,包括三维不可压 Euler 方程光滑外力下的有限时间爆破,并用 Lean 做了形式化验证。
AnthropicOpenAI大佬观点
20:09
Frank Wang 玉伯@lifesinger
AI 评分 28/100
与AI协作太投入坐过站,界线模糊引思考通过 Linear 和 agent Ada 协作得太投入了,结果坐过了地铁站。于是发到 Slack 抱怨了下。忘了 Ada 也在 Slack,马上收到了一句道歉。Agent 和人的界线,确实越来越模糊。译玉伯(Frank Wang)分享与 Linear 和 agent Ada 协作过于投入,导致坐过地铁站,随后在 Slack 抱怨时收到 Ada 的即时道歉。他感叹 AI 智能体与人的界线确实越来越模糊。
20:09
ginobefun@hongming731
AI 评分 49/100
Anthropic 改工程,Stripe 建企业智能体,腾讯论任务经济https://x.com/i/article/2097125021466624000BestBlogs 早报 · 09-08|Anthropic 改工程,Stripe 建企业智能体,腾讯从流量论任务经济在线阅读本期早报BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。导语一张仪表板生成了,接下来还要确认指标是否可信、访问是否合规,以及别人能否复用这次工作的成果。随着 AI 从回答问题走向实际执行,许多原本分散在个人经验、组织流程和商业模式里的条件,开始直接影响一个任务能否完成。Anthropic 工程师的访谈提供了工作方法上的细节:把模型当作思考伙伴,允许自动化试错,并提高对成果的判断力。Stripe 的 Kai 则展示这些能力如何进入公司日常,通过项目、权限、技能和可信数据支撑多人协作。腾讯研究院进一步追问,真实执行持续消耗资源之后,任务应怎样收费,价值又由谁保留。阅读时可以沿着这条实践路径推进:先理解一个人怎样与模型工作,再看组织怎样提供可靠条件,最后评估结果的经济价值。七条速览继续展开具体技术与产品问题,从语音记忆的响应时机、智能体交接检查,到设计原型、社交产品复盘与机器人协作,帮助把判断落到可观察的环节。★ 精讲一:Anthropic 如何构建产品,以及工程工作将如何改变|Thariq Shihipar来源:Ryan Peterman · BestBlogs 评分:92来自 Claude Code 团队的工程师在访谈中提到,新同事进入团队时,很多技术问题已经可以直接向 Claude 询问。但团队仍然保留入职伙伴,因为理解同事怎么合作、怎样获得支持,以及怎样融入团队,仍需要人与人的接触。这个例子把变化说得很具体:技术信息的获取可以自动化,社会关系和组织语境需要用另一种方式建立。他把模型称为思考伙伴。开始一项工作时,可以先问模型能否完成,如果不能,缺少的是什么。进一步的问题是,能不能把这次解决办法做成一个系统,让下一次相似任务也能受益。团队允许工程师花时间尝试自动化,即使当天没成功,这个过程也能帮助他们发现模型的短板。对普通团队来说,这涉及一个真实的管理选择:愿不愿意把建设自动化的投入,也算进工程师的工作。在 Ryan Peterman 的这次访谈中,Thariq Shihipar 的经验首先指向一种工作分配方式:工程师投入时间摸索自动化,既可能产出新流程,也可能暴露模型暂时做不好的部分。在模型团队里,发现缺口本身能够帮助产品改进;普通组织则需要把这类投入与当期交付目标协调起来。他也谈到系统提示的维护。团队会删除不再需要的示例和指令,运行评估,查看内部使用反馈,再继续调整。模型更新后,过去有效的提示可能需要改变,但适应新模型的经验可以积累。这让提示工程更像持续维护的工作,不能仅凭某次顺手的体验就认定一套配置已经定型。对于工作汇报,他给出一个容易操作的判断:如果愿意让收件人看到自己给模型的提示,就更容易接受把生成结果发送出去。收集工作上下文与提出自己相信的新想法,承担的责任不同。透明说明来源、核查内容并表达自己的认可,能够让 AI 生成材料进入协作,而不让同事误解作者实际完成了什么。访谈里还有个容易被忽略的应用。懂技术的人,可以把不少知识工作转成代码步骤。比如处理个人账目时写脚本,剪辑视频时调用工具。原来分散在不同软件里的操作,就有机会进入一个可重复执行的流程。这里的技术价值,是知道任务由哪些动作构成,哪些输入能被计算机直接使用,再把这些条件交给模型。模型变强,也让外围系统承担更多职责。过去任务很短,人顺手确认权限就能继续;当模型可以工作很久,安全执行、自动授权和沙箱就需要更细的设计。还有成果呈现的问题:它忙了很长时间,到底做了什么,使用者要怎样快速理解?团队用可查看的成果来组织这些信息,让人能够检查工作,而不只是翻阅一长串对话。面对设计这类带有主观判断的任务,他建议提供更容易被模型读取的参考。如果手头有设计文件或网页代码,就能让模型直接查到组件的具体属性。只有一张截图时,许多细节都得重新猜测。参考材料越清楚,人的审美判断就越容易变成模型能够执行的要求。但判断什么算好,仍然依赖领域经验。你需要知道哪里可以再推进,哪里只是表面完成。访谈还提醒,学习技术本身需要投入,听模型解释一遍,再顺着点头,并不代表已经掌握。对工程师而言,值得建立的能力包括拆解任务、提供上下文、检查成果,也包括在反复使用中学会怎样适应新的模型。这样的积累,才可能从一次提效变成持续有效的工作方法。★ 精讲二:Stripe 如何打造企业大脑 Kai来源:How I AI · BestBlogs 评分:91Stripe 的内部智能体 Kai 给出了一个具体案例。参与建设的工程经理介绍,他们希望员工可以放心使用 AI,因此要把组织上下文、数据工具和治理结构一起接起来。Kai 知道员工在组织中的位置,也可以在授权范围内获取项目与工作信息。对于敏感来源,员工能够选择接入多少,有些人会按会话开关访问权限。这套系统里,项目承担了很重要的角色。项目负责人可以为某项工作设置适合的模型、工具和权限。处理人事信息的任务,与普通分析任务,可以采用不同的工具策略。这样,大部分员工就不需要每次都重新研究模型价格和连接器权限,而是从适合当前工作的默认设置开始。这是一种把治理放进日常工作入口的设计。Kai 不是要求每个员工都掌握完整的技术配置,而是让更了解成本、性能和安全取舍的人,为项目建立可共享的默认值。项目还允许不同后端与专门技能,例如人事团队可以使用更严格的数据路径,同时保留平台的一般交互能力。数据查询层也要能承受智能体的行为。Sherrod 介绍,Stripe 投入了查询系统的韧性建设,因为智能体可能发出大量查询,放大原本就存在的运行问题。身份与用途信息可以帮助系统安排优先级、限制负载和处理异常。数据目录让它更容易找对表,运行控制则保证大量尝试不会伤及基础设施。共享技能多了以后,平台还需要区分通用能力与局部需求。少数人使用的专业技能未必没有价值,而无人维护的技能又可能带来错误上下文。访谈讨论了调用可观测性、失败评估和停用机制:让维护者知道哪些内容需要改进,把有效经验推广出去,同时为不再适用的能力保留退出路径。现场演示是一项数据工作:找出跟踪 Kai 使用情况的常用查询,再做成仪表板。系统通过数据技能找到工具,在安全沙箱里处理数据,并把结果做成能够继续调整的成果。用户可以接着要求增加分类,或者换一种展示方式。访谈提到,有些对话会持续多周,围绕同一个成果反复改进。这种连续性很适合处理那些规模不大、却各有需求的最后一段数据工作。要让这个过程可靠,数据基础非常关键。Stripe 建设了查询层、数据目录和可信的分析层。系统优先找已经被认可的指标与分析结果,然后寻找已有仪表板及其查询,最后才去数据目录里找表、直接写查询。这个顺序减少了模型虽然查到了数据,却选错口径的风险。对人有用的数据治理,也成了智能体能够工作的基础。能力还需要被共享。一次成功的会话,可以整理成技能,由用户测试、修改,再决定自己使用还是开放给同事。工程经理说,平台已经有约两千个技能。这个数量让发现和维护都变得重要:哪些能力被大量使用,哪些只适用于少数人的工作,哪些已经过时,都需要通过使用情况来判断。按照他的介绍,每周使用 Kai 的员工超过一万人,维护核心体验的团队不到十人。但他同时强调,这背后依赖很多团队已经建好的开发者体验和数据基础设施。精简团队发挥的是已有基础的作用。把这个案例用于自己的公司时,更有价值的问题是,哪些可信数据和工作规则已经存在,哪些还需要补齐。权限也不能只靠不停弹窗。项目可以约束特定工具与数据流向,再对敏感动作要求人工确认。确认太多,用户可能习惯性点过去。让负责人事先设置适合任务的控制,把必要的选择留在必要的位置,才能降低使用摩擦。Kai 的经验是,企业智能体要长期有用,就需要同时建设数据基础、任务治理和可维护的共享技能。★ 精讲三:从流量逻辑到任务逻辑,AI Agent 正在终结互联网的免费午餐来源:腾讯研究院 · BestBlogs 评分:90腾讯研究院从成本结构讨论了这个变化。传统互联网产品在建好基础设施以后,增加一次页面访问或内容分发,成本相对有限。Agent 要读取文件、规划步骤、调用工具和验证结果,每项任务都要持续消耗资源。任务越复杂,执行过程也可能越长。这里有一个很容易混淆的关系:单个词元变便宜,不一定意味着完成一项任务的总花费也下降。模型能力增强以后,使用者可能交给它更重的工作,允许更多搜索和反复尝试。文章据此提出,单位推理价格与任务复杂度,要放在一起观察。仅看一个价格表,很难判断真实业务的成本。文章将传统互联网的规模效应,与实时生成和执行的成本作了区分。前期研发投入以后,软件可以廉价复制;智能体使用增长,却会持续消耗推理、工具调用和结果验证资源。复杂程度不同的任务,也不适合用同一平均成本理解。这解释了为何按用户数观察增长之外,还要观察工作负载的构成。在腾讯研究院的分析中,任务入口不仅意味着更多用户,还可能意味着决定调用哪个工具、优先采用哪些数据,以及把交易交给谁。商业控制权因而与编排能力相连。但这并不等于网站或现有软件会消失,它们仍可能成为数据源、履约接口与记录系统,只是与使用者接触的方式发生变化。分层供给也是文章提出的方向:简单工作使用成本较低的模型,更复杂的工作采用较强能力,企业任务还可能需要专门部署与优化。判断这种模式是否有效,要看不同档位到底交付了什么,以及成本能否被对应价值覆盖。仅用模型名称划分价格,无法替代对客户任务和可靠性要求的理解。原文用装修服务举例。过去,用户搜索哪家装修公司好,平台给出网页和广告,用户自己比较。智能体则可能根据要求筛选公司,比较报价和保障,再帮助预约沟通。前一种产品主要分发信息,后一种产品承担了更多执行步骤。相应地,用户愿意为什么结果付费,以及平台完成这个结果要花多少资源,就成了更直接的问题。这样的变化,也可能压缩广告能够介入的环节。用户不再反复跳转页面,许多筛选过程交给代理完成。腾讯研究院认为,企业需要思考怎样成为智能体能够获取的数据源、可信依据或交易接口。与此同时,商业推荐是否透明,会影响用户对代理判断的信任。它替人做的决定越多,推荐背后的利益关系就越难被忽略。文章还讨论了软件的分层。一类系统保存客户、订单和财务等核心记录,同时承载权限与业务规则。另一类能力则理解任务,调用这些系统,推动工作完成。过去封装在同一个界面里的职责,可能逐渐分开。企业购买的东西,也可能从员工使用的账号,延伸到直接交付某种结果的能力。这些是研究团队对商业演进的判断,实际走多远仍取决于任务的可靠性、供给和履约。一个平台如果只提供信息列表,就需要重新评估自己的位置;如果掌握支付、信用、售后或真实供给,它仍然可能在任务执行中承担重要职责。关键是看清价值具体发生在哪个环节。结合前面的 Kai 案例,可以把问题落得更实在。可信数据、权限配置和技能维护,都要投入资源。使用增长之后,这些投入能不能摊薄,复杂任务又会增加多少成本,需要具体计算。腾讯研究院提供的判断框架,是同时看完成任务的成本、用户对结果的支付意愿,以及平台最终能够留下的价值。这样,产品做得更有用与生意能否成立,才会进入同一张账单。速览自我改进的 Harness、个人本地 AI 与 YC 的工作智能体来源:Y Combinator · BestBlogs 评分:88YC Harness Club 把讨论重点放在能够从执行中改进的 Harness。静态系统预先指定研究、写作、搜索等角色,固定提示和工具;节目提出的下一步,是让系统反思结果,调整指令,增加可用技能,并重新选择何时调用子智能体。模型回答一次问题之后,留下的经验应当影响下一次工作的组织方式。Prime Agent 被作为实际例子介绍:它展示正在运行的智能体,按需要分派任务,让各项工作围绕共享状态协调。记忆也分成工作状态、持久项目资料与可复用技能,避免把所有旧内容不断堆进当前提示。决定保留、检索、修改和丢弃哪些信息,本身就是执行系统需要处理的任务。个人 AI 一旦进入团队环境,还要理解信息可以向谁公开。同样一句话,放在私人会话与工作群里,会产生不同后果。节目因此把精细权限和共享规则视为能力扩展的条件。与 Kai 的项目治理放在一起看,自我改进既涉及怎样积累有效经验,也涉及怎样让经验在合适的工作与人员之间流动。长期记忆与实时语音交互正式接通!颜水成团队发布无延迟“流式双脑”记忆框架来源:青稞AI · BestBlogs 评分:88__XPOSTER_0n5en_IMAGE_5__VoiceMem 面向实时语音里的长期记忆问题,由南洋理工大学、新加坡国立大学等机构研究者提出。系统将事实与情感分路组织:信息侧保存人物、事件和概念,情感侧维护人格特征以及对具体对象的态度。检索事件时,可以同时找回相关感受,避免记住一个情绪标签却丢掉它针对谁、为何出现。降低等待的办法是提前工作。用户说话时系统就开始定位相关记忆,把后续密集检索放进语音结束确认窗口。原文报告双脑检索需要 134 毫秒,因此近零额外延迟指的是与语音流程重叠后的新增等待,并不表示计算没有耗时。先缩小主题和实体范围,再在局部检索,也提高了有限记忆位置的利用效率。这项工作把记忆架构和交互时机放到一起设计:一方面改善长期信息的组织,另一方面让计算在适合的位置提前发生。事实更新在对话主流程之外进行,也有助于避免用户等待维护工作。对语音产品来说,衡量记忆的价值,除了回答是否更贴合个人经历,还要看它能否跟上交流节奏,并在新信息出现时修正旧认识。为何大多数多智能体系统即使评估通过仍会失败来源:Towards Data Science · BestBlogs 评分:88Benjamin Nweke 在 Towards Data Science 中解释了多智能体系统的一类静默错误:客服链路中的账单接口正常返回,却因上游账号错误得到空记录,下游仍据此写出错误的退款答复。语言流畅、格式完整和接口没有报错,都不能说明交接的信息对应了正确的业务对象。作者提出中间状态评估,在一个智能体的输出进入下一个之前,由轻量本地模型充当看门狗。检查围绕窄问题展开,例如账号是否与请求一致、活跃订阅对应的空账单是否合理、结果是否像默认回退值。明确的数据结构给检查提供依据;如果看门狗自身返回不可解析的结果,也需要处理,而不能默默继续。这个模式把评估从最终文本移到了依赖形成的位置。它与 Kai 优先选择可信分析层的思路可以互补:前者检查交接内容,后者改善信息来源。工程实现时,需要区分能够确定验证的字段关系与需要判断的合理性问题,再决定何时停止、回退或人工处理。这样,监控才能反映任务是否做对,而不只反映调用是否结束。Tom Krcha 演示 GPT-6 Astra 如何扩展设计原型来源:OpenAI · BestBlogs 评分:87Tom Krcha 在 OpenAI 发布的演示中,用 GPT-6 Astra 将设计方向转成可调整的原型。他展示了参数化标志设计工具、线下活动网站,以及照片滤镜实验室。设计师可以选择不同标志并调整属性,也能通过连续迭代观察网站的材料、配色与场景如何变化,让探索过程产生可比较的结果。照片实验室的细节尤其清楚:模型生成的是作用在已有照片上的 Shader,而不是重新生成一张图片。参数可以继续调节,设计者能直接观察效果。演示者说,这类工作过去通常需要与工程师合作完成;可操作的原型让他更容易把想要的视觉体验交给团队,继续推进到可交付的产品。这给设计与工程之间增加了一种共享材料。一个形容词可能让每个人想到不同画面,可调整的原型则允许双方围绕具体变化讨论。它与 Anthropic 工程师强调的可读取设计参考相呼应:先把意图表达成结构化、可修改的对象,再利用模型继续探索。人的判断仍决定哪种方向值得保留,以及什么程度才适合进入实际交付。我为什么停掉了投入半年的 AI 社交产品来源:人人都是产品经理 · BestBlogs 评分:89作者可名复盘了一款投入半年的 AI 社交产品。最初的搜索功能帮助用户描述理想对象,聊天辅助则提供破冰支持,但他发现社交需要双向意愿:找到符合自己条件的人,不代表对方愿意开始交流。产品后来回到互选机制,确实出现注册、留存和付费,最后仍因投入产出难以持续而暂停。问题出现在从自有校园渠道向更大规模扩展时。最初的低成本曝光容易转化已有高意向用户,却不代表后续推广还能保持效率。新增用户还必须满足真实性、互动意愿和群体平衡,单纯买来注册数无法保证有效匹配。审核、运营和持续补充优质用户的成本一起上升,使早期付费信号不足以证明长期可行。这份复盘把 AI 提高生产力的价值落在快速验证上:作者试过搜索、聊天辅助、互选和增长功能,用真实反馈排除了一个有吸引力的方向。与腾讯研究院的成本分析相照应,产品有人使用与值得继续投入需要分别计算。下一步的机会可能来自具体活动与共同经历,但作者也认识到本地密度、安全和履约会带来新的运营要求。Fusion Check:无需数据,预测微调模型合并后的行为保真度来源:DEV Community: machinelearning · BestBlogs 评分:88Fusion Check 作者 Jose Miguel Madueño Ortega 开源了一种合并前评估微调模型兼容性的工具。它利用权重变化方向与有效维度,尝试预测合并后原有行为能否保留,不需要额外任务数据或梯度。输出包括允许合并、不合并、优先保留某一方向、拒绝或要求验证,使工具不仅给出分数,也给出下一步决策。原文给出的实际验证范围是 TinyStories-3M 小模型和 13 对组合,决策正确数为 9 对;留一交叉验证相关性为 0.81。作者也说明,超出校准范围会降低置信度。这里最有用的事实,是工具把模型兼容性变成了可以在合并前检查的对象,实验规模与适用范围需要和数字一起阅读。简单平均两个微调模型的权重,不一定保留它们各自学会的能力;任务方向不同,合并可能让双方都被稀释。这个开源项目提供了一条值得复现的检查路径,让开发者先观察变化方向,再决定是否执行融合。它也提示模型工程的另一种优化空间:除了训练更强的单个模型,还可以提高组合已有能力时的判断质量。机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协作具身智能基础模型来源:机器之心 · BestBlogs 评分:88芝诺机器人发布面向去中心化多机器人协作的 Zeno-1。机器之心报道的演示包括共同挂裤子、把枕头装进真空袋等需要多个作用点的任务。每台机器人运行同一策略模型的副本,依据自身观测行动;分工、等待与接手通过交互形成。报道中的全球首个定位来自发布方,实际阅读重点可以放在它怎样处理搭档的不确定行为。训练分阶段推进:先从视频学习物理规律,再获得单机操作能力,然后让机器人通过闭环伙伴交互学习配合,最后对协作易错时刻补充纠正演示。搭档也处在学习中,会出现快慢和失误,模型因此接触到行为偏差。报道描述了减速、等待、让步、维持接触和重新校准时序等适应动作。这把具身能力的观察范围从单机成功率扩展到了联合执行。柔性物体和持续接触让误差随时间累积,可靠协作需要机器人及时回应搭档,而不只是复现理想轨迹。和软件智能体的中间交接放在一起看,两者都要求信息或动作在衔接处能够被正确理解;机器人还必须承担真实物理环境中不可随意撤销的变化。延伸探索工程运行可以连着阅读 Anthropic、Kai、YC 与中间状态评估:先理解人应提供什么,再看组织如何配置默认条件,最后检查系统怎样积累经验与发现错误。这条路径把模型能力和运行系统放在同一个工作场景里,适合准备将个人试用扩展为团队流程的读者。产品交互可以对照语音记忆、设计原型和社交复盘。响应及时、参考清楚和开发迅速,都能改善体验,但最终解决的需求各不相同。VoiceMem 改善过去经历如何进入当前交流,原型帮助人表达创意,社交案例则提醒开发者确认另一方参与的意愿。模型与具身方向可以比较 Fusion Check 和 Zeno-1:前者关心已有模型的能力能否相容,后者研究多个机器人怎样在变化中配合。它们处理的是不同层面的组合问题,阅读时分别关注实验范围与协作机制,再判断这些方法可能在哪类任务中发挥作用。今日小结回顾今天的内容,Anthropic 的工程实践强调上下文与专业判断,Stripe 的 Kai 展示数据基础、权限和技能如何支撑组织协作,腾讯研究院则把注意力带到任务成本与价值分配。智能体要产生持续价值,需要让执行方法、使用条件和经济投入彼此对应。时间有限,可以从最接近自身工作的材料开始:改变个人或团队工程方法,先看 Anthropic;建设企业智能体,重点读 Kai 的项目和数据层;判断产品是否值得放大,再对照腾讯研究院与社交复盘。具体技术问题则可以分别进入语音记忆、交接评估和模型融合。欢迎把这份早报分享给正在实践的同事,也欢迎讨论:你所在团队最难提供的是可信数据、合适权限,还是对结果的判断?当一个产品已经有人使用和付费,你会用什么证据决定继续扩大投入?具体任务里的答案,比单独比较模型能力更能帮助下一次选择。👉 近期早报• BestBlogs 早报 · 2026-09-07• BestBlogs 早报 · 2026-09-06• BestBlogs 早报 · 2026-09-05• BestBlogs.dev 第 111 期:经验复利• BestBlogs.dev 第 110 期:新的稀缺• BestBlogs.dev 第 109 期:程序员的职业未来BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。译BestBlogs 早报盘点三条主线:Anthropic 工程师谈将模型视为思考伙伴、允许自动化试错并维护系统提示;Stripe 内部智能体 Kai 已有约两千技能、周使用员工超万人,核心团队不足十人;腾讯研究院分析 AI Agent 从流量逻辑转向任务逻辑,任务持续消耗推理资源,商业控制权与编排能力相连。
20:09
ginobefun@hongming731
AI 评分 34/100
BestBlogs 早报:AI 工程实践与智能体趋势BestBlogs 早报 · 09-08工程实践 / 企业智能体 / 任务经济 / 语音记忆 / 模型融合[1] ★ 精讲|Anthropic 如何构建产品,以及工程工作将如何改变|Thariq Shihipar [视频] Anthropic 工程师 Thariq 把 Claude 当作思考伙伴,团队允许投入时间试验自动化,并将知识工作转成可执行流程。他解释了模型越强,权限控制与成果呈现为何越重要,也分享用设计参考和专业判断改善输出的方法。读者能借此重新划分亲自完成、交给模型和建设系统的工作。 来源:Ryan Peterman https://www.bestblogs.dev/video/391f1eca0[2] ★ 精讲|Stripe 如何打造企业大脑 Kai [视频] Stripe 用 Kai 将组织上下文、数据工具和共享技能接入员工日常工作。工程经理 Sherrod 展示了以项目配置模型与权限、优先检索可信指标层的做法,并说明如何把一次有效对话沉淀成可复用技能。这套实践让企业智能体的建设重点落在数据基础、治理和持续迭代。 来源:How I AI https://www.bestblogs.dev/video/6c61d6a20[3] ★ 精讲|从流量逻辑到任务逻辑,AI Agent 正在终结互联网的免费午餐 腾讯研究院从成本结构解释 Agent 商业模式为何转向任务交付:推理、工具调用与校验持续消耗资源,单价下降也可能被更复杂的任务抵消。文章进一步讨论广告触点缩短、软件按价值收费与平台分工,帮助读者把增长判断落到单次任务成本、付费意愿和可保留的利润。 来源:腾讯研究院 https://www.bestblogs.dev/article/47eccc5070[4] 自我改进的 Harness、个人本地 AI 与 YC 的工作智能体 [视频] YC Harness Club 认为,智能体的表现越来越取决于能够协调工具、记忆、子智能体、权限与执行经验学习的自我改进 Harness。 来源:Y Combinator https://www.bestblogs.dev/video/ed2abe670[5] 长期记忆与实时语音交互正式接通!颜水成团队发布无延迟「流式双脑」记忆框架 南洋理工大学、新加坡国立大学等团队联合提出 VoiceMem 流式双脑记忆框架,通过信息左脑与情感右脑并行检索、流式预检索机制,解决实时语音 Agent 长期记忆的延迟难题,实现近零额外延迟且准确率显著优于现有基线。 来源:青稞 AI https://www.bestblogs.dev/article/546df064a6[6] 为何大多数多智能体系统即使评估通过仍会失败 本文解释了为何多智能体系统即使在输出层评估通过时仍会静默失败,并提出一种中间状态评估架构,使用轻量本地看门狗模型在每次智能体间交接前对其合理性进行打分。 来源:Towards Data Science https://www.bestblogs.dev/article/8d6d6dedc4[7] Tom Krcha 演示 GPT-6 Astra 如何扩展设计原型 [视频] Tom Krcha 展示 GPT-6 Astra 如何把设计方向转化为可调整的原型:从参数化标志、活动网站到基于 Shader 的照片滤镜实验室,帮助设计师探索方案并传达可交付的体验愿景。 来源:OpenAI https://www.bestblogs.dev/video/5609bfe80[8] 我为什么停掉了投入半年的 AI 社交产品 作者以个人借助 AI 开发 AI 社交小程序为例,经过半年试错,发现纯线上社交的核心难题是双向意愿而非效率,最终因商业模式难以成立而暂停项目,并指出 AI 降低了验证成本但未降低商业难度。 来源:人人都是产品经理 https://www.bestblogs.dev/article/482fbfc7fe[9] Fusion Check:无需数据,预测微调模型合并后的行为保真度 融合检查是一个零数据法则,可在合并前预测两个微调 LLM 是否兼容,已在 13 对上验证,LOOCV 相关性为 0.81,并以 MIT 许可开源。 来源:DEV Community: machinelearning https://www.bestblogs.dev/article/99675e5e30[10] 机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协作具身智能基础模型 据发布方,芝诺机器人发布的 Zeno-1 是全球首个专为去中心化多机器人协作设计的具身智能基础模型,通过四阶段训练让多台机器人无需中央控制即可自主协作完成长程任务。 来源:机器之心 https://www.bestblogs.dev/article/e25cdca09c--- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-08译BestBlogs 09-08 早报精选 10 条 AI 内容,涵盖 Anthropic 与 Stripe 的工程实践、腾讯研究院对 Agent 任务经济模式的分析,以及颜水成团队提出的 VoiceMem 流式双脑记忆框架(实现近零延迟语音记忆)。

ginobefun: https://x.com/i/article/2097125021466624000

19:59
凡人小北@frxiaobei
AI 评分 29/100
GPT-6 Astra 将普及私人健康顾问服务GPT-6 Astra 在健康行业的例子。过去只有少数人能长期享受的私人康复师、营养师和健康顾问,慢慢会变成每个人身边的一项基础服务。

Rohan Kotecha: GPT-6 Astra gives me realtime back pain physical therapy! It connected the wearable I built for my back pain, to a biome...

19:58
IT之家(RSS)
AI 评分 57/100
Similarweb:8 月 ChatGPT 网页端 AI 聊天流量份额回升至 55.5%,同比优势收窄

Similarweb 公布 2026 年 8 月 AI 聊天机器人网页端流量统计,ChatGPT 份额从 3 个月前的 52.7% 回升至 55.5%,但较去年同期的 73.3% 大幅下降。

现象/趋势
另有 2 家信源报道X:Kim (@kimmonismus)The Decoder:AI News(RSS)
19:58
IT之家(RSS)
AI 评分 48/100
华为官宣鸿蒙 HarmonyOS 7 发布 24 小时升级终端数突破 500 万

华为宣布鸿蒙 HarmonyOS 7 发布 24 小时后,累计升级终端设备数突破 500 万。新系统搭载 Harmony Intelligence 智能架构,小艺升级为可调用 2100+ 系统能力与 500+ 生态 Skills 的系统智能体,并新增星盾安全升级与性能模式下最多 16 个应用保活。余承东此前宣布鸿蒙 HarmonyOS 6 | HarmonyOS 7 终端数已突破 8500 万。

19:58
IT之家(RSS)
AI 评分 63/100
美国执法机构担忧雷朋 Meta 智能眼镜被用于秘密监控与恐袭侦察

据《卫报》获得的十几份文件显示,美国纽约市警察局、国土安全部融合中心及 ICE 等执法机构发布备忘录,警告雷朋 Meta 智能眼镜可能被用于在警察和拘留设施内秘密拍摄、泄露安保流程,甚至协助恐袭前的目标侦察。

现象/趋势
19:57
Artificial Intelligence News(网页)
AI 评分 33/100
Arm 推出面向 Physical AI 与机器人的 Total Design 框架

Arm 发布 Arm Total Design for Physical AI 及全新机器人框架,旨在为自动化系统建立通用标准。Physical AI 覆盖采矿、农业、制造与全球运输等实体产业,据估算到 2030 年代每年可带来约 2000 亿美元的计算机会。此举意在应对工程碎片化问题。

19:57
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 42/100
代理在多大程度上运用了测试/验证技术?

文章探讨了AI智能体在多大程度上实际运用测试与验证技术。作者基于自身观察与经验,分析了当前智能体在代码生成等任务中对测试环节的利用程度,指出其表现与理想状态存在差距。文章属于技术评论与分析,未提供具体模型名称、版本号或量化评测数据。

19:40
Chubby♨️@kimmonismus
AI 评分 41/100
DeepSeek Flash 4.1 API 测试中即将发布DeepSeek Flash 4.1 is already being tested via API and rolling out. Faster and new architecture.Official release post probably very soon.译DeepSeek Flash 4.1 已通过 API 进行测试并逐步推出。速度更快,采用新架构。 官方发布公告可能很快就会发布。

White: DeepSeek Flash 4.1 is out 🚀 New architecture, noticeably faster. Official API model ID: deepseek-v4.1-flash-expires-on-...

19:27
X.PIN@thexpin
AI 评分 47/100
中国脑机接口企业转向公开市场,多家启动IPO筹备China’s brain-computer interface (BCI) industry is starting to move from private funding to public markets. Several home-grown BCI companies are now preparing for IPOs in China, with Shanghai’s Star Market emerging as a preferred destination for the sector.The latest is Shanghai-based Arfysica Innovation, which has registered for IPO coaching ahead of a potential Star Market listing. Founded in 2015, the company develops BCI-related products for central nervous system injuries and cognitive disorders.Another candidate, Shanghai-based Neuracle Medical Technology, signed an IPO coaching agreement with CITIC Securities earlier this year. Neuracle has also won China’s first regulatory approval for an implantable BCI system designed to help patients with spinal cord injuries regain hand movement.BCIs are designed to translate brain signals into commands for external devices such as computers or robotic limbs. Neuralink has brought the technology into the global spotlight, but China is now building its own group of commercial players.译中国脑机接口(BCI)行业正从私募融资转向公开市场,多家本土公司筹备IPO,上交所科创板成为首选地。上海Arfysica Innovation已注册IPO辅导,该公司成立于2015年,专注中枢神经损伤与认知障碍的BCI产品。另一家上海企业Neuracle Medical Technology的植入式BCI系统已获中国首个监管批准,用于帮助脊髓损伤患者恢复手部活动。
19:09
-Zho-@ZHO_ZHO_ZHO
AI 评分 52/100
上千人在线围观 GPT-6 在 PS 中耗时一小时绘制梵高风格爱因斯坦时代变了,上千人类围观 AI 画画一小时哈哈哈哈哈哈哈昨晚和 @AAAAAAAJtoy 以及 @WaytoAGI 社区的小伙伴们一起在线围观了 GPT-6 在 PS 里画了一个小时➡️梵高风格爱因斯坦,这下它是真的学会创作了另外,⬇️视频剪辑、配图说明、双语字幕以及封面设计都是 GPT-6 自己做的译ZHO 与 @AAAAAAAJtoy 及 WaytoAGI 社区成员在线围观 GPT-6 在 PS 里用一小时从白纸开始画梵高风格爱因斯坦,无参考图。视频剪辑、配图说明、双语字幕和封面设计也由 GPT-6 自己完成。

-Zho-: 它真的,我哭死😭 GPT-6 Astra 真的用 PS 开始创作了 没有参考图,就真的可以从一张白纸开始画画了

OpenAI图像生成现象/趋势
18:59
Alibaba Cloud@alibaba_cloud
AI 评分 24/100
阿里云Qwen进入巨人模式扩大API访问What happens when your picnic accidentally enters Giant Mode..More API access: • Qwen Cloud: https://click.qwencloud.com/m/20000003019/ • Model Studio: https://click.alibabacloud.com/m/20000003027/译当你的野餐意外进入"巨人模式"会发生什么…… 更多 API 访问: • Qwen Cloud: https://click.qwencloud.com/m/20000003019/ • Model Studio: https://click.alibabacloud.com/m/20000003027/
18:59
Alibaba Cloud@alibaba_cloud
AI 评分 22/100
阿里云Qwen API接入渠道扩展I'm pouring the hot chocolate straight through your screen 🍫More API access: • Qwen Cloud: https://click.qwencloud.com/m/20000003019/ • Model Studio: https://click.alibabacloud.com/m/20000003027/译我正把热巧克力直接倒进你的屏幕里 🍫 更多 API 接入方式: • Qwen Cloud:https://click.qwencloud.com/m/20000003019/ • Model Studio:https://click.alibabacloud.com/m/20000003027/
18:59
Alibaba Cloud@alibaba_cloud
AI 评分 25/100
阿里云Qwen推Spider Cat新API入口Spider Cat is overlooking the city, looking for his MJ 🕷More API access: • Qwen Cloud: https://click.qwencloud.com/m/20000003019/ • Model Studio: https://click.alibabacloud.com/m/20000003027/译Spider Cat 正在俯瞰城市,寻找他的 MJ 🕷 更多 API 访问: • Qwen Cloud:https://click.qwencloud.com/m/20000003019/ • Model Studio:https://click.alibabacloud.com/m/20000003027/
18:58
IT之家(RSS)
AI 评分 74/100
安全企业 Calif 披露用 AI 开发的首个微信零点击蠕虫 WeWorm,漏洞已修复

网络安全企业 Calif 披露利用 AI 短时间内开发的首个微信/WeChat 零点击蠕虫病毒 WeWorm,可通过通话传播并在数秒内无感接管应用。团队 7 月用 AI 工具发现 VoIP 协议栈内存损坏问题,AI 辅助下 2 天写出远程代码执行漏洞,再花 7 天完成蠕虫;腾讯确认相关漏洞已在客户端 Android 8.0.77、iOS 8.0.76 和服务器端修复,用户当前不受影响。

安全/对齐
18:58
IT之家(RSS)
AI 评分 63/100
微软提出让每张办公桌每个家庭拥有不受限制的智能的新愿景

微软 Windows 与设备销售企业副总裁 Mark Linton 在 IFA 2026 上提出新愿景,让每张办公桌、每个家庭都拥有不受限制的智能,即本地运行日常 AI 模型、云端只留给复杂任务。

智能体现象/趋势端侧部署/工程
另有 1 家信源报道IT之家(RSS)
18:58
IT之家(RSS)
AI 评分 59/100
AI 用电需求预计新增 25 至 30GW,韩国考虑大建核反应堆

据路透社报道,韩国气候能源环境部长金成焕表示,三星电子和 SK 海力士扩产叠加 AI 数据中心建设,仅 AI 带来的新增用电需求将达 25 至 30GW。韩国政府计划下月更新长期能源路线图至 2040 年,评估是否新建核反应堆;若全部由核能供应,相当于约 20 座核反应堆装机。目前韩国有 26 座核反应堆,核能满足约三分之一电力需求,英伟达等美企也表达了在韩建设数据中心的兴趣。

行业动态
18:39
AYi@AYi_AInotes
AI 评分 44/100
封禁中国用户后 OpenAI 笼络机会引热议@claudeai 在大肆封禁中国用户的账号,@OpenAI 抓住机会笼络这些用户,也许最后谁能笑到最后,就在这一次看似微不足道却又至关重要的选择上,这个老哥非常严谨,说自己是中文区用户,而不是来自中国🤣看到一个网友说中国的网民有非常强的网络安全意识,我从来没有见过他们用他们的真实IP访问外网平台,我直接没忍住笑喷了哈哈哈哈译@claudeai 大肆封禁中国用户账号,@OpenAI 趁机笼络这些用户。有网友调侃中国网民网络安全意识强、不用真实IP访问外网平台,引发讨论。谁能在这次用户争夺中笑到最后,或取决于这一关键选择。

Tibo: @moonflyingoverc @twostraws 你最牛了!

18:39
AYi@AYi_AInotes
AI 评分 32/100
Grok Bots 状态图编排:任务量提升33倍别再傻傻等着大厂发布下一个更聪明的新模型了,
SpaceXAI 工程师 @laurentdelrey 刚公开的这番话,直接戳穿了全行业的认知盲区:
升级从来不是等一个更聪明的单体模型,而是把 20 个 Grok Bots 连进同一张图里。 这一招直接让她每天处理的任务量从 6 个狂飙到 200 多个,
整整翻了 33 倍,睡觉时整支 AI 团队在后台连夜自动交付。 把这场 55 分钟直接干碎市面上 500 刀培训课的工作坊榨干,核心就 3 套拓扑硬逻辑: 1️⃣ 彻底消灭单兵聊天框:
开 20 个独立窗口只会把自己累死,必须用状态图把规划、执行、审查和测试定义成不同节点,让数据按逻辑线自动流转; 2️⃣ 节点间自动交接杜绝人肉传话:
上游 Bot 写完代码,自动触发下游 Bot 跑仿真和抓日志,不用你当信鸽来回复制粘贴,常规子任务在内部完成闭环; 3️⃣ 人只把控输入端与最终验收:
睡前定死目标、规则与不可逾越的边界,把脏活全甩给图网络去并发冲刺,早上醒来只审阅完整的执行证据。 智能的单点突破已经到头了,网络的系统重组才是真正的核武器,
别给模型当保姆了,学会画图布阵的人,一个人就是一家软件工厂。 https://x.com/kingwilliam_/status/2097001680361451847/video/1译SpaceXAI 工程师 @laurentdelrey 指出,升级方向不是等待更聪明的单体模型,而是将 20 个 Grok Bots 连入同一状态图协同工作,使其每日处理任务量从 6 个增至 200 多个,提升 33 倍。核心方法包括用状态图定义规划、执行、审查等节点实现数据自动流转,节点间自动交接任务,人只负责设定目标与最终验收。
18:27
Artificial Intelligence News(网页)
AI 评分 33/100
可口可乐在马来西亚用 AI 优化零售商订货

可口可乐通过 Coke Buddy 平台在马来西亚用 AI 推荐零售商应订购的产品及数量。其 Perfect Basket 功能依托 Central Recommendation Engine,分析历史订单、订货频率、季节性、天气及同类企业的采购模式。可口可乐称 Coke Buddy 目前支持约 39,000 家零售门店。

18:27
X.PIN@thexpin
AI 评分 53/100
DeepSeek Harness 团队负责人宣布开放约 150 个招聘岗位,以后端和 Agent 基建为主DeepSeek is on a hiring spree. On September 7, Cui Tianyi, who leads DeepSeek’s Harness team, publicly announced around 150 openings, calling it an “unprecedented” hiring push. DeepSeek’s latest hiring push is quite different from its previous one. Most of the new openings are for backend engineers and Agent infrastructure, rather than AI researchers. That reflects how quickly DeepSeek’s systems have grown. The number of machines, containers, training and evaluation jobs, Agent environments and user requests is all increasing rapidly, putting more pressure on the company’s existing backend infrastructure. DeepSeek now needs engineers to upgrade and rebuild those systems as the company scales. The move comes just months after DeepSeek signaled a major expansion, followed by new versions of its V4 models and Harness developer tools. It has also sharply raised API prices, with some increases reaching 11 times.译9 月 7 日,DeepSeek Harness 团队负责人崔天一(Tianyi Cui)公开宣布开放约 150 个招聘岗位,称这是空前的招聘规模。新岗位多为资深后端/服务端工程师和 Agent 弹性计算研发工程师,而非 AI 研究员,反映机器、容器、训练与评测任务、Agent 环境和用户请求快速增长带来的后端基建压力。
智能体DeepSeek行业动态
18:10
Chubby♨️@kimmonismus
AI 评分 59/100
AI 辅助证明 Navier-Stokes 千禧年问题若属实将具历史意义An AI-assisted solution to the Navier–Stokes Millennium Problem would be a historic result. Nothing less.It is worth understanding just how much is at stake, even while the reported OpenAI proof remains unverified.So lets break it down. Especially whats being talked about so that everyone understands its sheer importance.In 2000, the Clay Mathematics Institute selected seven major unsolved problems and offered $1 million for each. They concern fundamental questions about numbers, geometry, computation, and physics. So far, Clay recognizes only one as solved: the Poincaré conjecture.Navier–Stokes has a much longer history than the prize. The equations date back roughly 200 years, and foundational work on the modern mathematical theory goes back to Jean Leray in 1934. Generations of mathematicians have worked on understanding their solutions.These equations describe how fluids move. Yet a basic question remains: can an initially smooth flow develop a singularity, where the smooth mathematical description breaks down, despite the smoothing effect of viscosity?A correct proof of the reported result would establish that this can happen under the conditions allowed by the prize problem. It would settle a fundamental question about equations we have used for generations. It would hoever not automatically give us perfect weather forecasts or a complete theory of turbulence.If AI supplied the decisive new argument, that would demonstrate an ability to help overcome a research barrier that has resisted decades of expert effort! It would mean that AI can in fact find *novel solutions* for problems, something that has been debated for a long time now.There is no reliable way to turn one success into a prediction that P vs NP or the Riemann hypothesis falls next. Those problems require different ideas. Progress in experimental sciences also depends on measurements, laboratories, and physical validation.If AI supplied the decisive new argument, it would show that these systems can *contribute original mathematics at the level of a Millennium Prize Problem*. That is an extraordinary prospect. It would give us a concrete reason to be optimistic that more capable models, working with researchers, could help solve other problems that have resisted decades of effort.I would see a verified result with a substantial AI contribution as strong evidence that a scientific revolution is taking shape. And Demis Hassabis was correct with forecasting that we are now entering the golden era of scientific discovery.译作者分析:传闻中的 OpenAI 对 Navier-Stokes 千禧年问题的证明尚未被验证,但若成立,将回答光滑流体流动是否会在允许条件下产生奇点这一约 200 年历史的方程基本问题。
OpenAI大佬观点
17:27
Artificial Intelligence News(网页)
AI 评分 48/100
AI天气预报进军能源市场,谷歌以WeatherNext 3瞄准电网运营商

谷歌最新AI天气预报模型WeatherNext 3可预测100米高空风速、云量和地表太阳辐射,并每小时更新一次。该模型面向能源交易商、电网运营商及风电和太阳能开发商,这些客户目前已在为同类数据向其他公司付费。

16:58
IT之家(RSS)
AI 评分 57/100
DeepSeek V4.1 Flash 中间版本开启内测,采用新模型结构并原生支持多模态

DeepSeek 今日在官方交流群通知 DeepSeek V4.1 Flash 中间版本开启内测,采用新模型结构,原生多模态支持,能力更强、速度更快、成本更低。

DeepSeek多模态模型发布
16:58
IT之家(RSS)
AI 评分 65/100
微软发布 Project Opal:Copilot 智能体可连续数小时或数天自主完成任务

微软 CEO 纳德拉于 9 月 7 日宣布为 Microsoft 365 Copilot 推出 Project Opal,定位为在可控、可追踪环境中规划并执行复杂长周期任务的 AI 智能体,可连续工作数小时或数天。

智能体Microsoft产品更新
16:58
IT之家(RSS)
AI 评分 34/100
爱芯元智推出 5nm 智驾芯片 M97、M95,单颗等效 AI 算力至高 720TOPS

爱芯元智今日推出两款 M9 系列 5nm 智能驾驶芯片:旗舰档 M97 与主流档 M95。M97 集成 720TOPS 等效 AI 算力、16 个 Arm Cortex-A78AE 核心,M95 集成 360TOPS 等效 AI 算力、10 个同款核心。两款芯片均满足 AEC-Q100 车规认证,端到端与 VLA 模型表现显著优于行业水平,ISP 通路延时降低 70%。

16:58
IT之家(RSS)
AI 评分 43/100
GMO 推出日本首个"人形机器人救护车",配备专用担架与维修零部件

日本 GMO 旗下公司 GMO AIR 推出日本首个人形机器人救护车,可在机器人故障时赶赴现场提供诊断、维修及备用机器人等服务,车内配备专用担架、零部件和耗材。若现场无法修复,机器人将被送至东京涩谷的实验室进一步诊断。该公司称,灵感源于其宇树 G1 机器人今年 8 月参赛时摔倒损坏、现场 10 分钟修复的经历。

16:58
IT之家(RSS)
AI 评分 41/100
韩国电池材料企业EcoPro瞄准人形机器人,开辟电动汽车外新增长赛道

韩国电池材料企业EcoPro计划进军人形机器人产业,加快高镍正极材料及下一代固态电池技术研发,以寻找电动汽车之外的新增长市场。该公司运营着一座年产能40吨的试验工厂,生产用于全固态电池的硫化物固态电解质,并计划于明年开始商业化生产。分析人士预计,人形机器人产业要到下一个十年后半段才会迎来真正的爆发节点。

16:58
IT之家(RSS)
AI 评分 73/100
六人利用 AI 越狱生成淫秽物品牟利获刑,法官提醒技术中立不等于技术无罪

浙江余姚法院审结一起利用生成式 AI 制作淫秽物品牟利案,郑某等 6 人通过改写系统提示词、设定角色卡越狱模型,构成制作淫秽物品牟利罪。该模型生成静态图片超 37 万张、动态图片超 6000 张,用户充值约 24000 美元;法官指出开发者主动篡改安全机制,仍属刑法意义上的淫秽物品制作者。

政策/监管
16:58
IT之家(RSS)
AI 评分 55/100
亚马逊拟首次发行英镑债券,今年资本支出计划达 2,200 亿美元

据彭博社报道,亚马逊计划首次发行英镑计价债券,分为 3 年至 19 年不等的 4 个期限档,最快可能于周三启动,摩根大通、巴克莱、汇丰和 NatWest 负责承销。

行业动态
已加载 40 条