AI 日报

这一天的 28 件 AI 大事

28 条核心新闻10 分钟

GLM-5.3-Flash 开源:320B 总参数、AA 指数 57 分,定价为 Opus 4.8 的 1/40

智谱上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,AA 综合智能指数 57 分,与 Claude Opus 4.8 持平。其定价为 GLM-5.3 的 1/10,限时折扣内为 Opus 4.8 的 1/40,并已接入 ZCode 等平台开放 API 调用。该模型采用稀疏注意力与线性注意力混合架构,推理服务已跑在国产芯片集群上。

智谱原文

Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览

通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。

通义千问原文

GlucoFM:面向连续血糖监测的基础模型

Google Research 推出 GlucoFM,一款轻量级自监督 CGM 基础模型,采用双流设计分别建模缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,其 PR-AUC 较最优 GluFormer 变体平均高出 5.8 个百分点,并在 PPGR 预测中取得最低 MAE。模型在 109,066 小时无标注 CGM 数据上预训练,具备跨数据集迁移与少样本适应能力。

Google Research原文

Claude in Chrome 正式全面上线

Anthropic 宣布 Claude in Chrome 现已面向所有付费 Claude 套餐全面开放,Claude 可在浏览器中自主执行操作,无需逐步审批。系统通过安全分类器在每次操作前验证其安全性及是否符合用户请求,并强化了针对提示注入攻击的防御。最新评测显示,在启用探测与安全分类器后,自 Opus 4.8 起的所有模型均未出现攻击成功案例。

Anthropic原文

Claude Cowork 内置浏览器上线:Claude 可在桌面应用中自主浏览网页

Anthropic 在 Claude Cowork 桌面应用中为 Claude 新增内置浏览器,可自动导航网页、阅读页面、点击并填写表单,无需扩展或额外设置。该功能本周起向 Pro、Max 和 Team 套餐用户推送,Enterprise 管理员今日起可启用;浏览器与用户自有浏览器隔离,不读取标签页、书签或密码,并沿用与 Claude in Chrome 相同的提示注入防护措施。

Anthropic原文

以色列资助的假美国智库试图利用AI进行宣传

一个打着“汉诺威公共政策研究所”旗号的亲以色列网站,在九天内发布了124篇、超56万字的报告,旨在优化内容以引导ChatGPT等AI聊天机器人引用其亲以观点。该网站由美国公司Piro Inc依据《外国代理人登记法》为以色列政府分发内容,其背后是以色列政府数千万美元资助、经Havas Media等第三方转手的更广泛宣传行动。

Hacker News 热门原文

亚马逊将英伟达芯片订单增至三倍,新增200万颗GPU

亚马逊与英伟达宣布扩大合作,将在2027和2028年为AWS数据中心新增200万颗GPU芯片,包括Blackwell Ultra、Rubin和Rubin Ultra。此前五个月亚马逊刚同意部署超100万颗英伟达GPU,英伟达称此后“需求超出预期”。双方未披露财务条款,但按GPU单价估算交易价值达数百亿美元。

TechCrunch原文

英伟达 2027 财年半年报归母净利润 1180.1 亿美元,同比增长 161.1%

英伟达发布 2027 财年半年报,上半年营收 1778.37 亿美元,归母净利润 1180.1 亿美元,同比增长 161.1%,GAAP 毛利率 75%。第二财季营收 962.21 亿美元,同比增长 106%,环比增长 18%,归母净利润 596.88 亿美元,同比增长 126%。数据中心业务第二季度收入 890.23 亿美元,同比增长 117%,Vera Rubin 平台已进入全面量产。

IT之家原文

Linear 完成 9900 万美元要约收购,估值达 25 亿美元

Linear 完成 9900 万美元要约收购,公司估值达 25 亿美元,现有投资者 Accel 和 01A 及新投资者 Salesforce Ventures 和 S32 参与。公司年经常性收入已突破 1 亿美元,超 4 万家企业付费使用,净收入留存率达 177%。其智能体平台已覆盖 95% 的付费工作区,智能体创建的工作占比从一年前的 3% 升至 50%。

Linear原文

OpenAI 将 ChatGPT for Teachers 扩展至美国 55 个新学区,覆盖超 10 万名教育工作者

OpenAI 宣布将 ChatGPT for Teachers 扩展至 20 个州的 55 个新学区,新增覆盖超 10 万名教育工作者。至此,OpenAI 已与 30 个州的 100 多个 K–12 组织合作,为超 30 万名教育工作者提供免费访问和培训。同时,OpenAI 推出覆盖 16 个州的行业首个数据隐私协议,该工具对经认证的美国 K–12 教育工作者免费开放至 2028 年 6 月。

OpenAI原文

OpenAI 发布教育报告:ChatGPT 如何让学习不再受课堂时间限制

OpenAI 发布新报告,展示学生和教师如何用 ChatGPT 将学习延伸至课堂之外。隐私保护分析显示,各年龄段用户每周约有 7000 万次对话用于检验知识掌握;美国学年期间与课业相关的提示词每周峰值超 4.6 亿条,暑假期间仍保持在每周 1.8 亿条以上。报告还介绍了美国多位教师和学生的具体使用案例。

OpenAI原文

IDEA Prune:生成式语言模型预训练中的集成放大-剪枝流程

Apple 研究团队提出 IDEA Prune,将放大模型预训练纳入结构化剪枝流程,形成集成式 enlarge-and-prune 管线。该研究探讨两个关键问题:即使放大模型从不部署,预训练它是否值得;以及如何优化该流程以提升 token 效率。相比从头训练目标尺寸模型,该流程在有限推理预算下展现出更高的 token 效率。

Apple Machine Learning Research原文

PROOF-Gen:从优化数据到更好的知识蒸馏

PROOF-Gen提出用优化后的数据改进工具调用能力的知识蒸馏。在τ²-bench上,教师模型57%的试运行失败,其中三分之二是近失(大部分工具调用正确),而传统生成-过滤流程因失败不提供信号,每轮都会遗留相同的难题。该方法通过利用失败信号优化数据,提升蒸馏效果。

Apple Machine Learning Research原文

实测飞书和豆包合体后第1个Agent:豆包工作的8个使用技巧

豆包工作(豆包 Work)是当前企业接入Agent门槛最低的路径,但需用飞书账号登录才能解锁满血功能。实测可用手机远程控制最多7台设备、定时任务、自动读取本地skill、侧边栏直接编辑并同步飞书,且管理员看不到聊天记录。作者认为Work Agent是token消耗倍增器,飞书原生生态是豆包工作相比Claude Cowork、Codex Work的核心优势。

卡尔的AI沃茨原文

Warp 如何在 Claude 上构建自我改进的智能体

Warp 在 Claude 平台上构建了基于 Agent Skills 的自我改进循环,通过基础技能与改进技能两个文件型技能,将人类反馈转化为对智能体的持续优化。该模式已应用于其整个开源仓库,覆盖数百名贡献者与数千次代码审查。团队建议以原则而非规则编写技能,并强调低摩擦反馈与改进技能的可复用性。

Anthropic原文

GitHub Copilot app 入门:自动化 Dependabot 拉取请求分类

GitHub Copilot app 自动化功能可接管 Dependabot 拉取请求的初审,按风险分组、验证 CI 状态并在工作日开始前生成摘要。用户可用自然语言描述任务,选择手动、每小时、每日等触发方式,并决定在云端或本地运行。每次运行记录均被保存,便于回溯审查。

GitHub Blog原文

比尔·盖茨新文呼吁制定连贯AI计划,Gary Marcus称其呼应自身观点

Gary Marcus盛赞比尔·盖茨新文章,称其呼应了自己2024年著作《Taming Silicon Valley》的诸多主题。盖茨强调当前决策的持久重要性,指出AI在生物恐怖主义、深度伪造、虚假信息、网络攻击等方面的风险,并警告“AI可能阻碍孩子发展、取代人际关系”。盖茨呼吁建立国内外AI治理框架,并让公民社会而非仅政府和科技公司参与制定系统性计划。

Gary Marcus原文
AIHOT · 编辑系统自动生成