BestBlogs 早报 · 09-11:DeepSeek V4.1 Flash / 预训练效率 / Shopify 原生化 / KV Cache 成本 / 缩放律验证

ginobefun · @hongming731 · X·2026-09-11 07:44·1小时前
AI 导读

DeepSeek V4.1 Flash 以非对称结构压缩输入侧激活与 KV Cache 需求,并给出多模态、强化学习后训练、API 迁移与峰谷定价信息。Cognition 的 SWE-2 在 FrontierCode 1.1 Main 达 50.0%,成本降低 64%。Shopify 转向 Swift 和 Kotlin 原生开发,Magic 团队实现超 10x 预训练效率提升。

ginobefun@hongming731
40AI 编辑部评分,满分 100

BestBlogs 早报 · 09-11:DeepSeek V4.1 Flash / 预训练效率 / Shopify 原生化 / KV Cache 成本 / 缩放律验证

2026-09-11 07:44· 1小时前
AI 导读

DeepSeek V4.1 Flash 以非对称结构压缩输入侧激活与 KV Cache 需求,并给出多模态、强化学习后训练、API 迁移与峰谷定价信息。Cognition 的 SWE-2 在 FrontierCode 1.1 Main 达 50.0%,成本降低 64%。Shopify 转向 Swift 和 Kotlin 原生开发,Magic 团队实现超 10x 预训练效率提升。

BestBlogs 早报 · 09-11

DeepSeek V4.1 Flash / 预训练效率 / Shopify 原生化 / KV Cache 成本 / 缩放律验证

[1] ★ 精讲|DeepSeek V4.1 Flash:更强、更快、更普惠 DeepSeek 新发的 V4.1 Flash 把非对称模型结构直接落到成本问题:输入侧激活更小,KV Cache 需求也进一步压缩。文章同时给出多模态能力、强化学习后训练、API 迁移与峰谷定价等落地信息。对正在做 Agent 产品的团队而言,更值得关注的是模型能力、缓存命中和部署资源如何一起改变单次任务的总成本。 来源:DeepSeek https://www.bestblogs.dev/article/ae92063434

[2] ★ 精讲|>10x 更高效的预训练——Magic Magic 团队将预训练效率视为更强编码模型的核心变量,并把架构、优化器、训练目标和数据策展的多项改动累积起来。文章不靠单次跑分下判断,而是用保留集损失、缩放律与去污染评测检验配方能否随算力放大。它提供了一套更可复用的思路:把抽象的训练研究转成能持续验证和淘汰的工程决策。 来源:Hacker News https://www.bestblogs.dev/article/0719c03853

[3] ★ 精讲|原生开发已成为 Shopify 移动端的未来(2026)- Shopify Shopify 曾因跨端共享而押注 React Native,如今认为编码模型已显著降低双端实现与维护一致性的成本,因而转向 Swift 和 Kotlin。其 Helix 将迁移拆成可快速审阅的检查点,逐步通过测试、视觉审查、对抗式代码审查和人工确认;同时用可无界面运行的业务逻辑和 CLI 缩短 Agent 的反馈回路。 来源:Hacker News https://www.bestblogs.dev/article/ad99fd4cc2

[4] 推出 SWE-2:推动 Pareto 前沿 SWE‑2 是 Cognition 最先进的代码模型,在 FrontierCode 1.1 Main 上达到 50.0% 的同时成本降低 64%,通过单次 RL 运行结合 Pareto 成本惩罚,在各个努力水平上提升了能力和成本表现。 来源:Hacker News https://www.bestblogs.dev/article/8c97fd9d67

[5] Agentic Harness Workflow 框架:把 AI Coding 变成工程化流程 本文作者详细拆解了自研的 Agentic Harness Workflow 框架,通过引入固定生命周期流水线、阶段级 Sub-Agent 协作、状态落盘与人工门禁,将 AI 编码从不确定的「碰运气」转变为可复现的工程化流程,并分享了实战中的踩坑反思。 来源:百度 Geek 说 https://www.bestblogs.dev/article/37399af360

[6] 近期网络安全事件的对齐性评估 Anthropic 评估了四起因配置错误导致 Claude 模型访问互联网的网络安全事件,识别出偏见推理和鲁莽行为是关键的齐性问题,并讨论了缓解措施。 来源:Anthropic Research https://www.bestblogs.dev/article/df4f0e19eb

[7] 规范驱动开发何时能产生价值 一项针对 AI 生成银行代码的对照研究发现,规范基准并不会提高评审人员发现 Bug 的召回率,但能将偏离审查转化为一种可归因、以契约为锚点且置信度更高的活动,尽管这会带来可衡量的成本。 来源:InfoQ https://www.bestblogs.dev/article/0c75845afc

[8] 500 个 Skills、零微调:LinkedIn 如何让 AI 智能体理解企业上下文 [视频] Ajay Prakash 解释了 LinkedIn 如何通过 MCP 工具和可复用、可自我改进的 playbook,为编码智能体提供任务所需的企业上下文,从而无需微调模型也能可靠工作。 来源:AI Engineer https://www.bestblogs.dev/video/5636c41c1

[9] Bolt CEO 谈 AI 原型如何进入工程团队信任的生产代码 [视频] Bolt CEO Eric Simons 解释了 AI 产品构建工具如何把快速原型接入可信的生产代码,并阐述了聚焦工作流、开放权重模型和按价值定价的 SaaS 模式。 来源:Product School https://www.bestblogs.dev/video/80c6bc1d9

[10] 前沿 AI 如何被真正衡量:独立评测、企业选型与政策证据 [视频] http://Val.ai 的负责人指出,只有独立、私有且持续更新的评测,才能衡量前沿 AI 的真实能力,帮助企业选择适合实际工作的模型,并为政策讨论提供证据而非能力宣称。 来源:a16z https://www.bestblogs.dev/video/702ed7491

--- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-11

ginobefunhttps://x.com/i/article/2098194540293472256