#GitHub
#GitHub
今日 0 条
SenseTime@SenseTime_AIAI 评分5858Cloudflare BlogAI 评分6969 Cloudflare 如何用软件工厂将 Astro 的 GitHub issue 数降至零
Cloudflare 在 Astro 仓库上运行自动化 triage 流水线,通过隔离的 AI 子代理复现、诊断并修复 bug,将开放 issue 从 200 多个降至约 30 个,预计下月归零。该流水线由 issue 标签驱动,修复后自动发布预览版本供用户验证。其底层引擎已发展为 Flue,一个开源的平台无关框架,用于构建持久化智能体与工作流。
Rohan Paul@rohanpaul_aiAI 评分4242引用Genspark@genspark_aiOpen-sourcing GenOffice, the world's first full-featured open-source AI Office for PC and Mac. GenOffice is free for everyone, ad-free. All the editing tools you'd expect, no strings attached. How it started? One engineer, one week, $10,000 in tokens. That's what it took to build the GenOffice Alpha. Help shape the AI office experience We invite you to build the rest of it with us. Join the GenOffice group chat on GenTeam and bring your requests straight to the agent. Not by writing code, but by telling it what you want. You say what you need, and every piece of your feedback becomes part of the product. What's in GenOffice? Docs, Sheets, Slides, and PDF, with all the editing tools you already know. And with Genspark Super Agent built in, powered by top-tier models, it digs into research, crunches your data, then writes the doc or builds the deck for you, using your Genspark credits. This is an Alpha, and we mean it. Come tell us what's broken and what's missing. Everyone who jumps in with real feedback gets 1,000+ Genspark credits as a thank you. GitHub 👉 https://github.com/genspark-ai/genoffice Download it now 👉 https://www.genspark.ai/genoffice
MarkTechPost(RSS)精选AI 评分7979 Reflex 开源 XY:基于 Rust 的超快 Python 绘图库,可保持 1 亿点图表交互流畅
Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。
推荐理由:通过Rust核心和二进制输出,XY将千万级点的交互渲染稳定在0.08秒,并让HTML导出体积从259 MiB缩至258 KiB,这对金融、基因组学等需原始数据钻取的大数据场景有直接落地价值。
IT之家(RSS)AI 评分2020 全球最小 GPU 芯片 TinyGPU v2.0 通过实测:约 24 万个晶体管,最高渲染 15 FPS
开发者蓬萨贡·维奇特宣布,全球最小 GPU 芯片 TinyGPU v2.0 已通过实机测试。该芯片拥有约 24 万个晶体管,支持 4-bit 双缓冲和 8-bit 深度缓冲,屏幕最多容纳 1000 个三角形。在 Basys3 FPGA 主机上测试帧率为 7.5 到 15 FPS,TinyGPU v3.0 已提交下一轮流片,新增可编程像素着色器。
HuggingFace Daily Papers(社区热门论文)AI 评分5454 DualIFM:面向视网膜眼底图像的可解释基础模型
DualIFM 通过 BagNet 骨干网络实现设计上的可解释性,其小感受野生成的类别证据图忠实反映模型决策过程,并在预训练中加入 2D 投影层以直接可视化表征空间。该模型在超过 80 万张彩色眼底照片上训练,性能与参数多 16 倍的 RETFound 相当,且在分布外数据上提供可解释预测。代码与预训练模型已开源。
公众号:卡尔的AI沃茨AI 评分6969 跨多台 Mac 与 Codex、Claude Code 的 Agent 记忆管理方案:claude-mem 本地捕获 + Mem0 跨设备共享
作者为三台 Mac 上的 Codex、Claude Code 等 Agent 设计了一套记忆管理方案:开源项目 claude-mem 通过 hook 自动捕获本地对话关键记忆,筛选后上传至远程 Mem0 并附项目 id,实现跨设备、跨 Agent 共享项目上下文。
lauren@potetoAI 评分4040
IT之家(RSS)AI 评分6464 自变量机器人发布并开源 HOST 框架,让机器人看视频学会新技能
自变量机器人发布并开源 HOST 框架,让机器人仅观察一段数十秒的人类视频就能学会新技能,同时保留已掌握技能。该框架从一段 29 秒人类视频中学习技能的成功率达 62%,超越零样本基线 45%,相比 Pi-0.5 + 微调方案数据量减少 50 倍、学习速度提升 500 倍。HOST 采用“按任务进度对齐”和双专家 MoT 架构,研究论文与代码已全部开源。
Nathan Lambert@natolambertAI 评分5959引用Qwen@Alibaba_Qwen📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub:https://github.com/qwen-code-dev-bot/oh-my-cli - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. 💰Pricing: Input: $2.0 / M tokens Output: $6.0 / M tokens Implicit Caching: $0.25 / M tokens Start building with Qwen3.8-Max! 🚀 📖 Blog: https://qwen.ai/blog?id=qwen3.8 ✅ Qwen Studio: https://chat.qwen.ai/?models=qwen3.8-max ⚡ API: https://www.qwencloud.com/models/qwen3.8-max
HuggingFace Daily Papers(社区热门论文)AI 评分6262 PosterMELD:多智能体论文转海报生成,兼顾可控设计多样性与可编辑打印输出
PosterMELD 提出一种模板条件化的多智能体流水线,先通过容量感知槽位引导写作,再用确定性门控与 VLM 审查将失败路由至有界修复,每个通过请求导出可编辑 PPTX 与 PNG。
HuggingFace Daily Papers(社区热门论文)AI 评分5757 知识-几何解耦:面向流式推荐的可刷新预训练迁移
Shopee 提出知识-几何解耦(KGD)框架,解决流式推荐中预训练-迁移范式的两大问题:用行为多 token 预测(BMTP)过滤无关会话噪声,并通过可刷新编码器与任务学习器的参数解耦,避免任务梯度干扰预训练知识。KGD 在八个公开基准上较基线提升 4–12%,在 Shopee 首页搜索的线上 A/B 测试中使单用户 GMV 提升 1.75%、广告收入提升 1.53%,已全面部署。
Simon Willison 博客AI 评分4646 condense-json 1.0 发布:用替换语法压缩 JSON 重复字符串
Simon Willison 发布 condense-json 1.0,这个 Python 库可将 JSON 中与替换对象匹配的字符串或子串替换为特殊 `{"$r": ...}` 语法,并可用 `uncondense_json` 还原。作者用它压缩 LLM 生成的 SQLite 日志中的重复数据以节省空间。
Simon Willison 博客AI 评分4949 datasette-apps 0.2a0 发布:新增 app_debug() 与 app_list() 工具
datasette-apps 0.2a0 发布,新增 app_debug() 工具,允许 Datasette Agent 在 opacity: 0 且 pointer-events: none 的隐藏 iframe 中执行 JavaScript,对应用进行冒烟测试并测量元素尺寸;新增 app_list() 工具,用于列出用户有编辑权限的应用。
Simon Willison 博客AI 评分5555 Slack Emoji Maker:用 Fable 构建的 128x128 透明背景表情制作工具
Simon Willison 用 Fable 构建了一款名为 Slack Emoji Maker 的简易图像编辑器,专为创建 Slack 表情符号设计。该工具遵循 Slack 官方推荐规格,输出 128x128 像素且带透明背景的方形图片,满足用户快速制作自定义表情的需求。
MarkTechPost(RSS)AI 评分5151 Supabase 开源 Evals:用真实任务评测 Claude Code、Codex 和 OpenCode 的基准框架
Supabase 开源了 Supabase Evals,一个用真实任务(如构建 schema、调试 Edge Function、修复 RLS 策略)评测 Claude Code、Codex 和 OpenCode 等编码智能体的基准与框架,并驱动 supabase.com/evals 公开排行榜。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6161 以 0.50 tok/s 运行 Kimi K3:WASTE 引擎让 2.78T 参数模型在 64GB 内存笔记本上流式推理
WASTE 是一个用 C 编写的可嵌入推理引擎,通过将模型主干驻留内存、按需从磁盘流式读取专家权重,在 64GB MacBook Pro 上以 0.49–0.54 tok/s 运行完整的 2.78T 参数 Kimi K3 模型(982 GiB 容器,29.05 GiB 最低内存)。
GitHub BlogAI 评分5454 GitHub 开源 casefold:以内存速度进行源码大小写折叠
GitHub 为代码搜索引擎 Blackbird 优化大小写折叠性能,该引擎索引超 1.8 亿个仓库、480TB 源码。团队发现移除提前退出分支比保留优化更快,最终在 Apple M4 上实现超 45 GiB/s 吞吐,接近内存带宽。结果已开源为 Rust crate `casefold`,仅实现简单(1 对 1)折叠,与 ripgrep 等工具保持一致。
OpenBMB@OpenBMB精选AI 评分7575

推荐理由:做 agent 的人都知道环境对齐是个隐形的坑,这篇论文不仅把问题讲透了,还给了开箱即用的 wrapper,ALFWorld 上成功率从 13% 拉到 31%,原因只是改写了反馈措辞,我觉得这是今年 agent 工程最被低估的发现。
Simon Willison 博客AI 评分5353 llm 0.32rc1 发布:新增内容寻址哈希 ID 与 GPT-5.6 系列支持
llm 0.32rc1 完成自 0.32a0 开始的架构更新,采用内容寻址哈希 ID 存储消息,实现数据库去重并支持分叉对话的消息树结构。新版本同时新增对 gpt-5.6-sol、gpt-5.6-terra 和 gpt-5.6-luna 的支持。升级前建议运行 `llm logs backup logs-backup.db` 备份现有日志。
Simon Willison 博客精选AI 评分7272 llm-chat-completions-server 0.1a0 发布
Simon Willison 发布 llm-chat-completions-server 0.1a0 插件,可在本地 9001 端口启动一个兼容 OpenAI Chat Completions API 的服务器,暴露 LLM 工具中所有已安装的模型。
推荐理由:Simon 把 LLM 工具变成了兼容 OpenAI 的 API 服务器,开发者可以本地直接用任何模型,省去适配工作,安装即用,实用性强。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 RecHarness:面向自进化推荐系统的 Bandit 路由智能体框架
快手团队提出 RecHarness,一种用于自动化推荐模型优化的 Bandit 路由智能体框架。它将优化过程分为两步:bandit 路由器根据历史验证反馈选择修改方向,LLM 在选定方向内生成具体优化假设和可执行代码编辑,并通过 jump-basin 机制在局部编辑停滞时激活结构跳跃。
HuggingFace Daily Papers(社区热门论文)AI 评分4949 面向暗光环境的鲁棒 3D 感知 RGB-NIR 成像新方法
东京大学等机构提出一种无需干净 RGB 监督的 3D 感知神经隐式融合模型,可在暗光下将极噪 RGB 观测与近红外(NIR)线索在 3D 空间中隐式融合,恢复干净 RGB 图像。该方法引入 NIR 调制的位置编码和 Color Code MLP,解决噪声过拟合与 NIR-RGB 映射不适定问题,在合成与真实多视图数据集上优于现有方法,并能泛化至不同噪声水平。代码与数据将公开。
GitHub Blog精选AI 评分6565 GitHub Copilot 应用新增堆叠会话与拉取请求功能
GitHub Copilot 应用推出堆叠会话功能,允许用户在同一个仓库中创建一系列相互承接的任务,每个会话可基于前一个会话的成果继续工作。作者通过一个十余年历史的个人项目演示了该功能:先使用 Plan 模式制定前端现代化计划,再通过堆叠会话将 React-Bootstrap 替换工作拆分为独立会话,并自动为每个会话创建对应的拉取请求,避免范围蔓延。
推荐理由:GitHub Copilot 的堆叠会话让多步骤 PR 拆分成链,Cassidy 用十年老项目演示如何避免巨型改动,对 Copilot 用户是可直接套用的实操指南。
lauren@potetoAI 评分6363
HuggingFace Daily Papers(社区热门论文)AI 评分5757 EMBL AI Librarian:面向AI智能体的生命科学知识层
EMBL AI Librarian是一个知识层,将Europe PMC接口升级为面向AI智能体的自然语言问答形式,由单个LLM规划互补子查询并阅读论文定位证据。在ScholarQABench上,其Citation F1比近期强基线提升超16个百分点;在LitQA2基准上,接入Librarian的GPT-5.4智能体比使用网页搜索得分高约8分。代码已公开。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 SkillRise:面向跨任务技能演化的智能体强化学习框架
SkillRise 提出统一强化学习框架,让大语言模型智能体在解决一系列相关任务时自动提取、精炼并复用可迁移技能。在 ALFWorld、WebShop 和 ScienceWorld 上,其 Pass@1 性能超过最强基线 2.3 至 8.5 个百分点,且测试时随任务序列长度增加而持续提升。代码已开源。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6767 Vision Pro 最酷的用法:将户型图转为3D模型辅助建房决策
一位用户利用 Vision Pro 将平面户型图通过 Fusion 360 转为 3D 模型,在高分辨率虚拟空间中“行走”以感受房间尺度与动线。通过添加 IKEA 等家具 3D 模型,进一步模拟真实空间感,帮助做出装修决策。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7474 开源引擎可在任何 M 系列 Mac 上以 2 GB 内存运行 Gemma 4 26B
一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。
推荐理由:这是我见过最极端的端侧优化,把 26B 参数塞进 2GB 内存,意味着所有 M 系 Mac 都能本地跑大模型了,开发者值得马上 clone 试试。
Tencent Hy@TencentHunyuan精选AI 评分7474推荐理由:做推理加速的可以试试这个端到端推测解码框架,腾讯开源了完整代码和权重,在 Hy3 上提速近 2.4 倍且吞吐更高,拿来即用。
IT之家(RSS)AI 评分6464 微软 GitHub Copilot 现支持调用 Grok 4.5 AI 模型
SpaceXAI 宣布 Grok 4.5 模型已入驻 GitHub Copilot,开发者可在云智能体、Copilot CLI 及 VS Code IDE 中切换调用。该模型专为编码设计,上下文窗口达 50 万 token,支持文本和图像输入及三种推理难度,按量计费价格为每百万输入 token 2 美元、每百万输出 token 6 美元。
Tibo@thsottiaux精选AI 评分7777推荐理由:OpenAI Codex团队把代码安全扫描做成开源CLI和SDK,直接能跑在CI里,对在意AI生成代码安全的开发者来说,算是个实用工具,不妨一试。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6969 OpenAI 开源 Codex Security 代码安全工具
OpenAI 开源了 Codex Security,一个用于查找、验证和审查代码安全问题的 CLI 和 TypeScript SDK。该工具支持 macOS、Linux 和 Windows,需要 Node.js 22 及 Python 3.10 或更高版本,可扫描、导出 SARIF/CSV/JSON 格式结果、验证发现并自动生成补丁。
DogeDesigner@cb_dogeAI 评分5151
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7676 Kimi Linear:一种表现力强且高效的注意力架构
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
推荐理由:Kimi Linear首次在公平对比中证明了线性注意力可以全面超越full attention,KV缓存降低75%,解码吞吐量提升6倍,所有做长上下文和RL团队的必读论文。
OpenBMB@OpenBMBAI 评分4545

Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7171 FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA
Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。
公众号:月之暗面(Kimi)精选AI 评分8585 Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放
月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分4848 Opus 5 在 SlopCodeBench 上的基准测试结果
Opus 5 在 SlopCodeBench 基准测试中接受了评估。该测试旨在衡量模型生成低质量代码(slop code)的能力。具体分数和对比数据尚未在本文中披露。
MarkTechPost(RSS)AI 评分5454 Kimi 团队开源 AgentENV:为 2.8 万亿参数模型提供智能体强化学习训练
Moonshot AI 的 Kimi 团队与 kvcache-ai 开源了 AgentENV (AENV),一个用于大规模运行智能体环境的分布式平台,支持 Kimi K3 模型的智能体强化学习训练。该平台基于 Firecracker 微虚拟机,可实现快照启动/恢复低于 50 毫秒,并支持将运行中的沙箱分叉出最多 16 个独立子沙箱。代码采用 MIT 许可证。