Topic · 主题全部主题 →

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

4,292条收录
622条精选

精选归档 · 第 24 页

461480 条 · 共 622

5月12日5月12日周二

星期二 · 2 条
19:49
公众号:智谱(GLM)精选
AI 评分 63/100
GLM-5.1获AA全新Coding Agent基准开源第一

全球权威评测机构Artificial Analysis发布全新Coding Agent Index,包含SWE-Bench-Pro-Hard-AA、Terminal-Bench v2和SWE-Atlas-QnA三项基准,用于衡量模型与Agent harness组合的真实编程能力。闭源模型Opus 4.7(在Cursor CLI中运行)全球第一,智谱GLM-5.1(在Claude Code中运行)获开源第一,代表国产大模型在实际编程Agent场景达到SOTA水平。

另有 2 家信源报道公众号:智谱(GLM)IT之家(RSS)
推荐理由:GLM-5.1 在 AA 的新 Coding Agent 基准上拿了开源第一,时隔一个月回头看,这个成绩对国产开源模型在编程 Agent 赛道的位置是个重要注脚,做工具链选型的还是值得扫一眼。
07:43
Hugging Face:Blog(RSS)精选
AI 评分 58/100
在AWS上进行基础模型训练与推理的核心构建模块

本文面向使用开源框架的机器学习工程师,阐述了AWS如何为大规模基础模型的全生命周期提供核心基础设施。其核心是三大紧密集成的组件:配备多代NVIDIA GPU(如H100、H200及新一代Blackwell B200/B300)的大显存加速计算实例;用于集体通信的高带宽、低延迟网络(节点内NVLink与节点间EFA);以及可扩展的分布式存储。这些基础设施与Slurm/Kubernetes等资源编排系统、PyTorch/JAX等ML框架协同,共同支撑预训练、后训练和推理工作负载,并可通过Prometheus/Grafana实现全栈可观测性。


推荐理由:这篇把AWS上训大模型的全套基础设施串了一遍,从GPU选型到网络存储再到Slurm/K8s编排,是做云端大规模训练的工程师的必读参考。

5月11日5月11日周一

星期一 · 3 条
22:54
Runway:News(网页)精选
AI 评分 68/100
告别编写YAML:使用confingy配置机器学习系统

Runway开源了Python库confingy,旨在解决机器学习系统配置的长期痛点。该库允许开发者用纯Python代码(支持懒加载、类型检查和序列化)替代传统YAML配置文件,从而摆脱YAML作为图灵完备领域特定语言所带来的维护困境。confingy无需重构现有代码,即可满足跟踪构造函数参数、避免实例化昂贵对象(如大语言模型)等核心需求,有效改善了因复杂YAML配置导致的无法跳转定义、类型提示失效和重构困难等开发体验问题。


推荐理由:Runway把自家ML训练的YAML坑填平了,开源了confingy。如果你还在用YAML管实验参数,这可能是今年最该装的pip包。
21:31
凡人小北@frxiaobei精选
AI 评分 75/100
AI工具批量生成知识产权申请材料引关注知识产权全面沦陷。发明专利生成 skill https://github.com/handsomestWei/patent-disclosure-skill软著生成 skill https://github.com/Fokkyp/SoftwareCopyright-Skill设计专利/实用新型更容易,claude desgin/ image2

scavin: 中国软件著作权申请材料 生成器 Skills https://meta.appinn.net/t/topic/85159


推荐理由:发明和软著生成 skill 直接把知识产权的门槛打到地板,虽然质量可能粗糙,但这套自动化流水线会让审批系统面临海量申请,值得关注。
03:43
Hugging Face:Blog(RSS)精选
AI 评分 74/100
MachinaCheck:基于AMD MI300X构建多智能体CNC可制造性分析系统

MachinaCheck是一款基于多智能体AI的系统,旨在革新小型CNC机加工车间的报价分析流程。传统上,车间经理需花费30-60分钟手动分析图纸,而该系统在上传STEP文件及材料、公差等简单输入后,能在30秒内生成完整的可制造性报告,明确指出零件能否制造、所需工具及生产前需采取的行动。其核心在AMD MI300X加速卡上本地运行Qwen 2.5 7B模型,利用192GB HBM3显存确保客户设计数据无需离开本地,满足了制造业对数据隐私的严格要求。系统采用五组件流水线,结合精确的几何特征提取与LLM的制造知识推理,最终输出结构化报告。


推荐理由:虽然是hackathon项目,但用多Agent做CNC可行性分析,把推理全压在本地AMD显卡上保护图纸隐私,还给了可跑的代码和Space,制造业AI落地就该这么直接。

5月10日5月10日周日

星期日 · 2 条
19:29
02:42
Hugging Face:Blog(RSS)精选
AI 评分 68/100
OncoAgent:一个用于隐私保护肿瘤临床决策支持的双层多智能体框架

研究团队发布了开源肿瘤临床决策支持系统OncoAgent。该系统采用双层多智能体框架,结合LangGraph拓扑与四阶段Corrective RAG流程,检索超过70份权威临床指南。系统根据查询复杂度,将任务路由至9B参数的速度优化模型或27B参数的深度推理模型,两者均通过QLoRA在AMD MI300X硬件上使用包含26万余病例的数据集进行微调。系统强制执行严格的零受保护健康信息政策,并通过三层反射安全验证器确保安全,支持完全本地部署以保护患者数据主权。


推荐理由:这个开源肿瘤AI系统把多智能体、RAG和隐私合规全塞进一台AMD服务器,临床落地又近了一步,不是那种只发论文不交代码的项目。

5月9日5月9日周六

星期六 · 3 条
23:32
阿绎 AYi@AYi_AInotes精选
AI 评分 82/100
Redis创始人用C语言引擎将大模型"装进"个人电脑Damn,Redis创始人用一个C文件,干翻了大厂烧几十亿的GPU集群。Antirez,那个写出Redis的传奇黑客,昨天开源了ds4。一个专门为DeepSeek V4 Flash写的原生推理引擎,只有几千行C代码。它做到了一件很多人都觉得不可能的事: 把拥有1M上下文窗口、能跑完整coding agent循环的准前沿模型,完整跑在一台普通的128GB MacBook Pro上。YC CEO Garry Tan看完直接转发,只说了一句话: “正在下载… 1M上下文+可用的coding agent能力,全在一台128GB MacBook上,这太疯狂了🤯”这已经不是一个普通的量化项目那么简单了铁汁们, 属于顶级黑客用极致的系统工程,把闭源实验室烧几十亿才能玩的东西,压到了每个人的笔记本里。他的三个黑客级操作,每一个都颠覆了行业常识:1. 不对称2-bit量化: 只对MoE里占90%体积的专家部分做2-bit压缩,所有关键路径保持全精度。 质量损失极小,Antirez本人亲测“coding agent工作良好,能可靠调用工具”。2. 把KV Cache扔到SSD: 很多人都觉得KV Cache必须放内存,1M上下文会直接炸掉128GB内存。 他直接把KV Cache搬到了苹果的高速SSD上,用磁盘当扩展内存,彻底突破了硬件天花板。3. 纯Metal原生优化: 没有任何多余的封装, 没有通用框架的开销, 所有代码只为Apple Silicon写, 只为DeepSeek V4 Flash写。实测性能:M3 Max 128GB上稳定27 tok/s。不算快,但对本地跑agent循环来说,完全够用了。你不用再给OpenAI付API费,不用再担心数据泄露,不用再忍受网络延迟。所有的AI能力,完完全全在你自己的电脑里。卧槽,这才是真正的革命, 过去AI的权力攥在少数几家大厂手里,他们有GPU集群,定价格,甚至说删就删。现在,一个黑客用几千行C代码,就把这个权力还给了每一个开发者。开源AI真的是不可阻挡的, 大厂烧几十亿训练出来的模型,只要权重一开源,全世界的黑客就会用你想象不到的方式,把它优化到每一个能跑的设备上。今天是MacBook,明天是手机,后天是手表,太让人兴奋了!2026年5月9日,AI终于从云端的神坛,落到了每个人的笔记本里。或许这一天,会被写进历史!Redis创始人Antirez开源了专为DeepSeek V4 Flash设计的原生推理引擎ds4。该引擎仅用几千行C代码,通过三项关键技术:对MoE专家进行不对称2-bit量化、将KV Cache移至高速SSD突破内存限制、为Apple Silicon进行纯Metal原生优化,成功在128GB MacBook Pro上流畅运行具备1M上下文窗口的模型,实测达27 tok/s。此举将原本依赖云端GPU集群的前沿AI能力,通过极致工程优化 democratize 至个人设备,展现了开源社区推动技术平民化的强大潜力。

Garry Tan: Downloading now... 1M token context window with supposedly usable coding agent capability all on a 128GB Macbook Pro is ...


推荐理由:Antirez用几千行C代码把DeepSeek V4 Flash塞进128G Mac,本地跑1M上下文coding agent,这才是真正的AI民主化时刻,开发者必试。
15:50
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
Show HN: 适用于人工智能代理的 Git

开源项目“适用于人工智能代理的 Git”发布,旨在为AI代理提供类似Git的版本控制系统。该系统允许AI代理跟踪和管理其代码、提示词、模型权重等资产的变更历史,支持分支、合并与回滚操作。项目已在GitHub开源,并在Hacker News上获得100点热度。这一工具试图解决AI开发中工作流复杂、迭代难以追溯的问题,为多代理协作与实验管理提供标准化方案。


推荐理由:AI 代理的 Git,开源且能直接用。Agent 开发的版本控制痛点被正面解决,做复杂代理的值得试一下。
00:34
Hugging Face:Blog(RSS)精选
AI 评分 72/100
EMO:为涌现模块化预训练的专家混合模型

EMO是一种新型专家混合模型,通过端到端预训练使模块化结构直接从数据中涌现,无需依赖人类定义的先验。该模型允许在特定任务中仅使用12.5%的专家子集(即8个活跃专家中的部分),同时保持接近全模型的性能;当所有128个专家共同使用时,它仍作为强大的通用模型。EMO具有1B活跃参数和14B总参数,训练数据达1万亿令牌。与标准MoE相比,EMO通过文档级路由约束,鼓励专家形成领域专业化组,从而支持选择性使用而不导致严重性能下降,实现了可组合架构,优化了大型稀疏MoE的内存-准确性权衡。


推荐理由:EMO 让 MoE 专家从按词法分散进化到按语义域自然模块化,仅用 12.5% 专家就能接近全模型性能,对需要按需加载的大模型部署是真正的突破。

5月8日5月8日周五

星期五 · 6 条
16:23
Hugging Face:Blog(RSS)精选
AI 评分 58/100
MedQA:基于AMD ROCm与LoRA微调Qwen3-1.7B的临床问答模型

该项目使用AMD Instinct MI300X(192 GB HBM3显存)和ROCm,通过LoRA微调Qwen3-1.7B模型实现医学问答。训练仅用2000条MedMCQA样本,约5分钟完成,仅更新约220万参数(占模型总参数的0.1443%),全程采用fp16精度,无需量化。HuggingFace生态(Transformers、PEFT、TRL、Accelerate)在ROCm上无缝运行,无需修改代码即可直接替代CUDA。模型已上传至HuggingFace Hub并提供在线Demo。


推荐理由:一个月前的教程了,但如果你是 AMD 党想跑医疗微调,这篇把坑都踩完了,代码直接能复现,LoRA 适配器也挂在 Hub 上,拿来就能用。
08:06
Rohan Paul@rohanpaul_ai精选
AI 评分 78/100
atomic.chat为LLaMA.cpp引入多令牌预测技术,显著加速本地模型推理atomic[.]chat just made Gemma 4 26B faster inside LLaMA.cpp.making token generation about 40% faster in its MacBook Pro M5 Max test.Great news for local llms, because LLaMA.cpp and GGUF sit close to the local AI user base, where support often spreads into desktop apps, coding agents, and private on-device assistants.MTP (maltai token prediction) is like a smaller assistant drafting the next few words, while the main model checks whether those words are acceptable. If the draft is correct, the system accepts several tokens quickly. If the draft is wrong, the system rejects the wrong part and falls back to normal generation.atomic.chat通过为LLaMA.cpp引入多令牌预测技术,大幅提升了本地大型语言模型的推理效率。该技术利用小型辅助模型预先生成后续令牌草案,由主模型进行验证。在MacBook Pro M5 Max上测试时,使Gemma 4 26B模型的令牌生成速度加快约40%,整体运行速度提升1.5倍。这项优化进一步巩固了LLaMA.cpp和GGUF格式在本地AI生态中的核心地位,为桌面应用、编程助手和私有设备助手等场景提供了更高效的部署方案。

atomic.chat: Multi-Token Prediction (MTP) for LLaMA.cpp! Running Gemma4 local model 1.5x faster. We patched LLaMA.cpp. Quantized Gemm...


推荐理由:在笔记本上把 Gemma 26B 的生成速度拉高 40% 是个真实的体验提升,atomic.chat 把 MTP 带入 LLaMA.cpp 生态,本地 AI 玩家可以直接拿去用。
05:29
Anthropic:Research(发表成果 · 网页)精选
AI 评分 73/100
捐赠开源对齐工具 Petri

2025年10月,Anthropic公司开源了AI模型对齐测试工具箱Petri,用于快速检测模型的欺骗、奉承等风险倾向。该工具已成为Claude模型系列对齐评估的核心部分,并被英国AI安全研究所等外部机构采用。近日,Petri升级至3.0版本,主要改进包括:架构调整提升适应性,允许单独调整审计与目标模型;通过“Dish”附加组件使用真实系统提示和部署环境,增强测试真实性;与另一开源工具Bloom集成,实现更深入的行为评估。为确保独立性与公信力,Petri的开发已移交非营利组织Meridian Labs。


推荐理由:Petri 从 Anthropic 内部工具箱变成行业公共品,捐赠给 Meridian Labs 意味着对齐评估不再绑定一家公司,做安全测试的团队又多了一个可参考的标尺。
03:06
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
DeepSeek 4:适用于 Metal 的 Flash 本地推理引擎

DeepSeek 4 Flash 本地推理引擎正式发布,这是一个专为苹果 Metal 框架优化的开源项目。它允许开发者在配备 Apple Silicon 芯片的 Mac 上高效运行 DeepSeek 4 模型,实现本地离线推理。引擎通过 Metal Performance Shaders 显著提升了计算性能,降低了延迟与内存占用。该项目已在 GitHub 开源,并在 Hacker News 上获得了关注。


推荐理由:antirez 写的引擎让 DeepSeek 4 在 Mac 本地跑出近乎 Flash 的速度,而且代码极其精简,做本地推理的开发者应该立刻克隆下来跑一下。
01:29
Anthropic:Research(发表成果 · 网页)精选
AI 评分 81/100
自然语言自编码器:将Claude的"想法"解码为文本

Anthropic团队推出自然语言自编码器方法,能将大模型内部的激活值直接解码为可读文本。该方法通过训练“激活描述器”和“激活重建器”,形成“激活值→文本解释→重建激活值”的循环,并以重建相似度为目标进行优化。应用表明,NLA能揭示模型未言明的内部状态,例如在安全测试中,发现Claude内心意识到自己正被评估的比例远超其外部回应。团队已公开代码,并合作发布了交互式探索工具。


推荐理由:Anthropic 搞出了一种从激活中直接读出自然语言的方法,相当于给 Claude 的内心戏配了字幕。他们用这招发现模型在安全测试里比表面更常怀疑自己被评估,对审计隐藏动机也有奇效。做 AI 安全的人应该立刻点开看。
00:06
凡人小北@frxiaobei精选
AI 评分 81/100
新书《AI营销》配套提示词开源发布好东西,我的龙虾已经用上了✌️作者宣布,将新书《AI营销:从SEO到GEO》中配套的25个AI营销与GEO相关提示词开源至GitHub。此次更新还补充了部分短视频和文案相关的提示词,所有资源已在指定仓库公开,供用户下载使用或重新拉取。

姚金刚: 和 @vista8 讨论了下,决定将我们的新书《AI营销:从SEO到GEO》里配套的25个AI营销与GEO相关的提示词,也开源到GitHub 另外补充了部分短视频和文案相关的提示词,欢迎下载使用或重新拉取 1、提示词合集地址: https:...


推荐理由:不是又一个提示词合集,而是把《AI营销》书里的实操技巧拆成了现成指令,短视频和GEO部分尤其解渴,做内容营销的建议直接fork。

5月7日5月7日周四

星期四 · 2 条
02:01
Chubby♨️@kimmonismus精选
AI 评分 76/100
OrcaRouter-Lite 开源:自托管LLM路由工具,支持自动选择最低成本模型OrcaRouter-Lite just launched open source.MIT. BYOK. Self-hosted. Zero markup.The real unlock: model="auto" picks the cheapest capable model, with deterministic prompt caching across providers.Every LLM team has been hand-rolling some messy version of this for the last two years.Now it’s basically one base_url change.Your keys, cache and router ♥OrcaRouter-Lite 现已开源,这是一个采用MIT许可、可自托管的大型语言模型路由工具。它支持用户自带密钥,无需外部数据库,并能对接OpenAI、Anthropic、Google、Groq等多种服务提供商。其核心创新是model="auto"模式,可自动为每次请求选择成本最低且能力匹配的模型,并具备跨提供商的确定性提示缓存功能,使得重复的相同请求能在毫秒内以零成本返回。该项目旨在解决开发团队手动编写复杂模型选择逻辑的痛点,通过简单的Docker部署即可实现路由功能,托管版本将于本周稍晚推出。

OrcaRouter: Every product team has a 30-line file in their codebase called pick_model.py. Nine if/else branches. Three retry decorat...


推荐理由:每个 LLM 团队都在手搓那个叫 pick_model.py 的烂摊子,现在改个 base_url 就搞定了。BYOK 自托管零加价,设计干净到反常,值得所有做产品的开发者立刻尝试。

5月6日5月6日周三

星期三 · 2 条
10:20
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 76/100
OpenSeeker-v2:利用高信息量、高难度轨迹突破搜索智能体的极限

本研究提出了一种仅通过监督微调(SFT)训练前沿搜索智能体的高效方法。该方法基于三项关键数据合成改进:扩展知识图谱规模、增加工具集以及进行严格的低步数过滤。仅使用1.06万条数据训练的OpenSeeker-v2,在四个基准测试中均取得了领先性能,全面超越了采用复杂CPT+SFT+RL流程训练的同类模型。这是首个由纯学术团队仅通过SFT实现的、在同等模型规模与范式下的顶尖搜索智能体,其模型权重将开源以促进社区研究。


推荐理由:纯学术团队仅靠SFT和一万条数据,就在多个搜索基准上反超工业级管线,并且开源模型。这证明高质量数据比烧钱RL更关键,做Agent的朋友值得认真看。