精选归档 · 第 30 页

581600 条 · 共 709

4月16日4月16日周四

星期四 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 65/100
Ecom-RLVE:面向电子商务对话代理的自适应可验证环境

Ecom-RLVE 是一个为电子商务对话代理设计的自适应可验证环境。该环境支持智能体在模拟且可验证的电商场景中进行训练与评估,通过动态调整交互难度和规则约束来提升对话系统的鲁棒性与适应性。其核心在于结合强化学习与验证机制,确保智能体行为既符合商业逻辑又可追溯,为电商对话系统的开发与测试提供标准化、可复现的实验平台。


推荐理由:做电商对话 agent 的可以看看,这个 RL 环境把难控的多轮对话变成了可验证的 reward,还附带了从易到难的课程,开源可跑,是个扎实的工具。

4月15日4月15日周三

星期三 · 1 条
11:04
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
Nemotron 3 Super:面向智能体推理的开放高效Mamba-Transformer混合专家模型

Nemotron 3 Super是1200亿参数(120亿激活)的Mamba-Attention混合专家模型,首创NVFP4预训练,集成LatentMoE架构与MTP推测解码层优化推理。模型基于25万亿token预训练,经监督微调和强化学习后训练,支持100万token长上下文。相比GPT-OSS-120B和Qwen3.5-122B,推理吞吐量分别提升2.2倍和7.5倍,同时保持相当精度。全系列数据集与模型检查点已在HuggingFace开源。

另有 1 家信源报道X:AK (@_akhaliq)
推荐理由:NVIDIA 用 LatentMoE 和 Mamba 混合架构,把 120B 参数的推理吞吐做到 GPT-OSS 的 2.2 倍,且 agent 能力不输主流前沿模型,对低成本部署智能体是个强信号。

4月13日4月13日周一

星期一 · 3 条
08:00
Together AI 研究与产品博客(RSS)精选
AI 评分 62/100
Together AI 发布 EinsteinArena,AI 智能体协作刷新 11 项数学问题纪录

Together AI 发布 EinsteinArena,一个供 AI 智能体在开放问题(从数学起步)上互动、讨论与竞争的平台,包含实时 API、公开排行榜和验证器,已完全开源。


推荐理由:原文给出了平台机制与真实数学发现案例,读者可以据此了解多智能体协作如何推进开放问题的求解。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 77/100
RationalRewards:推理奖励在训练与测试时扩展视觉生成

研究团队发布8B参数奖励模型RationalRewards,基于PARROT框架从偏好数据恢复高质量推理依据,实现打分前生成多维度显式批评。该模型仅用同类基线1/10到1/20训练数据即达开源SOTA水平,性能比肩Gemini-2.5-Pro。其结构化推理奖励不仅为强化学习提供细粒度训练信号,更在测试时通过生成-批评-优化循环无需参数更新即可改进输出,在多个基准上匹敌甚至超越传统RL微调效果。


推荐理由:这篇论文把视觉生成的奖励模型从黑盒标量变成了带推理的结构化批评,而且发现测试时的生成-批评-改进循环能匹敌昂贵的RL微调,做图像生成和编辑的人应该认真读一下。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
ClawGUI:GUI Agent训练、评估与部署的统一开源框架

ClawGUI是面向GUI Agent的开源全栈框架,统一解决训练、评估与部署的基础设施瓶颈。ClawGUI-RL首创支持并行虚拟环境与真实设备的开源强化学习管道,集成GiGPO与过程奖励模型;ClawGUI-Eval在6项基准实现95.8%基线复现率;ClawGUI-Agent支持部署至Android、HarmonyOS、iOS及12个以上聊天平台。经该管道训练的ClawGUI-2B在MobileWorld GUI-Only任务达17.1%成功率,较同规模基线提升6.0%。


推荐理由:这是 GUI agent 方向久等的工程基座,第一次把在线 RL 训练、标准化评估和真实设备部署装进同一个开源框架,2B 模型就能跑赢大尺寸模型,做移动 agent 的团队可以直接上手复现。

4月10日4月10日周五

星期五 · 1 条
05:28
Nathan Lambert:Interconnects(RSS)精选
AI 评分 60/100
Claude 神话与对开放权重的误导性恐慌

针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。

另有 1 家信源报道Gary Marcus:The Road to AI We Can Trust(RSS)
推荐理由:Nathan Lambert 对 Claude Mythos 引发的反开放权重恐慌提出关键反驳,认为问题被简化为全面禁令,忽略时间滞后本身就是安全阀,观点冷静且值得政策讨论者细读。

4月9日4月9日周四

星期四 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 81/100
基于 Sentence Transformers 的多模态嵌入与重排序模型

Sentence Transformers 开源社区发布了支持多模态的嵌入与重排序模型。新模型能够同时处理文本和图像输入,生成统一的语义向量表示,并可通过交叉编码器实现细粒度相关性重排序。该版本显著扩展了原框架的纯文本能力,支持图像-文本检索、跨模态匹配等场景,所有代码与预训练模型均已开源,延续了其推动AI民主化的目标。


推荐理由:Sentence Transformers v5.4 把多模态嵌入和重排变成统一 API,跨模态 RAG 从试验品变成开箱即用,做多模态搜索的开发者可以直接上手复制。

4月8日4月8日周三

星期三 · 4 条
10:41
公众号:智谱(GLM)精选
AI 评分 62/100
GLM-5.1开源:一个独立工作8小时的模型

智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。

另有 2 家信源报道公众号:智谱(GLM)IT之家(RSS)
推荐理由:智谱把 GLM-5.1 开源,并且主打 8 小时独立工作,这个定位切中了 agent 场景下长任务执行的痛点,想做自动化流程的可以跑起来试试。
08:00
Hugging Face:Blog(RSS)精选
AI 评分 62/100
Safetensors 加入 PyTorch 基金会

Safetensors 安全张量格式原为 Hugging Face 项目,旨在解决模型权重存储的安全风险,现正式加入 PyTorch 基金会,移交至 Linux 基金会旗下,实现供应商中立治理。该格式因简单高效被广泛采用,成为 Hugging Face Hub 等平台默认模型分发方式,服务数万个模型。此次变更对用户无影响,格式、API 和集成保持不变。未来路线图包括设备感知加载与保存、张量并行和流水线并行的 API 支持,以及 FP8、GPTQ 等量化格式的正式集成。项目治理文档已公开,鼓励社区参与贡献。


推荐理由:Safetensors 从单厂项目转为社区治理,意味着模型格式的安全性和互操作性有了更中立的长期保证,这对依赖它的开发者是个积极的制度信号。
08:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 66/100
cuLA:用 CUDA 重写线性注意力

cuLA是一套面向GLA、KDA等线性注意力变体的高性能CUDA内核库。它通过手工优化的CuTe DSL与CUTLASS C++实现,深度适配NVIDIA Hopper和Blackwell等新一代GPU架构,旨在将复杂算法转化为可直接调用的高性能算子。其接口与flash-linear-attention保持一致,开发者仅需修改一行import即可低成本接入。性能测试显示,其内核在Blackwell和Hopper GPU上相比Triton基线实现,平均加速比最高达1.52倍。该项目已开源,并计划未来集成至FLA的统一调度机制中。


推荐理由:蚂蚁百灵把线性注意力的 CUDA 内核做成了开箱即用的库,性能超过 Triton 基线,对于做长上下文推理优化的团队挺实用,但受众面比较窄。

4月7日4月7日周二

星期二 · 1 条
08:00
Google Developers Blog(RSS)精选
AI 评分 67/100
TorchTPU:在谷歌规模上原生运行 PyTorch 于 TPU

TorchTPU 是一个新的工程栈,旨在让 PyTorch 工作负载以最小代码改动在谷歌 TPU 基础设施上获得原生高性能体验。它采用“Eager First”设计,提供多执行模式,并利用 XLA 编译器优化大规模集群的分布式训练。项目计划到 2026 年进一步降低编译开销,扩展对动态形状和自定义内核的支持,以确保下一代 AI 实现无缝扩展。


推荐理由:Google 终于把 PyTorch 和 TPU 拉平了,TorchTPU 用 eager 优先的设计解决了 XLA 编译的别扭感,对依赖 PyTorch 又想啃 TPU 算力的人是个实在利好。

4月4日4月4日周六

星期六 · 2 条
00:57
Nathan Lambert:Interconnects(RSS)精选
Gemma 4 与开放模型成功之道

Gemma 4 的发布揭示了开放模型成功的真正标准。文章指出,决定模型成败的关键并非基准测试分数(benchmark scores),而是其他因素。当前 AI 领域过度关注 leaderboard 排名,但高分数不等于实际应用价值与社区采用率。真正的成功取决于模型解决真实场景需求的能力、开发者友好度以及生态建设,而非单纯的技术指标领先。这一观点挑战了以 benchmark 为导向的行业评估范式。

另有 1 家信源报道X:Francois Chollet (@fchollet)
推荐理由:开源模型成败不只看榜单分数,Hugging Face 大佬揭秘真实胜负手

4月3日4月3日周五

星期五 · 5 条
16:39
karminski-牙医@karminski3精选
AI 评分 72/100
Gemma4有8个模型, 选哪个? 一文看懂!http://x.com/i/article/2039985553492598784Gemma4有8个模型, 选哪个? 一文看懂!Google 刚刚发布了 Gemma4 系列开放权重模型, 之前没接触过本地模型的朋友都在问我该用哪个本地部署, 来, 这篇文让你迅无痛掌握.首先啊, 选带"-it" 后缀的, 这个是指令微调版(Instruction Tuned) 的意思, 代表该模型经过了大规模的人类指令跟随训练和多轮对话对齐, 其他的都是基模, 是给自己要微调的同学准备的(所以举一反三, 你要是想自己微调, 就用不带-it的版本).A4B 我知道激活参数量是 4B, 那么 E4B 是啥意思? 简单来讲, 这是个专门为了移动端优化的技术——逐层嵌入(Per-Layer Embeddings), 它本身并不能省内存, 所以 Gemma-4-E2B 并不是它只需要2B参数量的内存, 它还是需要原始的5.1B的参数量的内存空间, 但是它的计算量只需要大概2B模型的计算量! (可以简单理解为把一部分矩阵运算优化为了查表, 然后用内存换计算了, 这部分表当然需要吃内存).好的, 我们的前置知识准备完毕了! 那么接下来直接说模型选型:本地龙虾优先选 Gemma-4-26B-A4B! 激活量4B的MoE, prefill速度也相当好, 特别适合龙虾这种系统提示词超级臃肿的场景.写代码/写脚本/要求精确工作选 Gemma-4-31B, 选这个肯定就是要最好的效果的, 如果实在是跑不动, 可以试试5bit量化. 给大家一个参考, Apple M2Ultra 如果运行 8bit, 理论速度也就 25token/s.我要一个本地语音助手! 选Gemma-4-E4B, 全模态输入, 你写代码让它接入有麦克风的摄像头, 剩下的场景就靠你的想象了. 并且4B激活即使CPU跑都能跑动.我只想跑一下试试装在我的树莓派里, 选 Gemma-4-E2B, 你能体验到极致的本地模型速度, 至于质量嘛, 会比电子鹦鹉好点, 他可以做类似"帮我检查文本里有英文吗"之类的过滤工作, 另外它是全模态输入的, 也可以尝试语音输入.#Gemma4 #google #GoogleGemma #本地大模型Google发布的Gemma4系列开放权重模型包含多个版本,选型需结合场景。带"-it"后缀为指令微调版,开箱即用;不带后缀为基座模型,供自行微调。其中,A4B指激活参数量为4B,E4B则采用逐层嵌入技术,以内存换取计算量,优化移动端性能。选型建议:综合性能与速度选26B-A4B;追求最佳代码或任务效果选31B;开发本地全模态应用选E4B;资源受限设备体验可选E2B,但输出质量有限。
推荐理由:Gemma 4 一口气出了 8 个变体,本地部署的人最怕选错模型白折腾,这篇把选型逻辑拆得明明白白,从龙虾助手到树莓派都有对应方案,抄作业就行。
01:09
Artificial Analysis@ArtificialAnlys精选
Google发布Gemma 4多模态开源模型系列Google has released Gemma 4, a new family of multimodal open-weight models including Gemma 4 E2B, Gemma 4 E4B, Gemma 4 31B and Gemma 4 26B A4B@GoogleDeepMind’s new Gemma 4 family introduces four multimodal models supporting text, image, and video inputs. We evaluated Gemma 4 31B (dense) and Gemma 4 26B A4B (MoE), both with a 256k context window, while the other two smaller models support up to 128k. With 31B and 26B parameters respectively, both evaluated models can run on a single H100.On GPQA Diamond, our scientific reasoning evaluation, Gemma 4 31B (Reasoning) scores 85.7%, the second highest result we have recorded for an open-weights model with fewer than 40B parameters, just behind Qwen3.5 27B (Reasoning, 85.8%). It reaches this score using only ~1.2M output tokens, fewer than Qwen3.5 27B (~1.5M) and Qwen3.5 35B A3B (~1.6M). Gemma 4 26B A4B (Reasoning) scores 79.2%, ahead of gpt-oss-120B (high, 76.2%) but behind Qwen3.5 9B (Reasoning, 80.6%).We are now running the Artificial Analysis Intelligence Index on all four Gemma 4 models and will share a full update once those results are complete.Google DeepMind推出Gemma 4系列四款多模态开源模型,支持文本、图像及视频输入。31B(密集架构)与26B A4B(MoE架构)拥有256k上下文窗口,可在单张H100运行;另两款较小模型支持128k上下文。GPQA Diamond测试中,Gemma 4 31B(Reasoning)获85.7%,仅次于Qwen3.5 27B,但输出token仅约1.2M,效率更优;26B A4B(Reasoning)得分79.2%,超越gpt-oss-120B。
另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:Jeff Dean (@JeffDean)
推荐理由:Google发布多模态开源模型Gemma 4,单卡H100可跑且科学推理能力突出

4月1日4月1日周三

星期三 · 1 条
23:03
Jim Fan@DrJimFan精选
CaP-X开源发布:大模型智能体进入物理世界The power of the Claw, in the palm of a robot hand. Agentic robotics is here! Today, we open-source CaP-X: vibe agents, alive in the physical world. They incarnate as robot arms and humanoids with a rich set of perception APIs, actuation APIs, and auto synthesize skill libraries as they go. CaP-X is a strict superset of our old stack, because policies like VLAs are “just” API calls as well. It solves many tasks zero-shot that a learned policy would struggle with.And we are doing much more than vibing. CaP-X is our most systematic, scientific study on agentic robotics so far:• We build a comprehensive agentic toolkit: perception (SAM3 segmentation, Molmo pointing, depth, point cloud), control (IK solvers, grasp planner, navigation), and visualization (EEF, mask overlays) that work across different robots. • CaP-Gym: LLM’s first Physical Exam! 187 manipulation tasks across RoboSuite, LIBERO-PRO, and BEHAVIOR. Tabletop, bimanual, mobile manipulation. Sim and real. Can’t wait to see the gradients flow from CaP-Gym to the next wave of frontier LLM releases. • CaP-Bench: we benchmark 12 frontier LLMs/VLMs (Gemini, GPT, Opus, Qwen, DeepSeek, Kimi, and more) across 8 evaluation tiers. We systematically vary API abstraction level, agentic harness, and visual grounding methods. Lots of insights in our paper. • CaP-Agent0: a training-free agentic harness that matches or exceeds human expert code on 4 out of 7 tasks without task-specific tuning. • CaP-RL: if you get a gym, you get RL ;). A 7B OSS model jumps from 20% to 72% success after only 50 training iterations. The synthesized programs transfer to real robots with minimal sim-to-real gap.3 years ago, our team created Voyager, one of the earliest agentic AI that plays and learns in Minecraft continuously. Its key ideas — skill libraries, self-reflection loops, and in-context planning — have since influenced many modern agentic designs.Today, the agent graduates from Minecraft and gets a real job. It’s April Fool’s, but this Claw is getting its hands dirty for real!Link in thread:CaP-X开源具身智能系统,让大模型智能体通过机械臂与人形机器人进入物理世界。系统整合SAM3、Molmo等感知API与IK求解器、抓取规划等控制接口,可自动合成技能库。研究发布CaP-Gym基准(187项操作任务)与CaP-Bench(评测12个前沿模型),提出零样本框架CaP-Agent0及强化学习方案CaP-RL,后者仅用50次迭代即将7B模型成功率从20%提升至72%。该技术由曾开发Minecraft智能体Voyager的团队推出。

推荐理由:NVIDIA Jim Fan 开源 CaP-X,让 Vibe Agent 真正进入物理世界操作机器人