精选归档 · 第 3 页

4160 条 · 共 78

7月9日7月9日周四

星期四 · 2 条
21:16
IT之家(RSS)精选
AI 评分 71/100
法国对英伟达反垄断调查接近尾声,聚焦 CUDA 生态和产业投资

法国竞争管理局确认,对英伟达的反垄断调查已近尾声,即将发布正式异议声明。调查聚焦两大问题:市场对CUDA平台的严重依赖,以及英伟达对CoreWeave等AI云计算公司的投资。英伟达占全球AI加速器超70%份额。若认定滥用市场支配地位,最高可处全球年营业额10%罚款。法国是首个准备正式指控英伟达的监管机构。


推荐理由:法国快成为全球首个正式指控英伟达反垄断的监管机构,争议在CUDA生态紧耦合与芯片投资,这个案子能不能动摇AI芯片供应链,是所有人都该关心的节点信号。
16:57
MarkTechPost(RSS)精选
AI 评分 70/100
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍

NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。Hugging Face 提供 BF16、FP8、NVFP4 检查点。


推荐理由:把120B MoE压到75B后,同节点服务吞吐几乎翻倍,单张H100百万token并发从1涨到8。对长上下文RAG和AI编码助手这类对吞吐敏感的产品来说,这不是论文调优,是实打实的降本方案。

7月8日7月8日周三

星期三 · 1 条
10:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。


推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。

7月7日7月7日周二

星期二 · 1 条
21:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
统一音频智能模型 Nemotron-Labs-Audex-30B-A3B 发布

Nemotron-Labs-Audex-30B-A3B(Audex)是基于Nemotron-Cascade-2-30B-A3B的MoE大语言模型,采用单一Transformer解码器统一处理文本与量化音频token。训练使用157.4B音频token和320.5B文本token,经多阶段监督训练、文本Cascade RL和多域on-policy蒸馏优化。在音频理解、语音识别/翻译、文本转语音、音频生成及语音到语音生成任务上达SOTA,同时保持原文本LLM的推理、对齐等能力几乎无退化。模型权重已开源。


推荐理由:多模态LLM常捡芝麻丢西瓜,Audex难得做到音频全面增强而文本智能不退化。开源模型让语音产品人可以立刻评估,不是研究Demo。

7月4日7月4日周六

星期六 · 1 条
14:41
MarkTechPost(RSS)精选
AI 评分 70/100
NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分

NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出 ASPIRE,一个持续学习机器人框架。它通过协调器-执行器架构、闭环执行引擎、技能库和进化搜索,编写并优化机器人控制程序。编程智能体使用 Claude Code(Claude Opus 4.6,1M token 上下文窗口)。在 LIBERO-Pro 上最高比最强基线提升 77 分;Robosuite 双手交接成功率从 20% 提升至 92%;BEHAVIOR-1K 收音机拾取任务从 56% 提升至 88%。利用 LIBERO-90 积累的技能,ASPIRE 在零样本条件下对 LIBERO-Pro Long 任务达到约 31% 成功率,此前方法饱和在 4% 附近。


推荐理由:ASPIRE让机器人编程从单次尝试变成持续学习,把失败调试沉淀成可复用技能库,长任务零样本直接从4%拉到31%,这条思路比具体数字更有启发性。

7月3日7月3日周五

星期五 · 1 条
18:00
公众号:面壁智能(MiniCPM)精选
AI 评分 65/100
面壁智能发布AI全自动预训练框架ForgeTrain,8小时追平Megatron-LM

面壁智能发布全球首个完全由AI编写、无人类干预的生产级大模型预训练框架ForgeTrain。该框架针对特定模型和硬件从零自动“锻造”专用训练代码。基准测试显示,ForgeTrain在8小时内追平Megatron-LM,1.5至2天内实现稳定反超,模型FLOPS利用率提升约8%~10%,且可迁移至不同模型(MiniCPM4-0.5B/8B)和硬件(H100及昇腾NPU)。其采用四阶段Harness优化流程,全程自动判定。面壁智能将其工程思想概括为Forge Engineering。


推荐理由:这是AI编写生产级训练框架的首个实证,8小时追平Megatron-LM并反超,证明AI打穿Infra的范式已到临界点,做训练框架和Infra的都该看看。

7月1日7月1日周三

星期三 · 1 条
16:32
MarkTechPost(RSS)精选
AI 评分 73/100
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型

NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。


推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。

6月29日6月29日周一

星期一 · 1 条
01:26
Nathan Lambert:Interconnects(RSS)精选
AI 评分 60/100
Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度

开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。


推荐理由:这篇文章把开源模型玩家拆成三类,清晰解释了不同动机,Cohere 转向 Apache 2.0 和 NVIDIA 采用 OpenMDW 是许可层面的重要信号,关注开源的值得一读。

6月25日6月25日周四

星期四 · 1 条
00:15
Hugging Face:Blog(RSS)精选
AI 评分 66/100
NVIDIA NeMo AutoModel:一行代码加速Transformer MoE模型微调

NVIDIA NeMo AutoModel 是基于 Transformers v5 的开源库,添加 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核。在 MoE 模型微调中,相比原生 v5,训练吞吐量提升 3.4–3.7 倍,GPU 内存减少 29–32%,仅需改动一行 import。在 16 节点 128 张 H100 上全微调 Nemotron 3 Ultra 550B A55B 时,v5 因内存不足无法运行,而 AutoModel 凭借 EP=64 专家并行使训练可行。单节点 30B MoE 模型(如 Qwen3-30B-A3B)同样获得可量化的性能优势。


推荐理由:英伟达的 NeMo AutoModel 把 MoE 模型微调速度提高了三倍多,内存省了近三分之一,代码只需改一行 import,做训练的可以立刻升级。

6月20日6月20日周六

星期六 · 1 条
06:54
MarkTechPost(RSS)精选
AI 评分 77/100
NVIDIA Research 发布 SpatialClaw:免训练空间推理框架

NVIDIA Research 发布 SpatialClaw,一个免训练的空间推理框架。它通过将代码作为动作接口,让智能体调用感知工具(Depth Anything 3、SAM 3)并自由组合输出,解决视觉语言模型在 3D 空间判断上的弱点。在 20 项基准测试中平均准确率达 59.9%,比近期智能体 SpaceTools 高 11.2 个百分点,比无工具基线高 6.5 点,比结构化工具调用高 3.2 点。框架无需重新训练,同一提示词和工具集可跨所有基准和骨干网络运行,支持 Qwen3.5/3.6 及 Gemma4 等 26B 至 397B 参数的模型。


推荐理由:NVIDIA 把空间推理的动作接口从工具调用换成代码,这个思路很巧,20 个基准平均拉升到 59.9%,无训练即插即用,做机器人和视频理解的人该直接跑一下 repo。

6月18日6月18日周四

星期四 · 1 条
00:35
Jim Fan@DrJimFan精选
AI 评分 81/100
NVIDIA GEAR实验室发布ENPIRE:8个Codex智能体自主控制机器人完成物理实验I made Physical AutoResearch sound simple (conceptually), but it took a village to pull off and lots of design thinking into the robot /loopcraft. The hardest part is everything we need to setup *before* pressing Enter. Here's a behind-the-scene tour:1. Safety harnessLetting 8 robots run unattended overnight means safety has to be more than a hint in the system prompt. ENPIRE hardwires it in 2 layers: (1) hard kinematic limit that trips an immediate task failure and auto-resets as soon as a robot leaves its safety envelope, and (2) a torque-limited compliant gripper so a bad contact or misaligned insertion ends in a safe stall, instead of crushing the robot or the object at hand.We make safety more conservative than usual so humans can sleep tight. In reality, we still need a few human operators to watch over the "robots of loving grace".2. Definition of /doneAn agent that can edit its own reward will game it for sure. ENPIRE fixes the goalposts before the fleet can move them. Here's the recipe:Collect a few minutes of success & failure demos -> Ask agent to write code using computer vision tools to classify success and measure against groundtruth -> Agent hill-climbs on classifier until reliably good -> This classifier becomes the real-time reward function that directly computes on sensor streams -> *Freeze* the reward function before AutoResearch. It's sacred, enshrined in a Gym env that no one can touch.3. System telemetry designRobot-seconds is by far the scarcest resource, followed by GPU-seconds, and finally tokens. We instrument all three and surface them to ENPIRE for live resource awareness rather than letting it hill-climb in a vacuum.We define: • Mean Robot Utilization ("MRU"): the fraction of wall-clock time when the robot is actively executing an experiment. Otherwise the hardware is sitting idle and waiting for the next code commit. • Mean Token Utilization ("MTU"): tokens consumed per minute, our proxy for how hard the agent is actually thinking. A low MTU means the agent is stalled, waiting on a robot rollout to finish instead of doing research. • GPU utilization: fraction of wall-clock time when GPU is active.... and evaluate on two budget-to-outcome metrics:1. Tokens-to-Success: token budget the fleet burns to complete /goal. 2. Time-to-Success: wall-clock time to /goalNVIDIA GEAR实验室推出ENPIRE系统,首次实现物理世界自主研究。系统让8个Codex智能体控制8台机器人,配备GPU和token预算。安全方面采用硬运动极限切断和扭矩受限夹爪两层硬件保障,支持通宵无人运行。奖励函数通过视觉分类器离线固定并冻结,防止智能体作弊。实时监测机器人利用率(MRU)、token利用率(MTU)和GPU利用率,以Tokens-to-Success和Time-to-Success评估效率。ENPIRE自主完成扎带、整理细针、安装GPU等高精度任务,发现8机器人并行探索显著更快。系统将开源。

Jim Fan: 今天,我们首次在物理世界中实现了 AutoResearch!隆重推出 ENPIRE:我们为 8 个 Codex 智能体配备了一支机器人舰队、一批 GPU 分配以及充足的模型 token 预算。我们给它们设定了一个简单的目标,然后放手让它们去...


推荐理由:Jim Fan团队让8个机器人在真实世界自主研究,从安装GPU到发现物理扩展定律,这是具身智能第一次真正脱离人类监督探索物理任务,比任何虚拟环境的Agent实验都更接近AGI的物理锚点,做机器人的必须关注。

6月17日6月17日周三

星期三 · 1 条
00:52
Jim Fan@DrJimFan精选
AI 评分 64/100
NVIDIA GEAR 实验室推出 ENPIRE:首次在物理世界启用 AutoResearchToday, we enable AutoResearch in the physical world for the first time! Introducing ENPIRE: we give 8 Codex agents a fleet of robots, an allocation of GPUs, and generous token budget. We set them free with a simple goal: solve the task as quickly as possible, keep the robots busy but stay safe, don't waste precious compute. Make no mistake.Then humans step aside and our watch begins. The robot fleet starts to come alive: they learn to look for visual clues, reset the scene, practice novel skills, tinker with control stack, read papers online, debate, reflect, get stuck, and try again directly on the hardware. All we did is to give Codex an API to the world of atoms, and the rest is emergence.ENPIRE is able to solve high-precision tasks like tying zip-ties, organizing fine pins, and installing GPUs all by itself. We also discovered a new type of "physical scaling": 8 robots exploring in parallel improves significantly faster than fewer ones.A part of our NVIDIA GEAR lab now self-improves tirelessly over night. We just read the reports in the morning./goal: we all take a holiday and Jensen wouldn't even notice ;)We will be open-sourcing everything, so you can host your self-running robot lab at home too! Deep dive in the thread:NVIDIA GEAR 实验室首次在物理世界启用 AutoResearch,推出 ENPIRE 项目。给 8 个 Codex 智能体分配机器人舰队、GPU 和 token 预算,目标快速安全完成任务。人类退出后,机器人舰队自主学会寻找视觉线索、重置场景、练习新技能、调整控制栈、阅读论文、辩论反思。ENPIRE 能高精度完成扎带、整理细针、安装 GPU 等任务。发现物理扩展:8 机器人并行探索比少机器人效率显著提升。实验室部分可整夜自我改进,早上读取报告。所有内容将开源。

推荐理由:ENPIRE把自动研究从代码带到真实世界,8台机器人并行学习的效果提升是个意外惊喜,做具身智能的团队值得紧盯他们的开源进展。

6月16日6月16日周二

星期二 · 1 条
00:13
The Decoder:AI News(RSS)精选
AI 评分 72/100
Nvidia 加入 AI 债务热潮,发行 200 亿美元债券

Nvidia 计划通过自 2021 年以来的首次债券发行筹集至少 200 亿美元,消息援引知情人士透露。此举标志着 Nvidia 加入 AI 领域的债务融资热潮。


推荐理由:Nvidia发债200亿美元加入AI债务潮,这是自2021年来的首次,显示AI基建的烧钱速度在加速,属于行业层面的重要信号,但对开发者日常无直接影响。

6月9日6月9日周二

星期二 · 1 条
16:42
MarkTechPost(RSS)精选
AI 评分 70/100
NVIDIA cuTile Python 教程:在 Colab 中构建用于向量加法、矩阵加法和矩阵乘法的 Tiled GPU 内核

该教程基于 NVIDIA cuTile Python 实现了分块 GPU 内核编程工作流,在 Colab 环境中配置 GPU、驱动、CUDA 及 cuTile 可用性后,分别构建了 tiled 向量加法、矩阵加法和矩阵乘法核函数,并以 PyTorch 作为回退保持 notebook 可执行。每一步均通过 PyTorch 验证结果正确性,并基准测试了各阶段的中位运行时间。


推荐理由:NVIDIA cuTile把GPU tiled kernel编程的门槛拉低到Python,这个Colab教程从环境搭建到矩阵乘法全链路,想自己写算子的人可以跟着跑一遍。

6月5日6月5日周五

星期五 · 1 条
03:43
Hugging Face:Blog(RSS)精选
AI 评分 78/100
Nemotron 3.5 Content Safety:面向全球企业AI的可定制多模态安全

Nemotron 3.5 Content Safety基于Gemma 3 4B IT,提供128K上下文窗口,支持用户提示、可选图像与助手响应的统一多模态安全评估。新增自定义策略执行,允许企业用自然语言定义专属安全规则;THINK模式可输出可审计的逐步推理痕迹。显式训练覆盖12种语言,并借助基座模型零样本泛化至约140种语言。输出提供低延迟二分类、带分类标签、THINK推理痕迹三种模式。安全分类遵循Aegis 2.0框架(13核心类别+10细分类别)。同步发布多模态、多语言安全数据集,可在8GB+ VRAM GPU上实时部署。


推荐理由:Nemotron 3.5 把内容安全从「单模态英文」拉到「多语言多模态可定制」,自定义策略和推理 trace 让企业能审计决策,做安全平台的值得细看。

6月4日6月4日周四

星期四 · 3 条
21:42
Hugging Face:Blog(RSS)精选
AI 评分 75/100
Nemotron 3.5 ASR:为你的语言、领域或口音进行微调

Nemotron 3.5 ASR 是一个 600M 参数的多语言流式语音识别模型,单个检查点覆盖 40 种语言-地区(含英、西、德、法、意、日、韩、中、阿拉伯等)。采用 Cache-Aware FastConformer 编码器与 RNNT 解码器,缓存内部状态避免重复计算,实现低延迟流式转录且不损失精度。模型原生输出带标点和大写的生产级文本,无需后处理。支持指定语言(target_lang=es-ES)或自动语言检测(target_lang=auto)。通过注意力上下文大小(att_context_size)可在推理时直接调节延迟-准确率权衡,范围从 80ms 到 1.12s,无需重新训练。模型以 NeMo 检查点形式发布,可用于微调以适配特定语言、领域或口音。


推荐理由:一个模型搞定40种语言的实时语音转文字,NVIDIA还给了完整微调代码和实测数据,做语音Agent和字幕的可以照着抄作业。
19:42
Hugging Face:Blog(RSS)精选
AI 评分 68/100
Nemotron 预训练的任务种子合成问答生成

在 Nemotron-3 Nano 模型的 100B token 续训练实验中,任务种子合成数据生成(Task-Seeded SDG)使 MMLU-Pro 提升 1.8 分,平均代码提升 1.9 分,常识理解提升 1.6 分,GPQA 提升 11.1 分,数学成绩保持稳定。该流程利用 lm-eval-harness 中约 70 个公开任务(约 700 子任务)的训练集作为种子,生成新示例并补充推理和上下文,经过格式校验、去重和答案验证后得到精选合成数据集,用于 Nemotron Ultra 和 Super 训练。


推荐理由:NVIDIA 公开了 Nemotron 训练中造合成数据的详细方法论,用 70 个公开任务训练集做种子生成新题目,100B token 实验把 GPQA 拉高 11 个点,做预训练的人值得看看他们怎么造的数据。
08:00
vLLM 官方博客(RSS)精选
AI 评分 61/100
NVIDIA 发布开源推理模型 Nemotron 3 Ultra,vLLM 提供 Day-0 支持

NVIDIA 发布开源模型 Nemotron 3 Ultra,采用 Hybrid Transformer-Mamba MoE 架构,总参数 550B、激活 55B,上下文最长 1M token,主打长时程自主智能体工作流,vLLM 提供 Day-0 支持。


推荐理由:原文给出架构细节、部署配置和与 GLM 5.1、Kimi K2.6、Qwen3.5 的基准对比,读者可据此评估其在长时程智能体工作流中的适用性。