精选归档 · 第 6 页

101120 条 · 共 721

8月11日8月11日周二

星期二 · 3 条
17:21
公众号:蚂蚁百灵(Ling)精选
AI 评分 72/100
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。


推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。
04:46
Artificial Analysis@ArtificialAnlys精选
AI 评分 78/100
Meta 开源 Muse Glimmer,Apache 2.0 首秀Meta returns to open weights: Muse Glimmer, its first open-weights release since Llama 4, scores 35 on the Artificial Analysis Intelligence Index. It is a 30B-parameter model, and the first from Meta to be released under Apache 2.0Muse Glimmer (high) arrives 16 months after Llama 4, scoring 21 points above Llama 4 Maverick (14), Meta's last open weights release. It sits alongside Kimi K2.5 (Reasoning, 36) and just behind Qwen3.6 27B (Reasoning, 38) and Ling 3.0 Flash (38), and creates a two-tier Meta lineup together with the proprietary flagship Muse Spark 1.2 (xhigh, 57)@AIatMeta shared access with us ahead of public release for benchmarking. Congratulations to @AIatMeta, @finkd, and @alexandr_wang on the release!Key Takeaways:➤ Meta's open-weights line is back, under its most permissive license yet. Every prior Meta open release shipped under a Llama License; Muse Glimmer uses Apache 2.0, placing almost no restrictions on commercial use or derivatives➤ Strong intelligence for its parameter count. At 30B parameters, Muse Glimmer scores 5 points above Gemma 4 31B (Reasoning, 30) at the same size, and effectively matches 1T total parameter Kimi K2.5 (Reasoning, 36) with 33x fewer parameters. Qwen3.6 27B (Reasoning, 38) remains ahead on the Intelligence vs Parameters frontier at a slightly smaller size➤ Small enough to self-host on a single GPU, even at full context. Muse Glimmer is a 30B dense model (including a ~1.8B vision encoder) with weights at ~60 GB in BF16 and ~18 GB in 4-bit. It features a hybrid-attention mechanism with three sliding-window layers for every global layer, which holds KV cache memory use to ~1.8 GB (minimum) at its pre-extension 128K context. This means the model can run at full context on a single H100 at BF16 precision, or on a higher-spec MacBook or RTX 5090 at 4-bit, with more breathing room if the vision encoder is not required➤ Agentic knowledge work is its weakness relative to its size class. Muse Glimmer scores 953 Elo on GDPval-AA v2, below the 1,000 human baseline and behind other models at its intelligence level, including the similarly sized Qwen3.6 27B (Reasoning, 1141), and Gemini 3.5 Flash-Lite (1141). Knowledge calibration follows the same pattern: its AA-Omniscience Index of -33 is low for its intelligence level, driven by an 82% hallucination rate (Qwen3.6 27B: 49%) rather than accuracy, where it matches its peers. Agentic tool use is the exception, with Muse Glimmer scoring 24% on Tau3-Banking, ahead of Gemini 3.5 Flash-Lite (18%) and Qwen3.6 27B (17%), among the best in its classOther model details:➤ Parameters: 30B Dense ➤ Context window: 128K tokens, plus extension ➤ License: Apache 2.0 ➤ Openness Index: 44, indicating relatively high openness/transparency vs. other major open-weights models ➤ Pricing and output speed: at the time of release, Meta is not serving the model on their API; pricing and serving speed are TBC depending on third-party providersMeta 发布开源模型 Muse Glimmer,这是其自 Llama 4 以来首个开源权重模型,30B 参数,在 Artificial Analysis 智能指数上得分 35,也是 Meta 首个采用 Apache 2.0 许可的模型。

推荐理由:Apache 2.0 许可和单 GPU 可运行的设计,使团队能在自有硬件上运行与更大模型接近的性能,部署成本与合规风险同时下降。
02:37
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 55/100
OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型

OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具。


推荐理由:GPT-5.6-Cyber 将大模型能力引入授权的漏洞研究与验证流程,安全团队可借助模型自动化分析,缩短从漏洞发现到修复的窗口。

8月10日8月10日周一

星期一 · 6 条
19:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。


推荐理由:SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。
18:30
Unsloth AI@UnslothAI精选
AI 评分 72/100
Meta 开源 30B 模型 Muse Glimmer,18GB 内存即可本地运行Meta releases Muse Glimmer, a new 30B open model that runs on 18GB RAM.Muse Glimmer is Apache 2.0 licensed, supports vision and is the strongest agentic model for its size.Run and train the model via Unsloth. GGUF: https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF Guide: https://unsloth.ai/docs/models/muse-glimmerMeta 开源 30B 参数密集模型 Muse Glimmer,Apache 2.0 许可,支持视觉,可在 18GB RAM/VRAM 环境本地运行,定位于本地智能体与编码工作流。

Mark Zuckerberg: 今天我们还开放了 Muse Glimmer 的权重,这是一个出色的 30B 参数稠密模型,可以在本地运行。很快我们还将发布 Muse Spark 1.2 的权重,这是我们最新的基础模型。Meta 是开源的有力支持者,我为这些发布感到自豪。祝...


推荐理由:Meta 开源 30B 密集视觉模型,18GB 内存可本地运行,作者还提供了 GGUF 和运行训练指南,方便直接上手。
08:14
MarkTechPost(RSS)精选
AI 评分 75/100
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。


推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。
00:00
Fireworks AI(网页)精选
AI 评分 69/100
Meta Muse Glimmer 30B 上线 Fireworks,面向常驻 Agent 场景

Meta 的 Muse Glimmer 30B 稠密模型已在 Fireworks 上提供 serverless 和按需部署,主打多轮工具调用与失败恢复等常驻 Agent 场景。


推荐理由:原文给出了架构细节、Agent 基准对比和推荐运行配置,读者可以据此评估这款 30B 开源模型是否适合自己的多轮工具调用工作流。

8月9日8月9日周日

星期日 · 1 条
20:32
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 60/100
inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。


推荐理由:该模型把投机解码的接受长度按工作负载分开报告,数学与代码任务明显高于对话类,部署时可据此对不同场景的加速收益有更实际预期。

8月7日8月7日周五

星期五 · 2 条
15:10
IT之家(RSS)精选
AI 评分 71/100
谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时

谷歌 DeepMind 联合多家机构推出 WeatherNext Cyclones 气旋预测模型,在路径、强度和风场结构预测精度上达到业界领先。该模型将有效预报时长从 2 天延长至 3 天,平均提前 24 小时,预测量级约相当于 10 年气象进展。


推荐理由:将气旋预报时效提前24小时并开源全套模型权重,气象机构可据此提升预警窗口,影响紧急预案规划。
01:11
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 53/100
ChatGPT 推出改进版 GPT-5.6 Sol,并扩大免费用户访问权限

ChatGPT 推出改进版 GPT-5.6 Sol,提升准确性与一致性,同时扩大免费用户访问权限。免费用户还可无限次使用 GPT-5.6 Luna 进行日常对话。


推荐理由:这次更新把 Sol 的准确度和一致性提升后开放给免费用户,同时 Luna 的无限日常聊天让非付费用户也能稳定使用基础能力,减少了因模型切换造成的体验落差。

8月6日8月6日周四

星期四 · 1 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。


推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。

8月5日8月5日周三

星期三 · 5 条
16:35
MarkTechPost(RSS)精选
AI 评分 79/100
NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。


推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。


推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
11:08
Qwen@Alibaba_Qwen精选
AI 评分 68/100
Qwen-Image-3.0-Pro 上线 Qwen CloudQwen-Image-3.0-Pro is live on Qwen Cloud now! Try it out👇 https://www.qwencloud.com/models/qwen-image-3.0-pro?utm_content=g_20000001188阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

Qwen Cloud: 🔔 Qwen-Image-3.0 现已上线通义千问云! 在 Arena 的 Text-to-Image Arena 中,位列中国模型第一、主流模型第二,现在只需一次 API 调用即可使用。 - 支持最长 4.5k token 的提示词:报...


推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。

8月4日8月4日周二

星期二 · 2 条
23:12
NVIDIA Blog(RSS)精选
AI 评分 68/100
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。


推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
23:04
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。


推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。