精选归档 · 第 22 页

421440 条 · 共 721

5月23日5月23日周六

星期六 · 1 条
08:16
Hugging Face:Blog(RSS)精选
AI 评分 63/100
NVIDIA 发布 Nemotron-Labs Diffusion 系列模型,支持三种生成模式

NVIDIA 发布 Nemotron-Labs Diffusion 系列,含 3B、8B、14B 文本模型和 8B 视觉-语言模型(VLM),均采用商用友好的 NVIDIA Nemotron Open Model License 或 NVIDIA Source Code License。模型支持自回归、扩散(逐块并行生成后逐步精炼)和自推测(扩散草拟候选 token 再自回归验证)三种模式。8B 模型平均准确率比 Qwen3 8B 提升 1.2%,扩散模式每次前向传递的 token 数(TPF)达自回归的 2.6 倍,自推测达 6–6.4 倍。模型在 1.3T tokens 上预训练、45B tokens 上微调,代码与模型已发布于 HuggingFace 和 GitHub,推理将获 SGLang 支持。


推荐理由:自推测模式让文本生成速度飙到AR模型的4倍,而且输出质量无损。NVIDIA这次开源的不仅是个新模型,更是一套能直接用在现有流程里的加速方案。

5月22日5月22日周五

星期五 · 8 条
22:56
Rohan Paul@rohanpaul_ai精选
AI 评分 75/100
首个基于华为昇腾910B NPU全栈训练的1.58比特开源大模型BitCPM-CANN发布BitCPM-CANN just became the world’s first open-sourced 1.58-bit ternary LLM trained entirely on Chinese-developed AI infrastructure.Developed by ModelBest, Tsinghua Univ, and OpenBMB community, the entire training pipeline, from quantization operators and algorithms to the full-stack framework, was natively executed on Huawei Ascend 910B NPUs.1.58-bit ternary weights use only 3 weight states, so the model needs far less memory when deployed on phones, PCs, cars, and local industrial devices.The harder achievement is the training system behind it: QAT, STE, low-bit operators, algorithms, framework work, and reproducible training scripts all had to hold together on Ascend 910B.When hardware costs rise, the winning model is not merely the one that scores higher in a chart, but the one that can be trained, reproduced, deployed, and improved under real constraints.ModelBest、清华大学与OpenBMB社区联合发布了BitCPM-CANN,这是全球首个完全基于华为昇腾910B NPU训练的开源1.58比特三元大模型。其核心创新在于采用仅含三种权重状态的极低比特量化技术,使模型内存占用相比BF16降低约6倍,可高效部署于手机、电脑、车载设备等边缘端。更关键的是,整个训练全栈(从量化算子到框架)均在昇腾上原生构建与验证,而非简单移植。该模型家族(0.5B-8B)在多项基准测试上保持了全精度模型95-97%的性能,为资源受限环境下部署和复现大模型提供了可落地的解决方案。

OpenBMB: 🚀 BitCPM-CANN by ModelBest × @Tsinghua_Uni × OpenBMB is here — and it's not about stacking parameters. Memory costs are...


推荐理由:首个开源的1.58-bit三元LLM,直接在昇腾芯片上原生训练,内存压缩到BF16的六分之一,8B模型就能跑在手机上,做端侧部署的可以立刻上手试试了。
18:09
IT之家(RSS)精选
AI 评分 70/100
网易有道"子曰4"多模态模型、语音合成模型全量开源

网易有道宣布将其“子曰”大模型4.0的多模态模型与语音合成模型面向全球全量开源。其中,多模态模型(27B参数)专注于教育场景,在处理高难度视觉数理问题上达到行业顶尖水平,纯文本中文数理难题准确率为81.4%。该模型通过思维链优化,将输出长度压缩43.2%,有效降低了推理成本。同时开源的语音合成模型支持跨语种音色与情感迁移克隆,3秒内即可完成零样本复制,准确度超97%,并支持包括中、英、日、韩在内的14种语言。


推荐理由:有道把垂直教育的多模态模型全量开源,27B参数在视觉数理上做到SOTA,还把思维链压缩了43%,推理成本实打实下降,做教育应用的可以拿来做二次开发;TTS的跨语种情感克隆也实用,3秒克隆14种语言。
14:03
公众号:龙猫LongCat(美团)精选
AI 评分 88/100
LongCat-Video-Avatar 1.5 正式开源

美团正式开源 LongCat-Video-Avatar 1.5,在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现全面跃升。该模型采用 DMD 蒸馏将生成步骤压缩至 8 步,推理效率提升约 15 倍,生成 10 秒视频仅需约 1 分钟;Wav2Vec2 升级为 Whisper-large,并引入 GRPO 逐帧偏好对齐优化手部稳定性。


推荐理由:开源数字人模型首次在多人场景区分、长视频稳定性和推理效率上同时达到商业产品水平,评测透明度高。
10:09
IT之家(RSS)精选
AI 评分 73/100
智谱GLM-5.1高速版发布:刷新全球大模型API速度纪录

5月22日,智谱向部分企业客户推出了旗舰大模型GLM-5.1的高速版API“GLM-5.1-highspeed”。该版本输出速度达400 tokens/s,刷新了全球大模型API速度上限。关键突破在于,它首次在国产大模型中实现了旗舰级能力与低延迟的结合,打破了“高速模型即轻量模型”的传统。该版本由智谱GLM团队与TileRT团队合作,通过系统级优化确保了速度的生产级稳定性,适用于AI编程、实时语音交互等场景。

另有 1 家信源报道公众号:智谱(GLM)
推荐理由:智谱把旗舰模型拉到 400 tokens/s,还保持全尺寸能力,不是那种为快阉割的小模型。做实时交互、AI 编程的可以认真看看,延迟敏感场景的选型参数要重写了。
09:41
公众号:智谱(GLM)精选
AI 评分 64/100
GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度

智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。


推荐理由:在旗舰模型上实现400 tokens/s,打破了高速必为轻量模型的惯例,对编码智能体等实时交互场景提供了不牺牲能力的低延迟方案。
09:41
公众号:智谱(GLM)精选
AI 评分 63/100
智谱推出GLM-5.1高速版

智谱发布GLM-5.1高速版,推理速度达400 tokens/s,在顶尖模型中生成速度最快。

另有 1 家信源报道公众号:智谱(GLM)
推荐理由:智谱把GLM-5.1做到了400 tokens/s,虽然发布已半个月,但这是国产模型在推理速度上的新标杆,做实时应用的可以看看。
08:37
Google Gemini@GeminiApp精选
AI 评分 82/100
Gemini Omni发布,创意作品涌现Gemini Omni is here, and we’ve been seeing amazing creations all week. Here are some standouts 👇Gemini Omni来了,我们本周看到了许多令人惊叹的创作。以下是一些杰出作品 👇另有 14 家信源报道IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Google 的 GPT-4o 时刻终于来了,Gemini Omni 原生多模态的体验比想象中更惊艳,普通人也能随手出大片。

5月21日5月21日周四

星期四 · 4 条
21:40
Qwen@Alibaba_Qwen精选
AI 评分 82/100
Qwen3.7-Max:面向Agent时代的旗舰模型📣Meet Qwen3.7-Max — our latest flagship, made for the Agent Era.A versatile foundation for agents that actually get things done: 🧑💻 Coding agent, end to end. Frontend prototypes, multi-file refactors, real debugging — nails it. 🗂️ A reliable office and productivity assistant. Get your work done through MCP integrations and multi-agent orchestration. ⏱️ Long-horizon autonomy. 35 hours straight on a kernel optimization task — 1,000+ tool calls, zero hand-holding. 🔌 Scaffold-agnostic. Claude Code, OpenClaw, Qwen Code, or your own stack. Consistent reliability everywhere.API's up on Alibaba Model Studio. You can also take it for a spin on Qwen Studio.Go build something wild!🏃🏃♂️📖 Blog: https://qwen.ai/blog?id=qwen3.7 ✅ Qwen Studio: https://chat.qwen.ai/?models=qwen3.7-max ⚡️ API:https://modelstudio.console.alibabacloud.com/ap-southeast-1?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3.7-max&serviceSite=internationalQwen3.7-Max是Qwen系列面向Agent时代推出的最新旗舰模型,旨在为能完成实际任务的智能体提供强大基础。其核心能力包括:可作为端到端编码智能体,处理前端原型与多文件重构;作为可靠的办公助手,通过MCP集成与多智能体编排协同工作;并支持超长时间(超过35小时)的自主运行,执行复杂任务链。该模型兼容Claude Code、OpenClaw等主流开发框架,现已上线阿里云模型工作室与Qwen Studio提供服务。
另有 7 家信源报道公众号:通义实验室(千问)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:通义千问 / Qwen (@Alibaba_Qwen)X:Rohan Paul (@rohanpaul_ai)X:X.PIN (@thexpin)
推荐理由:Qwen 3.7-Max 的亮点不在榜上分数,而是它瞄准 Agent 场景的连贯执行能力,35 小时不间断跑 kernel 优化,对需要长线任务的开发者是直接可用的探索方向。
16:56
Tencent Hy@TencentHunyuan精选
AI 评分 74/100
腾讯开源Hy-MT2多语言翻译模型🚀 Introduce Hy-MT2: New Open-Source Multilingual Translation ModelWe proudly launch our new Hy-MT2 translation model and the Tencent Hy Translation mini-program!Hy-MT2 is a powerful multilingual model supporting seamless translation across 33 languages — and it's fully open-source!It's 7B and 30B-A3B models achieve state-of-the-art performance among all open-source models on various translation tasks, surpassing models with dozens of times more parameters.The lightweight 1.8B model even outperforms mainstream commercial APIs like Microsoft and so on. Powered by Tencent AngelSlim 1.25-bit extreme quantization, it needs just 440MB storage and enables effortless local inference on mainstream mobile chips — with 1.5x faster speed vs. Hy-MT1.5.Open-source AI translation just got way smarter, faster, and more accessible! 🌏Project Page: https://aistudio.tencent.com/llm/zh?tabIndex=0 Hugging Face: https://huggingface.co/collections/tencent/hy-mt2 Modelscope: https://modelscope.cn/collections/Tencent-Hunyuan/Hy-MT2 Github: https://github.com/Tencent-Hunyuan/Hy-MT2腾讯正式开源Hy-MT2多语言翻译模型,支持33种语言间的无缝互译。其7B与30B-A3B版本在开源模型中达到最先进的翻译性能,超越了许多参数规模大数十倍的模型。更具突破性的是,1.8B轻量级版本性能超越微软等主流商业API,并凭借腾讯AngelSlim 1.25-bit极量化技术,仅需440MB存储空间,即可在主流手机芯片上本地运行,推理速度较前代提升1.5倍,显著降低了高质量AI翻译的部署门槛。
另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)
推荐理由:虽然翻译领域不算最热,腾讯这个1.8B开源模型用1.25位量化直接跑在手机上,效果还超微软商业API,做本地化翻译工具的人值得关注。
04:17
Google DeepMind@GoogleDeepMind精选
AI 评分 84/100
Gemini 3.5 Flash 正式发布Gemini 3.5 Flash has landed.Gemini 3.5 Flash 已正式发布。
另有 14 家信源报道IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Google 在 Gemini 3.5 上继续扩展 Flash 线,这种轻量模型对成本和延迟敏感场景很关键,如果你在等一个便宜的 Gemini API,该看了。
00:44
Google Gemini@GeminiApp精选
AI 评分 74/100
Gemini 3.5 Flash快速整理混乱输入Gemini 3.5 Flash quickly delivers organized results, no matter how messy the input is.Watch Gemini take chats and texts with clients and turn them into usable documents for your small business.Gemini 3.5 Flash能快速提供整理好的结果,无论输入多么混乱。 看看Gemini如何将与客户的聊天和文本,转化为您小企业可用的文档。
另有 14 家信源报道IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Gemini 3.5 Flash 的核心不是刷榜,而是解决现实中‘信息像一堆垃圾’的问题,这种从杂乱输入直接生成文档的能力,对小企业和自由职业者比 SOTA 更有用。

5月20日5月20日周三

星期三 · 7 条
23:56
IT之家(RSS)精选
AI 评分 71/100
Stability AI 推出音频模型 Stability Audio 3.0,可生成最长 6 分钟专业级歌曲

Stability AI 推出 Stability Audio 3.0 音频生成模型家族,包含四款不同规格模型,参数从45900万到27亿。小型模型专注设备端运行,可本地生成两分钟以内的音频;中型和大型模型支持创作超过6分20秒的完整音乐,


推荐理由:Stability Audio 3.0 把AI音乐从几十秒的demo拉到了六分钟的完整歌曲,而且中小模型直接开源,任何一个能跑模型的设备都能玩,音乐创作的门槛继续被踩低。
18:46
SenseTime@SenseTime_AI精选
AI 评分 68/100
SenseNova U1:同时思考文本与图像的AITurn your ideas into visuals that spark stories 🧨将你的想法转化为激发故事的视觉画面 🧨 【引用 @Adamaestr0_】:大多数AI工具可以写作或生成图像。 但这个能同时做这两件事。 向你介绍 SenseNova U1。 一个能同时思考文本和图像的AI。 这改变了一切 🧵

Adam: La mayoría de las herramientas de IA pueden escribir o generar imágenes. Pero esta hace AMBAS cosas a la vez. Te present...

另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤发了 SenseNova U1,主打文本和图像同时生成的「全模态」,但宣传语太简略,没给任何性能数据或技术细节,暂时看不出是真突破还是常规迭代,先标记关注。
11:04
公众号:通义实验室(千问)精选
AI 评分 62/100
Qwen3.7-Max 重新定义 AI Agent 基座

通义实验室推出 Qwen3.7-Max,定位为重新定义 AI 智能体基座的模型,侧重提升智能体的基础能力与架构。

另有 7 家信源报道公众号:通义实验室(千问)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:通义千问 / Qwen (@Alibaba_Qwen)X:Rohan Paul (@rohanpaul_ai)X:X.PIN (@thexpin)
推荐理由:Qwen3.7-Max 是通义系列对 Agent 基座的一次关键升级,发布时间虽已过两周,但做 Agent 的开发者仍不能忽略,选型必看。
10:49
Qwen:Blog Retrieval(API)精选
AI 评分 79/100
Qwen3.7-Max:面向智能体时代的最新专有模型

通义千问发布 Qwen3.7-Max,专为智能体时代设计。它具备从原型到复杂多文件工程的编码智能体能力,通过 MCP 和多智能体编排实现办公自动化,能自主执行超 1000 步工具调用(如 35 小时全自主内核优化)。兼容 Claude Code、OpenClaw、Qwen Code 等多框架。在多项基准测试中超越 Opus-4.6 Max 等模型:Terminal Bench 2.0 (69.7)、SWE-Verified (80.4)、GPQA Diamond (92.4)、HLE (41.4) 等。现已通过阿里云 Model Studio 提供 API 调用。


推荐理由:Qwen3.7-Max 把 agent 能力拉到了新高度,35 小时自主内核优化证明长程执行有真实生产力,做 coding agent 的团队该认真测一下。
04:29
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 80/100
Gemini Omni

Google DeepMind 于 2026 年 5 月 19 日发布了新一代多模态大模型 Gemini Omni。该模型整合了文本、图像、音频与视频的理解与生成能力,旨在实现更自然的人机交互。在同期 Hacker News 讨论中获得 112 点赞,显示出技术社区对多模态融合趋势的持续关注。这标志着大模型从单模态向全模态感知与响应能力的进一步演进。

另有 14 家信源报道IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Gemini Omni 把视频编辑变成自然语言对话,多轮编辑和物理理解让它从玩具变成创作工具,做视频的值得一试。
02:18
Google Blog:AI(RSS)精选
AI 评分 83/100
Gemini 3.5:前沿智能与行动能力相结合

Google 在 I/O 大会上正式发布了最新的 Gemini 3.5 模型系列。该系列模型将前沿的人工智能能力与执行操作的功能相结合,旨在提供更强的综合性能。作为 Google 最新推出的模型,它代表了其在大模型技术上的最新进展。


推荐理由:Google 在 I/O 上甩出 Gemini 3.5,这次不只拼多模态,更强调‘行动’,是所有做 Agent 的团队必须对标的新基座。
02:18
Google Blog:AI(RSS)精选
AI 评分 89/100
I/O 2026: 欢迎来到自主的 Gemini 时代

Google 在 I/O 2026 大会上宣布 Gemini 进入自主代理时代,新功能使其能够自动执行复杂任务,显著提升用户工作效率。大会展示了 Gemini 如何通过代理操作简化工作流程,实现自动化处理,例如自动管理邮件、安排日程或生成报告,帮助用户从重复性工作中解放出来,专注于创造性任务。这一更新基于先进机器学习模型,强调准确性与效率,标志着 AI 助手向更智能、更自主的方向发展。


推荐理由:谷歌 I/O 大会上 Sundar Pichai 亲自宣布 agentic Gemini 时代到来,这是把 Gemini 从对话助手升级成真正能自主执行任务的 agent,所有做 AI 应用的接下来都得重新看一遍技术选型。