Topic · 主题全部主题 →

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

3,734条收录
407条精选

精选归档 · 第 11 页

201220 条 · 共 407

6月5日6月5日周五

星期五 · 2 条
03:43
Hugging Face:Blog(RSS)精选
AI 评分 78/100
Nemotron 3.5 Content Safety:面向全球企业AI的可定制多模态安全

Nemotron 3.5 Content Safety基于Gemma 3 4B IT,提供128K上下文窗口,支持用户提示、可选图像与助手响应的统一多模态安全评估。新增自定义策略执行,允许企业用自然语言定义专属安全规则;THINK模式可输出可审计的逐步推理痕迹。显式训练覆盖12种语言,并借助基座模型零样本泛化至约140种语言。输出提供低延迟二分类、带分类标签、THINK推理痕迹三种模式。安全分类遵循Aegis 2.0框架(13核心类别+10细分类别)。同步发布多模态、多语言安全数据集,可在8GB+ VRAM GPU上实时部署。


推荐理由:Nemotron 3.5 把内容安全从「单模态英文」拉到「多语言多模态可定制」,自定义策略和推理 trace 让企业能审计决策,做安全平台的值得细看。
02:54
Google AI Developers@googleaidevs精选
AI 评分 70/100
Google Magenta RealTime 2 (MRT2) 实时音乐模型发布Play our new open-weights music model, @GoogleMagenta RealTime 2, using a MIDI keyboard, live text prompts, and even hand gestures ✌️ https://x.com/GoogleMagenta/status/2062589313372594538Google AI for Developers 宣布推出开放权重的实时音乐模型 Magenta RealTime 2 (MRT2)。该模型可通过 MIDI 键盘、实时文本提示甚至手势进行演奏。MRT2 在 MacBook 上原生运行,延迟低于 200ms,提供开放权重、开源推理引擎以及配套应用和插件套件。

Google Magenta Project: Introducing Magenta RealTime 2 (MRT2): the live music model you can play as an instrument. MRT2 offers MIDI and prompt c...

另有 1 家信源报道IT之家(RSS)
推荐理由:Magenta RealTime 2 把音乐生成从「后期制作」拉到了「实时演奏」,开放权重且延迟低于 200ms,音乐创作者值得立刻上手试试。

6月4日6月4日周四

星期四 · 9 条
11:42
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
MapAgent:面向城市级车道级地图生成的工业级智能体框架

MapAgent是一种工业级智能体架构,用于生成符合规范的车道级地图。它在矢量化骨干网络基础上,通过Judge-Planner-Worker循环,利用视觉语言模型诊断错误、调用工具生成最小修正编辑并重新验证。系统仅在骨干网络置信度低的瓦片区域选择性触发,保持高吞吐量。MapAgent已集成至百度地图,支撑全国360多个城市的车道级地图生成,整体生产自动化率超95%。


推荐理由:百度地图团队把Agent验证循环接入车道级地图生成,360+城市落地且自动化率超95%,复杂路口和长尾场景提升明显,做自动驾驶和在线地图的可以直接看结论。
09:36
Elon Musk@elonmusk精选
AI 评分 71/100
Grok 登陆 Cloudflare AI GatewayGrok on CloudflarexAI 与 Cloudflare 合作,将 Grok 的 LLM、音频、图像和视频模型接入 Cloudflare AI Gateway,用户可直接通过 Cloudflare 计费,无需额外认证或 API 密钥。Elon Musk 发推称 "Grok on Cloudflare"。

Cloudflare Developers: We're partnering with @xai to bring Grok to @Cloudflare AI Gateway. • Grok LLMs, audio, image, and video models are now ...

另有 1 家信源报道X:SpaceXAI (@SpaceXAI)
推荐理由:开发者现在可以在Cloudflare上零配置调用Grok全家桶了,从LLM到视频生成,对已经用Cloudflare生态的人来说,这比单独接入xAI API省事太多。
09:28
xAI:News(网页)精选
AI 评分 75/100
xAI 发布 Grok Imagine 1.5 预览版(图像转视频模型)

xAI 通过 API 发布了图像转视频模型 grok-imagine-video-1.5-preview(Grok Imagine 1.5 预览版)。该模型能将单张静态图片转为流畅的电影感视频,用户提供起始帧和描述运动的提示词后,模型可生成包含相机移动、氛围和物理效果的动画,并保持对源图像的忠实。支持生成 720p 片段,可使用自然语言指令控制镜头、节奏和音效,并支持逐帧拼接成长场景。模型目前通过 xAI API 提供预览使用。

另有 2 家信源报道X:cb_doge (@cb_doge)X:Elon Musk (@elonmusk, xAI)
推荐理由:xAI的新视频模型从单张图像生成电影级短片,支持自然语言控制运镜和氛围,对视频创作者和开发者是个值得一试的工具。
09:06
Elon Musk@elonmusk精选
AI 评分 73/100
Grok Imagine 1.5制作《伊利亚特》预告片Iliad (Troy) trailer made by Grok Imagine 1.5, which was just released伊利亚特(特洛伊)预告片由刚刚发布的 Grok Imagine 1.5 制作
另有 2 家信源报道X:cb_doge (@cb_doge)X:Elon Musk (@elonmusk, xAI)
推荐理由:Elon 亲自演示 Grok Imagine 1.5,生成的《伊利亚特》预告片质感让我觉得视频生成赛道又要卷一轮,做短片的可以盯一下。
01:38
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
Gemma 4 12B:一种统一的、无需编码器的多模态模型

Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。

另有 6 家信源报道X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)Google Developers Blog(RSS)X:Demis Hassabis (@demishassabis)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)
推荐理由:我觉得Gemma 4 12B最大的变化不是参数大小,而是第一次在开源模型里把多模态直接交给LLM主干处理,没有单独的视觉编码器,这意味着本地多模态应用的延迟和内存占用都会大幅下降,对于在笔记本上做Agent的开发者,这是一个必试的版本。
00:07
Google Developers Blog(RSS)精选
AI 评分 78/100
Gemma 4 12B:开发者指南

Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

另有 6 家信源报道X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)Google Developers Blog(RSS)X:Demis Hassabis (@demishassabis)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)
推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

6月3日6月3日周三

星期三 · 6 条
12:42
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
世界模型与语言模型:论具体推理与抽象推理的互补性

本研究探讨了世界模型与多模态大语言模型在预测未来状态时的互补性。世界模型可生成具体的视觉未来轨迹,但可能视觉合理却任务错误;多模态大语言模型则擅长抽象推理。为此,研究提出了“受控的具体推理”框架,并构建了VRQABench和OpenWorldQA两个基准。同时,提出了Privileged-Future On-Policy Self-Distillation(PF-OPSD)方法,该方法在训练时利用真实未来视频作为特权上下文评估推理轨迹,但部署时无需真实未来。实验结果显示,PF-OPSD在两个基准上分别比基线高出10.6%和10.9%,并提升了对噪声或冲突轨迹的鲁棒性。


推荐理由:世界模型靠视觉预测,语言模型靠抽象推理,这篇把两者真正拧在一起了。用未来视频做自我蒸馏提升 10%,还给全开源,做 agent 决策的可以认真看看‘什么时候不信自己的眼睛’是怎么训出来的。
06:25
MiniMax (official)@MiniMax_AI精选
AI 评分 80/100
MiniMax-M3 多模态模型发布,开源权重新SOTAMiniMax-M3 #6 overall on @ValsAIthe new open-weight SOTA 🚀MiniMax-M3 在 @ValsAI 排名中位列第六 新的开源权重 SOTA 🚀

Vals AI: MiniMax just released MiniMax-M3, their first multimodal model. It is the new open-weight SOTA on the Vals Index and the...

另有 8 家信源报道公众号:MiniMax(稀宇科技)X:OpenRouter (@OpenRouter)IT之家(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:karminski (@karminski3)X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)
推荐理由:MiniMax 闷声干大事,第一个多模态模型就拿下 open-weight SOTA 和总榜第 6,做多模态应用的可以蹲一下权重。
00:00
Google DeepMind:Blog(RSS)精选
AI 评分 80/100
Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。

另有 6 家信源报道X:Google AI for Developers (@googleaidevs)X:Jeff Dean (@JeffDean)Google Developers Blog(RSS)X:Demis Hassabis (@demishassabis)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)
推荐理由:统一无编码器架构让 12B 模型在消费级笔记本上跑出接近 26B 的多模态 Agent 体验,开源 + Apache 2.0,本地部署门槛又压低了。

6月2日6月2日周二

星期二 · 3 条
07:19
MiniMax (official)@MiniMax_AI精选
AI 评分 81/100
MiniMax M3 模型上线 Cloudflare AI GatewayM3 on Cloudflare AI Gateway, day one ⚡Frontier coding, 1M context, and native multimodal and now just one fetch away.It is time to build something. 🦞M3 on Cloudflare AI Gateway, day one ⚡ 前沿编码能力,1M 上下文,原生多模态,现在一次 fetch 即可调用。 是时候构建些东西了。 🦞

Cloudflare Developers: M3 from @MiniMax_AI is now available on Cloudflare AI Gateway: - First open model to push SOTA coding frontier - 1M cont...

另有 8 家信源报道公众号:MiniMax(稀宇科技)X:OpenRouter (@OpenRouter)IT之家(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:karminski (@karminski3)X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)
推荐理由:MiniMax的M3把开源编码模型拉到新高度,1M上下文加原生多模态是惊喜,上线首周5折,值得跑一下看是不是真能干翻闭源。
01:59
公众号:通义实验室(千问)精选
AI 评分 64/100
Qwen3.7-Plus 多模态智能体模型发布

Qwen3.7-Plus 深度融合视觉与语言,实现“看、想、写、做、验”端到端闭环,在 12 项核心基准测试中表现提升。实测中,基于该模型的智能体连续运行超 11 小时,自动完成英语学习 APP 开发,生成代码超 10000 行、触发调用超 1000 次;复刻 macOS Stocks 应用并通过 10 项功能验证。支持图像/视频转 SVG、视觉驱动网页设计及浏览器自动化。已在阿里云百炼上线,提供 OpenAI 兼容 API 与 Anthropic 协议。

另有 4 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Kim (@kimmonismus)
推荐理由:Qwen3.7-Plus 把视觉智能体推到了‘能看、能想、能动手’的端到端闭环,从写代码到操作浏览器一条龙,做自动化 Agent 的团队可以直接拿来用。
01:37
Qwen:Blog Retrieval(API)精选
AI 评分 81/100
Qwen3.7-Plus:多模态智能体模型发布

阿里云通义千问推出 Qwen3.7-Plus,基于 Qwen3.7 文本骨干,增强视觉语言能力,保留编码、工具使用和生产工作流的智能体能力。它支持感知现实场景、读取并操作 GUI、从视觉参考编写代码、端到端导航手机应用、基于网络知识回答视觉问题,融合 GUI 与 CLI 交互,跨 Claude Code、OpenClaw、Qwen Code 等框架泛化。在 Terminal Bench 2.0-Terminus 得分 70.3,SWE-Verified 77.7,QwenWorldBench 62.1,GPQA Diamond 90.3,MMLU-Pro 88.5。通过阿里云 Model Studio API 提供。

另有 4 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Kim (@kimmonismus)
推荐理由:Qwen3.7-Plus 把视觉感知、GUI 操作和编码能力整合进同一个 agent 模型,在 ScreenSpot 和浏览器操作上的提升很实在,做自动化的开发者值得上手试试。