Topic · 主题全部主题 →

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

3,734条收录
407条精选

精选归档 · 第 6 页

101120 条 · 共 407

7月12日7月12日周日

星期日 · 1 条
00:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
Ghost Font:一种人类能读懂但AI无法识别的反AI字体

Ghost Font 是一种利用运动、视频、噪点和诱饵来隐藏文字的反AI字体。用户输入文字后可生成并下载视频片段,视频中的字母由与背景完全相同的点组成,单帧截图无法显示任何信息。该字体生成的视频被传递给Claude Fable和GPT Sol 5.6 Ultra等前沿模型时,这些模型即使具备编程能力也无法解码移动信息,直到被提示具体技术。视频中还包含一条诱饵信息,使模型误以为找到真实内容。项目灵感来自2013年Sang Mun设计的ZXX字体,但现代AI已能轻松读取ZXX。Ghost Font目前为本地原型,数据不发送至任何服务器。作者计划未来将视频生成代码开源,并探索将其用于CAPTCHA系统或AI视觉感知基准测试。


推荐理由:这个项目用视频中运动的光点传递文字,还加了假消息陷阱,让顶级视觉模型集体失败。对抗AI感知的探索很少这么直观,做CAPTCHA和对抗样本的值得看。

7月11日7月11日周六

星期六 · 3 条
16:17
MarkTechPost(RSS)精选
AI 评分 74/100
蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。


推荐理由:首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。
00:40
Mira Murati@miramurati精选
AI 评分 65/100
Mira Murati 新公司 Thinking Machines Lab 获 20 亿美元融资A year ago we set out to empower humanity with a focus on multimodal AI, custom models, and open science.We previewed interaction models that collaborate the way people do. Tinker lets anyone train their own open weights models. We published our research on Connectionism.Mira Murati 创立的 Thinking Machines Lab 宣布获得 20 亿美元融资,由 a16z 领投,NVIDIA、Accel 等参投。公司专注于多模态 AI、定制模型和开放科学,将在未来几个月推出首款产品,包含重要的开源组件,面向研究人员和初创公司。

Mira Murati: Thinking Machines Lab 的使命是通过推进协作式通用智能来赋能人类。 我们正在构建多模态 AI,使其能够与你与世界的自然交互方式协同工作--通过对话、通过视觉、通过我们那种混乱的协作方式。我们很高兴地宣布,在未来几个月内,...


推荐理由:Mira 的公司以 2B 融资和开源路线站上了今年 AI 创业的前排,虽然产品还没出来,但这笔钱和阵容本身就说明市场对多模态协作路线的信心。

7月10日7月10日周五

星期五 · 2 条
08:20
Google Research:Blog(网页)精选
AI 评分 70/100
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型

Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问题。


推荐理由:SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 78/100
GenCeption:视频生成模型作为通用视觉学习器

论文提出 GenCeption,利用预训练文本到视频扩散模型作为前馈感知骨干,通过文本指令驱动完成深度估计、表面法线、相机位姿、指代分割和 3D 关键点预测等多种视觉任务。GenCeption 在多个基准上达到 SOTA,匹配或超越 DepthAnything3、SAM3、D4RT、VGGT-Omega 等专用模型。视频生成预训练骨干在同等设置下优于 V-JEPA 和 Video MAE 等替代范式。GenCeption 展现出数据与模型缩放特性,仅用 7 到 500 倍更少的训练数据即可达到 D4RT 和 VGGT-Omega 的同等性能。模型仅用合成人类视频训练,即可泛化到真实场景及动物、机器人等分布外物体类别。


推荐理由:这篇论文提出用视频生成模型做通用视觉预训练,在深度、分割、姿态估计等一堆任务上吊打专业模型,甚至只用1/500的数据就追平D4RT。我觉得这可能是CV领域的‘GPT时刻’前兆,做视觉基础模型的人该认真看看。

7月9日7月9日周四

星期四 · 2 条
15:16
IT之家(RSS)精选
AI 评分 73/100
蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0

蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。


推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。

7月8日7月8日周三

星期三 · 6 条
22:33
Mistral AI:News(网页)精选
AI 评分 70/100
Robostral Navigate:Mistral AI 首个具身导航模型

Robostral Navigate 是 Mistral AI 首个具身导航模型(8B 参数),仅用单 RGB 摄像头,在 R2R-CE 验证集上取得 76.6%(unseen)和 79.4%(seen)的成功率,超越最佳单摄像头方法 9.7 个百分点,超越使用深度或多摄像头的系统 4.5 个百分点。模型通过 pointing 预测目标坐标并结合强化学习持续改进,全部在模拟中训练(约 40 万轨迹、6000 场景),采用 prefix-caching 实现高效训练。通用适配轮式、腿式和飞行机器人,能适应真实环境中未训练的障碍。


推荐理由:Mistral 首个具身导航模型,只用单 RGB 摄像头就在未见环境中跑赢深度传感器方案,对机器人行业是个真信号,做物流和制造的可以仔细看看。
21:22
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
Seedream 5.0 Pro 发布:不止"生成",更懂"设计"

字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。

另有 1 家信源报道IT之家(RSS)
推荐理由:字节这次发布的 Seedream 5.0 Pro 把图像生成从「画得好看」推进到「能输出信息图、能精准编辑」的实用设计工具,尤其复杂信息图和交互编辑是当前竞品明显短板,做设计的值得立刻试试。
11:24
MarkTechPost(RSS)精选
AI 评分 71/100
蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知

蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。

另有 1 家信源报道X:karminski (@karminski3)
推荐理由:在视觉基础模型里把边界当作核心信号,这个思路很反常识,1B模型在深度估计上超过7B的DINOv3,做机器人的可以认真看看。
10:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。


推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。
00:24
OpenRouter:Announcements(RSS)精选
AI 评分 65/100
在LLM中选择最佳图像输入细节级别

在5个模型上测试了1730道视觉推理题,发现将图像细节降至"low"会损失准确率,且在gpt-5.5上费用反而上升。真正可靠降低成本的手段是调节推理努力(reasoning effort)。


推荐理由:OpenRouter 用 1730 道题的实验告诉你,降图像细节未必省钱,GPT-5.5 上反而更贵,真正靠谱的开关是控制推理努力。做视觉应用的不看这个容易踩坑。

7月7日7月7日周二

星期二 · 1 条
21:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
统一音频智能模型 Nemotron-Labs-Audex-30B-A3B 发布

Nemotron-Labs-Audex-30B-A3B(Audex)是基于Nemotron-Cascade-2-30B-A3B的MoE大语言模型,采用单一Transformer解码器统一处理文本与量化音频token。训练使用157.4B音频token和320.5B文本token,经多阶段监督训练、文本Cascade RL和多域on-policy蒸馏优化。在音频理解、语音识别/翻译、文本转语音、音频生成及语音到语音生成任务上达SOTA,同时保持原文本LLM的推理、对齐等能力几乎无退化。模型权重已开源。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:多模态LLM常捡芝麻丢西瓜,Audex难得做到音频全面增强而文本智能不退化。开源模型让语音产品人可以立刻评估,不是研究Demo。

7月5日7月5日周日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
ResearchStudio-Reel:从论文到海报、视频和博客的自动化系统

ResearchStudio-Reel 由五个 Claude Code 和 Codex 技能组成,包含共享提取器 Paper2Assets,三个可编辑生成器 Paper2Poster、Paper2Video、Paper2Blog 以及交互式汇聚层 Paper2Reel。它一次性从论文中提取资产,生成打印级海报、同步讲解视频和双语博客,并支持在 PowerPoint 或 Word 中二次编辑。在 Paper2Poster 基准上,其海报在美学和信息指标上均优于先前自动化系统和单次调用前沿 LLM。


推荐理由:ResearchStudio-Reel 把论文到海报、视频和博客的“最后一公里”自动化了,生成结果还能在 PowerPoint 里重新编辑。对经常做学术传播的人,是个省时的小利器。

7月3日7月3日周五

星期五 · 4 条
23:46
公众号:京东JoyAI精选
AI 评分 68/100
JoyAI App 上线 UGC 数字人功能,用户可"捏"出专属虚拟玩伴

JoyAI App 近日上线 UGC 数字人功能,用户只需上传一张照片即可生成专属虚拟数字分身,支持一键复刻写实形象或通过模板重塑为卡通风格,搭配用户自己的语音即可解锁专属陪伴。该功能复用“万能博士”技术底座,集成 JoyAI 语言、语音、数字人大模型,实现行业领先的全双工对话,支持随时打断、自然接话。数字人兼具情绪陪伴与全能助手属性,可提供点外卖、金融咨询、学英语、规划行程等生活服务。


推荐理由:京东把数字人技术做成了「传一张照片就能捏」的大众玩具,虽然看不出硬核突破,但对普通用户来说,这是第一次零门槛体验有形象有语音的 AI 玩伴,上手即用。
23:46
公众号:生数科技(Vidu·视频)精选
AI 评分 70/100
生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代

7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。

另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)
推荐理由:Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。
18:05
公众号:京东JoyAI精选
AI 评分 65/100
JoyAI App上线UGC数字人功能,一张照片即可"捏"出专属虚拟玩伴

JoyAI App正式上线UGC数字人功能,用户上传一张照片即可生成高度还原的写实数字分身,或搭配模板重塑为卡通形象,并支持复刻音色。该功能复用“万能博士”技术底座,实现全双工对话能力,可随时打断、自然接话,同时提供点外卖、金融咨询等生活服务。


推荐理由:照片生成数字人并不新鲜,但把全双工对话和京东生活服务(点外卖、金融咨询)集成进一个虚拟玩伴,让陪伴型智能体有了更直接的服务抓手。