Topic · 主题全部主题 →

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

3,734条收录
406条精选

精选归档 · 第 17 页

321340 条 · 共 406

5月7日5月7日周四

星期四 · 2 条
06:30
Apple Machine Learning Research(RSS)精选
AI 评分 73/100
从位置认知到功能理解:为多模态大语言模型设立空间功能智能基准

现有基准如VSI-Bench主要评估基础几何感知能力,但未能触及具身智能所需的高阶认知。为此,研究团队推出了空间功能智能基准SFI-Bench,该基准包含超过1700个问题,数据来源于多样化的第一人称室内扫描视频。SFI-Bench旨在系统评估多模态大模型从物体位置感知到功能意图理解的高级空间推理能力,标志着对智能体空间认知的评估从几何层面迈向功能层面。


推荐理由:Apple 自己搞的 SFI-Bench 把评估从几何定位推进到功能理解,这个方向很对,做具身智能和空间推理的团队该跟一下。

5月6日5月6日周三

星期三 · 5 条
22:16
IT之家(RSS)精选
AI 评分 71/100
豆包大模型家族首款全模态理解模型:字节跳动 Doubao-Seed-2.0-lite 升级

字节跳动火山引擎发布豆包大模型家族首款全模态理解模型 Doubao-Seed-2.0-lite 升级版。该模型原生统一支持视频、图像、音频和文本理解,并能进行跨模态联合推理,在物理、医疗等学科推理及细粒度感知上表现超越此前Pro版本。音频方面支持19种语种转写及多语种互译,多项基准测试优于Gemini-3.1-Pro。同时,其Agent、Coding与GUI能力升级,能更稳定处理长任务、胜任深度开发,并实现界面理解与操作执行的闭环。新版本已在火山方舟上线,旨在为企业提供高性价比的全模态任务部署方案。


推荐理由:豆包Seed 2.0 lite把视频、音频、图片、文字原生塞进一个模型,还顺手强化了Agent和GUI操作,对需要全模态处理的企业来说,这可能是目前性价比最高的选择。
07:15
IT之家(RSS)精选
AI 评分 70/100
苹果 iOS 27 将允许用户选择第三方 AI 模型,支持谷歌与 Anthropic 等

据报道,苹果计划在秋季发布的iOS 27等系统中,推出名为“Extensions”的新功能,允许用户自行选择已通过App Store集成的第三方AI模型(如谷歌、Anthropic的模型),来驱动设备上的文本生成、图像编辑等AI功能。此举将打破此前ChatGPT作为唯一第三方选项的独占地位。同时,Siri将支持更换不同音色以区分内外模型,并迎来独立App及更深度的系统整合。苹果将在App Store设立专区展示兼容应用,并对第三方模型生成的内容免责。


推荐理由:苹果放开 AI 模型底层的选择权,让谷歌和 Anthropic 进入原先 OpenAI 独占的地盘,这比发一个新模型更有生态意义——手机 OS 正在变成 AI 的分发渠道。
02:56
Google AI Developers@googleaidevs精选
AI 评分 68/100
Gemini API 文件搜索工具推出三项新更新,助力多模态 RAG 系统开发We’re expanding the Gemini API File Search tool 🔍 with 3 new updates that enable developers to more easily build multimodal RAG systems with enhanced precision:• Multimodal Support: By leveraging our Gemini Embedding 2 model, File Search can now reason across image and text simultaneously.• Custom Metadata Filtering: Bring structure to unstructured data by tagging files with custom key-value labels. This pre-filters your data and boosts search speed.• Exact citations: File Search can now capture and return the exact source (down to the page number) for every piece of information indexed.See multimodal File Search in action with our example app in @GoogleAIStudio. Chat with your entire image and doc library, ask questions, and trace answers back to the source: http://goo.gle/4tKSz1kGemini API 文件搜索工具近日扩展三项功能更新,旨在帮助开发者更轻松地构建高精度多模态检索增强生成系统。更新包括:多模态支持,通过Gemini Embedding 2模型实现对图像和文本的同步推理;自定义元数据过滤,允许为文件添加键值标签以结构化非结构化数据,从而提升搜索速度;精确引用功能,能够捕获并返回每条索引信息的精确来源,如页码。开发者可通过Google AI Studio的示例应用体验这些功能,与图像和文档库交互,提问并追溯答案来源。

推荐理由:如果你在用 Gemini 搭 RAG 系统,这三项更新能直接改善搜索精度和可解释性,多模态搜索终于把图片和文档打通了,值得马上试试。
02:00
Sam Altman@sama精选
AI 评分 69/100
ChatGPT今日迎来5.5即时版重大升级5.5 instant comes to ChatGPT today!imo it is a pretty big upgrade, i really like using it.5.5 instant 今日登陆 ChatGPT! 在我看来这是一个相当大的升级,我真的很喜欢使用它。 【引用 @ericmitchellai】:Excited that we're updating the default model in ChatGPT today! 5.5 instant 在智能、图像感知和事实准确性方面都有显著提升。 它还更新了写作风格,使其更平实、更直接。 你的愿望清单上有什么?

Eric: Excited that we're updating the default model in ChatGPT today! 5.5 instant is a substantial improvement in intelligence...

另有 1 家信源报道X:Satya Nadella (@satyanadella)
推荐理由:ChatGPT 默认模型悄悄换上了 5.5 instant,图像感知和事实性提升明显,写作风格也更直接,每天用它的人今天会感觉到差异,不是小修小补。
01:26
Chubby♨️@kimmonismus精选
AI 评分 83/100
OpenAI推出GPT-5.5 Instant作为ChatGPT新默认模型,实现显著升级Nice, big update: OpenAI is rolling out GPT-5.5 Instant in ChatGPT as the new default model (very good jumps in benchmark)The upgrade makes ChatGPT smarter, more factual, more dependable, and better at everyday tasks like image analysis, STEM questions, writing, and high-accuracy domains such as medicine, law, and finance.The bigger shift is personalization: ChatGPT can now use saved memories, past chats, files, and connected Gmail context more effectively, while showing users which memory sources influenced a response.GPT-5.5 Instant will roll out to all ChatGPT users over the next two days, while personalization improvements are coming first to Plus and Pro users on web, with mobile following soon. In the API, it will be available as gpt-5.5-chat-latest.OpenAI正式将GPT-5.5 Instant设置为ChatGPT的新默认模型,该模型在基准测试中表现大幅提升,变得更智能、准确和可靠。其在图像分析、STEM、写作及医学、法律等高精度领域能力增强。核心升级在于个性化功能,能有效利用用户保存的记忆、过往聊天、文件和Gmail上下文,并展示影响回复的记忆来源。该模型将在未来两天内向所有用户推出,个性化改进优先面向网页版Plus和Pro用户,移动版随后跟进;API版本为gpt-5.5-chat-latest。官方表示,升级后的模型能提供更智能、清晰、个性化的答案,语气温暖自然且更简洁。

OpenAI: GPT-5.5 Instant is starting to roll out in ChatGPT. It’s a big upgrade, giving you smarter, clearer, and more personaliz...


推荐理由:ChatGPT默认模型直接换到GPT-5.5 Instant,个性化能力是代际跃迁,明天打开就能感受到不同。

5月5日5月5日周二

星期二 · 5 条
12:17
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
MolmoAct2:面向真实世界部署的动作推理模型

MolmoAct2 是一个为实际部署设计的全开放动作推理模型,在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER,基于 330 万样本语料库训练。团队发布了三个新数据集,包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM(720 小时遥操作轨迹),并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构,嫁接连续动作专家,还引入自适应深度推理变体 MolmoThink,以极低延迟保持几何基础。在广泛实证研究中,MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线,MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。


推荐理由:开源具身动作推理模型首次全面超越 GPT-5 和 Gemini Robotics,还附赠最大的双手操作数据集和全套训练代码,做机器人的同学本周必读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
RLDX-1技术报告

为提升视觉-语言-动作模型在复杂现实任务中的功能覆盖,研究团队推出通用机器人策略RLDX-1。该模型基于多流动作变换器架构,整合运动感知、记忆决策与物理传感等异构模态,并辅以合成罕见场景数据、仿人操作学习流程及实时推理优化等系统设计。在仿真与真实测试中,RLDX-1全面超越前沿模型π_{0.5}和GR00T N1.6,尤其在ALLEX人形机器人任务上取得86.8%的成功率,显著高于对照模型的约40%,标志着其在接触密集型动态灵巧操作领域取得关键进展。


推荐理由:在 ALLEX 人形任务上把成功率从 40% 拉到 86.8%,RLDX-1 证明了多模态流架构对灵巧操作的价值,做机器人的同学可以重点关注一下。
02:58
Google Gemini@GeminiApp精选
AI 评分 67/100
创意速成:Nano Banana 2助力产品原型实现From idea to prototype, bring your specific product visions to life with the help of Nano Banana 2 in Gemini. 🪀从构想到原型,借助Gemini中的Nano Banana 2,将您独特的产品愿景变为现实。🪀

推荐理由:Google Gemini塞进一个Nano Banana 2创意工具,把想法转原型只需几句话,产品经理脑暴草案利器,算不上重磅但够实用。

5月2日5月2日周六

星期六 · 2 条
03:10
Tomer Tunguz 博客(VC 分析)精选
AI 评分 57/100
本周的积极信号:AI在医疗、教育、农业与科研领域的突破性进展

近期多项进展展现了AI的巨大积极影响。医疗领域,Mayo Clinic的AI能通过常规CT提前最多三年检测胰腺癌,强生利用AI将新药线索生成时间减半。教育方面,哈佛研究显示AI导师使学生学习效果翻倍,泰国培训16万名教师惠及330万学生。农业上,AI能以约88%准确率预测害虫爆发。科研中,AI快速筛查NASA数据,新发现超一万颗系外行星候选。此外,香港推出AI洪水预报系统,Atlassian和Twilio等公司也因AI驱动业绩增长并上调预期。这些案例平衡了AI风险,凸显其创新潜力。


推荐理由:Tomer 收集了最近两周 AI 在医学、教育、农业的硬核落地案例,对反 AI 恐慌是一剂清醒剂,SaaS 公司的营收也说明行业在回暖。

5月1日5月1日周五

星期五 · 4 条
19:17
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
Grok 4.3

x.ai 正式发布了 Grok 4.3 模型,开发者可通过官方文档获取详细信息。该模型在 Hacker News 社区获得关注,相关帖子收获了 100 点热度。此次发布标志着 Grok 系列模型的持续迭代更新。


推荐理由:xAI 的 Grok 4.3 如期而至,性能和对标都写在文档里了,想了解最新大模型实力的开发者值得花五分钟看一眼。
02:13
Google Developers Blog(RSS)精选
AI 评分 62/100
基于Gemini Embedding 2构建:智能多模态RAG及其他应用

Google正式发布Gemini Embedding 2统一嵌入模型,该模型能将文本、图像、视频、音频和文档映射到同一语义空间。开发者可通过单请求处理交织多模态输入,显著提升智能RAG、视觉搜索等内容审核任务的性能。模型支持超100种语言,并提供任务特定前缀和马特廖什卡降维等特性,为构建复杂AI智能体提供高效精准的基础。


推荐理由:开发者做多模态RAG的苦日子结束了,Gemini Embedding 2把文本、图片、视频塞进同一个语义空间,还自带Matryoshka降维,直接省掉一堆胶水代码。
01:45
Google AI@GoogleAI精选
AI 评分 69/100
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2Last week, we made Gemini Embedding 2, our first natively multimodal embedding model, available to the general public. Since then, developers have used it to build video analysis tools, visual shopping assistants, and more.But you might be wondering... what is an embedding model? 🤔 Let’s break it down!1. What is it? Think of an embedding model as a "universal translator." It takes text, images, video, and audio data and turns them into a long string of numbers, like a unique digital fingerprint.2. How does it work? Historically, search has been text only. Now, instead of just matching data by keyword, Gemini Embedding 2 maps multiple modalities in the same space based on meaning. It "feels" the connection between a video of a soccer goal and the words "game-winning shot" without needing tags.For example, "ocean" and "waves" are placed close together, but "ocean" and "toaster" are miles apart.3. How can you use it? Developers have been using it to incorporate smarter search functionality into their builds. This means creating tools where you can snap a photo of a product and type "find this in yellow," or search through thousands of hours of video by describing what happens in a scene.4. Ready to try it out for yourself? You can start using it today via the Gemini API or the Gemini Enterprise Agent Platform.谷歌上周正式向公众发布了其首个原生多模态嵌入模型Gemini Embedding 2。该模型如同"通用翻译器",能将文本、图像、视频和音频数据转化为独特的数字向量。其核心突破在于不再依赖关键词匹配,而是基于语义将不同模态的数据映射到同一空间,从而理解内容间的深层联系。开发者已利用该模型构建视频分析工具、视觉购物助手等应用,实现通过拍照或描述场景进行智能搜索的功能。模型现可通过Gemini API或Gemini Enterprise Agent平台使用。

推荐理由:Google 第一个原生多模态嵌入模型,把文本、图像、视频拉到同一个向量空间,做跨模态搜索的开发者可以不用再手动打标签了,但离「无感理解」还有距离。

4月30日4月30日周四

星期四 · 2 条
23:10
IT之家(RSS)精选
AI 评分 72/100
DeepSeek 公布多模态模型技术报告

DeepSeek发布了多模态大模型及技术报告,提出创新的“基于视觉原语的思考”框架。该框架将点、边界框等视觉元素作为推理的基本单元,旨在解决多模态模型在空间参照任务中存在的“参照鸿沟”核心问题,使模型能将抽象认知锚定到图像的具体坐标上。尽管模型规模紧凑且图像标记预算较低,其在多项挑战性计数和空间推理基准测试上的性能,可与GPT-5.4等前沿模型相媲美。


推荐理由:DeepSeek 把视觉概念直接变成推理单元,绕开了语言描述空间的先天模糊,在空间推理上把自家紧凑模型拉到和 GPT-5.4 一个水平,做多模态应用的人值得细读。