Ovis-Embedding:推进通用全模态嵌入的前沿

HuggingFace Daily Papers(社区热门论文)·2026-09-21 08:00·2天前
AI 导读

Ovis-Embedding 是一个基于共享多模态骨干的全模态嵌入模型家族,用预训练的 Qwen-omni 作为嵌入骨干,通过低秩初始化的对比训练统一编码文本、图像、视频和音频。

HuggingFace Daily Papers(社区热门论文)
39AI 编辑部评分,满分 100

Ovis-Embedding:推进通用全模态嵌入的前沿

2026-09-21 08:00· 2天前
AI 导读

Ovis-Embedding 是一个基于共享多模态骨干的全模态嵌入模型家族,用预训练的 Qwen-omni 作为嵌入骨干,通过低秩初始化的对比训练统一编码文本、图像、视频和音频。

In this report, we introduce Ovis-Embedding, a state-of-the-art omni-modal embedding family built on native integration of text, image, video, and audio. Instead of assembling separate modality towers, Ovis-Embedding uses a shared multimodal backbone to encode different modalities in a common representation space. Specifically, we make three key advances: (1) native omni-modal initialization: we adopt a pretrained Qwen-omni model as the embedding backbone and adapt it through contrastive training with low-rank initialization; (2) data-centric omni-modal training: we construct a broad, high-quality corpus spanning text, images, video, audio, and interleaved multimodal data.

To improve data efficiency, we introduce homogeneous-source sampling to form task-consistent batches with informative in-batch negatives; and (3) embedding-specific training and inference optimization: we use focal loss to emphasize hard examples and similarity-based Embedding Distillation to transfer fine-grained similarity structure from complementary experts. At inference time, low-rank feature decomposition enables compact embeddings with flexible dimensionality and minimal performance loss. Empirical evaluations show that the Ovis-Embedding family achieves state-of-the-art performance on MMEB-v3, MMEB-v2, MVEB, MAEB, and RTEB, demonstrating its effectiveness across text, image, video, and audio modalities.

These results highlight the potential of unified omni-modal training to overcome modality fragmentation and advance universal embedding models for any-to-any retrieval.

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org