HuggingFace
26-05-06 11:12 微博认证:HuggingFace官方微博

Sentence Transformers v5.4 已支持多模态能力 🔍
现在,你可以用同一套 API,同时处理文本、图片、音频、视频的 embedding 与 rerank 了。

这意味着什么?
以前 Sentence Transformers 更多用于文本语义搜索、RAG 和相似度匹配;现在它已经扩展到多模态检索场景:
🖼️ 用文字搜索图片
🎬 给视频匹配描述
📄 在文档截图中检索答案
🎧 用音频做语义搜索
🤖 构建多模态 RAG pipeline

核心变化是:不同模态会被映射到同一个向量空间。
比如“一张汽车图片”和一句 “A green car parked in front of a yellow building”,虽然输入形式不同,但 embedding 可以彼此接近,从而实现跨模态搜索。

除了 embedding,这次还支持多模态 reranker。
常见工作流是:
1️⃣ embedding 模型先快速召回
2️⃣ reranker 再做精排
这样既能兼顾速度,也能提升检索质量。

使用方式也非常统一:
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("Qwen/Qwen3-VL-Embedding-2B")
之后 model.encode() 就能直接处理文本、图片 URL、本地图片等输入。

目前已经支持多种模型生态,包括:
- Qwen3-VL
- NVIDIA Nemotron
- BAAI BGE-VL
- LCO Omni
- Jina reranker
- CLIP 系列

一句话总结:
Sentence Transformers 正在从“文本 embedding 工具”,升级为“多模态检索基础设施”。
无论你在做图文搜索、视觉文档检索、多模态 RAG,还是 Agent 检索系统,现在都能用更统一的方式搭建。🚀

🤗 欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起交流多模态检索、RAG 与开源模型实践!
#多模态检索##RAG##HuggingFace#

发布于 美国