📣 新标准来了!RTEB(beta)正式发布:一个更贴近真实应用的向量检索评测基准 🚀
为什么需要 RTEB?很多模型在公开数据上“考得高”,到真实业务里却“用得差”。RTEB 采用“公开数据集+私有数据集”的混合策略:公开集可复现,私有集由 MTEB 统一评测,直测真泛化;若两者分差大=潜在过拟合预警。核心指标用 NDCG@10,更符合检索排序质量。
它有何不同:
强泛化:混合评测抑制“背题”,结果更可信。
贴场景:覆盖 20+ 语言与法律、医疗、金融、代码等领域,规模适中、评测高效。
更实用:以 NDCG@10 为默认指标,聚焦真实检索体验。
已知限制与规划:当前以文本检索为主,后续将扩展多模态与更多语言;部分任务源自 QA 重构,将持续补充更贴近真实分布的数据。看到公开 vs 私有分差时,优先优化数据去重、训练分布与召回策略,再迭代模型。
🤗 欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起参与共建——评测你的模型、提交高质量数据集建议、反馈问题,共创更可靠的检索评测标准!
#Hugging Face##向量检索##评测基准#
发布于 美国
