前端开发博客
24-04-23 13:02 微博认证:  太平洋网络前端开发博客站长 科技博主

推荐一个多模态视觉语言模型的潜力挖掘项目,2.7k Star!

Mini-Gemini是一个专注于挖掘多模态视觉语言模型潜力的开源项目,它支持从2B到34B不同规模的密集和MoE(Mixture of Experts)大型语言模型(LLMs),同时具备图像理解、推理和生成的能力。该项目基于LLaVA框架构建,旨在通过双视觉编码器提供低分辨率视觉嵌入和高分辨率候选,并通过补丁信息挖掘在高分辨率区域和低分辨率视觉查询之间进行补丁级别的挖掘。此外,LLM被用来将文本与图像结合,实现对两者的综合理解和生成。

GitHub:github.com/dvlab-research/MGM

发布于 广东