👀+🧠=nanoVLM!打造你自己的视觉语言模型,从未如此简单!
我们正式推出 nanoVLM:一个用纯 PyTorch 实现的超简洁 Vision Language Model(VLM)训练工具包 🎯。灵感来源于 Karpathy 的 nanoGPT,它是图文多模态世界的“极简入门门票”!
✨ 主要亮点:
📦 开箱即用:支持在免费 Colab Notebook 上快速启动训练,无需本地配置
🧠 模型结构清晰:视觉部分基于 SigLIP,语言部分基于 Llama3 架构,模态对齐只需一个投影模块
🐣 初学者友好:代码量极简,文件结构扁平,适合深入学习 VLM 架构
📊 任务聚焦:目前以 Visual Question Answering 为训练目标,支持图文问答推理
🚀 轻量训练:示例模型在单张 H100 GPU 上仅训练 6 小时,已具备多模态理解能力
🧪 我们也在 Hugging Face Hub 发布了训练好的 nanoVLM 模型和交互式 Space,支持在线图文问答体验!感兴趣的开发者可以基于它继续训练或微调。
🤗 欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起打造你的第一个视觉语言模型!
#视觉语言模型##Hugging Face##开源工具包#
发布于 美国
