🔥 Google 发布的多模态模型 Gemma 3n 正式全面开源啦!
Gemma 3n 最早在 Google I/O 上以“可本地运行的多模态模型”亮相,引发了社区的广泛关注。现在,这款模型已经全面登陆 Hugging Face 平台,并集成进多个主流开源库:包括 🤗 Transformers、timm、MLX、llama.cpp、Transformers.js、Ollama 等等!
🎯 什么是 Gemma 3n?为什么值得关注?
💡 多模态能力:同时支持文本、图像、音频和视频输入,一体化多模态交互体验。
🧠 高效架构设计:使用 MatFormer + KV Cache Sharing,支持层级抽取、内存共享,加速长文本与多模态处理。
📦 超轻量运行:实际参数为 5B / 8B,但仅需 2GB / 3GB 显存即可运行(E2B/E4B),本地部署更轻松。
🌍 多语言覆盖:支持 140 种语言文本输入,35 种语言的语音/图像理解能力。
🧪 指令微调版本同步上线,开箱即用。
🛠️ 模型已在以下平台原生支持:
🤗 Transformers:支持图文音混合输入,直接调用 pipeline 推理。
🖼️ timm:集成全新视觉编码器 MobileNet v5,手机上也能 60 FPS 运行。
🔊 MLX:支持 macOS 上图像、语音等多模态推理。
🧱 llama.cpp / Transformers.js / ONNXRuntime:轻松嵌入 Web 和边缘设备。
📒 Google Colab 微调笔记本也已开放,轻松上手文本或语音任务!
🎓 小体积、多模态、低门槛 —— Gemma 3n 正在开启一个“人人可用”的 AI 模型新时代。
🤗 欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起体验并探索更多 Gemma 的玩法!
#Hugging Face##多模态模型##Gemma3n#
