蚁工厂
26-07-04 10:52 微博认证:科技博主

斯坦福 CS25 课程最近的一场客座讲座,请了 Thinking Machines Lab的研究员Victoria Lin来讲 从语言模型到原生多模态智能
这节课系统讲解了如何把大语言模型的范式扩展到"原生多模态"——通过对文本、图像、音频、视频统一做 token 化再用自回归生成建模,并区分了只做理解(多模态输入、纯文本输出,如 Gemini/Qwen/Kimi)与能生成多模态内容的 Omni 模型(如 GPT-4o)。 http://t.cn/AXo6I7i8

发布于 山东