研学手记
5小时前来自 科技看点

除了华中科大,还有哪些高校在研究多模态大模型?

本文从中国日报AI短片让菲律宾“破防”事件切入,梳理除华中科技大学外,国内还有清华大学、北京大学、上海交通大学、浙江大学、南京大学、中国科学院大学等多所高校在多模态大模型领域的代表性研究成果。

一、事件背后:AI生成能力的直观展示

2026年7月,中国日报在海外平台发布了一段58秒的AI生成短视频,片中一只身穿菲律宾传统服饰的猴子被印有美日国旗的巨手操控,手持“南海仲裁裁决”纸条,最终被水炮冲入海中。这段短片全程未提及菲律宾国名,却引发菲外交部、国防部、海岸警卫队多部门集体抗议,要求下架视频。外交部回应指出该视频并非官方行为,但“民意不可违”。事件迅速冲上全球热搜,也让公众对AI在内容创作、政治讽刺中的表现力印象深刻。该短片背后正是多模态大模型技术——它能够同时理解文本、图像、音频,并生成连贯的叙事画面。而国内在多模态大模型领域的研究,正是支撑这类AI创作的核心力量。

二、华中科大的“Monkey”模型:先行探索

华中科技大学软件学院白翔教授领衔的VLRLab团队于2023年底发布了多模态大模型“Monkey”。该模型以出色的“看图说话”能力著称,可处理分辨率高达1344×896像素的图像,是当时其他模型最大处理尺寸的6倍。团队通过创新的“裁剪+放大镜”方法,将大图分割为小块分别处理,在图像描述和视觉问答任务上超越了微软LLAVA、谷歌PALM-E、阿里Mplug-owl等知名模型,甚至在某些样本上接近GPT-4V水平。Monkey的开源发布,为国内多模态研究提供了重要基础。

三、其他高校的多模态大模型研究

除华中科大外,国内多所顶尖高校在多模态大模型领域均有深度布局,形成“百花齐放”的创新格局。

1. 清华大学

清华大学在通用多模态模型方面走在前列。其与智源研究院联合开发的GLM系列(如ChatGLM-4V)支持图像、视频、音频等多模态输入,在权威榜单上多次刷新成绩。清华还牵头发布“多模态大模型评测基准”,推动行业标准化。

2. 北京大学

北京大学计算机科学技术研究所和前沿计算研究中心在多媒体智能方向成果突出。该校研发的Pkuseg等文本模型已向多模态扩展,并在视觉-语言预训练、跨模态检索等任务上保持领先。北大还联合企业共建“多模态感知与理解实验室”。

3. 上海交通大学

上海交通大学电子信息与电气工程学院、人工智能研究院在多模态大模型上布局广泛。其MiniGPT-4系列模型(与阿里的工作有合作)以轻量高效著称,能在消费级显卡上运行并展示出接近GPT-4V的视觉理解能力。交大还推出了“书生”系列基础模型,覆盖图文、视频等多模态场景。

4. 浙江大学

浙江大学计算机科学与技术学院在视觉与语言融合方向上深耕多年。其研发的ViLBERT变体及“启真”多模态模型,在图文问答、视觉推理等任务上表现优异。浙大还牵头“视觉与学习”国家实验室,推动多模态技术在医疗、制造等领域的应用。

5. 南京大学

南京大学人工智能学院在机器学习理论驱动下的多模态建模方面特色鲜明。该校开发的LAMM系列模型强调可解释性和小样本学习能力,在细粒度图像描述、情感分析等任务中展现了独特的算法优势。

6. 中国科学院大学(含中科院下属研究所)

国科大依托中科院自动化所、计算所、软件所等机构,在多模态大模型研究中占据重要地位。自动化所提出的紫东太初多模态大模型,融合了语音、图像、文本三模态,并在跨模态生成任务上达到国际先进水平。计算所则在模型压缩、推理加速上提供关键技术支撑。

四、国际化合作与跨校联合

多模态大模型研究并非单一高校独立完成。例如,华中科大曾与南洋理工大学等海外高校联合提出故障token检测方法,相关工作被软件工程顶级会议FSE 2024接收。清华大学、上海交通大学等也与英伟达、Meta等国际企业保持合作,共同推进多模态基准测试和开源工具链建设。

五、总结:从技术到应用的闭环

一个有趣的现象是:“Monkey”模型命名本身就带有“猴子”元素,而中国日报AI短片中的猴子形象又恰好展现了多模态生成的力量。从华中科大的“Monkey”到其他高校的各类模型,国内多模态大模型研究已形成从基础理论、算法创新到应用落地的完整链条。这些技术不仅支撑了舆论场中的创意表达,更在智能教育、辅助医疗、工业检测等场景中释放价值。未来,随着更多高校和企业持续投入,中国在多模态人工智能领域的创新能力将进一步夯实。