全速前进E
26-01-14 20:18

1/ 智谱开源了GLM-Iamge,一个类似Nano Banana一样的图像生成模型,模型方面核心几点

1) 模型能力主打文字渲染和指令遵循,尤其中文的文字渲染很强,小段文字可以一图直出。Nano Banana的核心能力也是视觉和语言的融合,GLM-Iamge也是这个方向的一次探索,后面有测试案例,提示词也会放到评论区,欢迎大家和其他模型对比测试看看效果(Nano Banana 依然很强稳定发挥,但GLM也不错)

2) 模型架构用了自回归加扩散模型(融合了9B大小的Transformer+7B的DiT),架构上的创新让模型能读懂写对,自回归模型负责提升对指令的语义理解和画面的全局构图,扩散模型专注于还原图像的高频细节和文字笔画

3) GLM-Image在文字渲染的权威榜单上达到了开源SOTA水平,比如CVTG-2K(复杂视觉文字生成)和LongText-Bench(长文本渲染),看后面的图

2/ 另一个亮点是GLM-Image是在纯国产芯片上训练出来的,是对国产AI基础设施的的一次探索和验证。自回归结构基座、早期的数据预处理,到最终的大规模预训练,全流程都在昇腾Atlas 800T A2设备上完成,现在国产芯片上面也能训练SOTA级别的多模态模型了

3/ 试了一些case,GLM的文字渲染能力是亮点,后面MBTI那个图里字非常多,有几个字渲染得有问题,但是准确率已经90%了,其他模型确实还达不到。不过细节的丰富程度和世界知识方面,谷歌依然是现在的王,但国产的模型追到这个水平应该也是时间问题

发布于 北京