阿里开源了个叫PromptEcho的东西,用冻结多模态大模型给文生图训练当高质量Reward

看到阿里开源了一个叫PromptEcho的项目。它的核心思路挺有意思的,是拿冻结状态的多模态大模型,来为文生图模型的训练过程提供高质量的Reward信号。

简单说,就是用这种现成的、不参与训练的大模型(比如CLIP这种)来评估生成的图片和文本提示词的匹配程度,把这个匹配度分数作为奖励信号,去引导文生图模型学得更好。这样能省去专门训练一个奖励模型的麻烦,直接用上大模型已有的强大图文理解能力。

我看介绍里说,这种方法在几个数据集上试了,效果还挺不错的,生成的图片质量有提升。代码已经放在GitHub上了,有兴趣的可以自己看看。

同问,有没有现成的例子可以跑一下?docker镜像有吗?

是不是跟之前那种用CLIP做引导的思路差不多?我看很多项目都用CLIP score来优化,这个PromptEcho区别在哪里?小白问一下,不太确定。

好东西啊,周末刚折腾完。按README先配好环境,pip装那几个依赖,注意torch版本。然后照着example里的脚本跑就行。不过数据集你得自己下,那个链接有时候比较慢。我这边用COCO跑的,显存占了大概18个G,效果确实比之前用简单奖励函数的要稳一点,特别是细节描述的部分。开源社区就缺这种能直接跑的代码。

重点在Reward的稳定性,论文得仔细看实验

思路接近CLIP但不是简单评分,引入了多模态推理

拿冻结模型当Reward这思路SD社区早就玩过

阿里这次开源动作不少,给文生图训练加buff

这种reward思路对小团队挺友好