看到阿里开源了一个叫PromptEcho的项目。它的核心思路挺有意思的,是拿冻结状态的多模态大模型,来为文生图模型的训练过程提供高质量的Reward信号。
简单说,就是用这种现成的、不参与训练的大模型(比如CLIP这种)来评估生成的图片和文本提示词的匹配程度,把这个匹配度分数作为奖励信号,去引导文生图模型学得更好。这样能省去专门训练一个奖励模型的麻烦,直接用上大模型已有的强大图文理解能力。
我看介绍里说,这种方法在几个数据集上试了,效果还挺不错的,生成的图片质量有提升。代码已经放在GitHub上了,有兴趣的可以自己看看。