本文提出多模态生成嵌入模型MM-GEM,将生成与嵌入两种目标统一于单个大语言模型中,实现每个模态仅需一个模型。通过引入PoolAggregator提升效率并支持细粒度嵌入与生成。实验表明,生成与嵌入目标并不显著冲突,模型在跨模态检索、零样本分类和图像描述等任务上表现优异,同时具备区域级描述生成与检索能力,并在长文本图像检索中取得显著提升。
本文针对仅使用文本数据训练图像描述模型的任务,提出一种多上下文数据生成方法。通过构造多样化的文本上下文,生成合成图像-描述训练对,使模型学习跨模态对齐与语义描述能力,减少对真实图像标注的依赖。实验表明该方法在多个图像描述基准上取得有效性能,为数据稀缺场景下的多模态学习提供了新思路。