本文针对仅使用文本数据训练图像描述模型的任务,提出一种多上下文数据生成方法。通过构造多样化的文本上下文,生成合成图像-描述训练对,使模型学习跨模态对齐与语义描述能力,减少对真实图像标注的依赖。实验表明该方法在多个图像描述基准上取得有效性能,为数据稀缺场景下的多模态学习提供了新思路。