本文针对多模态大语言模型在多模态上下文学习中的演示序列配置问题,提出一种基于聚类的上下文配置方法。该方法自适应地对候选数据进行分组,并从每个簇中选取演示样本,以增强序列内多样性并保持语义一致性,从而减少高相似演示带来的归纳偏置,使模型更关注演示的主要意图。在OK-VQA、VQAv2、VizWiz和TextVQA四个视觉问答基准上的实验验证了其有效性。