本文针对多模态大语言模型在多模态上下文学习中的演示序列配置问题,提出一种基于聚类的上下文配置方法。该方法自适应地对候选数据进行分组,并从每个簇中选取演示样本,以增强序列内多样性并保持语义一致性,从而减少高相似演示带来的归纳偏置,使模型更关注演示的主要意图。在OK-VQA、VQAv2、VizWiz和TextVQA四个视觉问答基准上的实验验证了其有效性。
本文提出一种名为 Task Navigator 的框架,利用大语言模型作为导航器,将复杂多模态任务逐步分解为更易处理的子问题,并引导多模态大语言模型按步骤求解。该方法无需重新训练模型,而是系统化地调用 MLLM 已有的多种能力,如 OCR、识别、推理等,从而提升复杂任务的处理效果。作者还构建了包含数学推理、嵌入式文本问答和视觉规划等任务的基准,验证了框架的有效性。
本文提出多模态生成嵌入模型MM-GEM,将生成与嵌入两种目标统一于单个大语言模型中,实现每个模态仅需一个模型。通过引入PoolAggregator提升效率并支持细粒度嵌入与生成。实验表明,生成与嵌入目标并不显著冲突,模型在跨模态检索、零样本分类和图像描述等任务上表现优异,同时具备区域级描述生成与检索能力,并在长文本图像检索中取得显著提升。