<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>视觉问答 | ViLab</title>
    <link>https://vilab.team/tag/%E8%A7%86%E8%A7%89%E9%97%AE%E7%AD%94/</link>
      <atom:link href="https://vilab.team/tag/%E8%A7%86%E8%A7%89%E9%97%AE%E7%AD%94/index.xml" rel="self" type="application/rss+xml" />
    <description>视觉问答</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Sun, 14 Sep 2025 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>视觉问答</title>
      <link>https://vilab.team/tag/%E8%A7%86%E8%A7%89%E9%97%AE%E7%AD%94/</link>
    </image>
    
    <item>
      <title>Enhancing Visual Question Answering Via Clustered In-Context Sequence Configuration</title>
      <link>https://vilab.team/publication/enhancing-visual-question-answering-via-clustered-in-context/</link>
      <pubDate>Sun, 14 Sep 2025 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/enhancing-visual-question-answering-via-clustered-in-context/</guid>
      <description>&lt;p&gt;本文针对多模态大语言模型在多模态上下文学习中的演示序列配置问题，提出一种基于聚类的上下文配置方法。该方法自适应地对候选数据进行分组，并从每个簇中选取演示样本，以增强序列内多样性并保持语义一致性，从而减少高相似演示带来的归纳偏置，使模型更关注演示的主要意图。在OK-VQA、VQAv2、VizWiz和TextVQA四个视觉问答基准上的实验验证了其有效性。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>祝贺实验室科研成果发表于 ICIP 2025！</title>
      <link>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-icip/</link>
      <pubDate>Sun, 14 Sep 2025 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-icip/</guid>
      <description>&lt;p&gt;热烈祝贺贺子龙同学！论文《Enhancing Visual Question Answering Via Clustered In-Context Sequence Configuration》已发表在 &lt;em&gt;ICIP&lt;/em&gt;。&lt;/p&gt;
&lt;h2 id=&#34;enhancing-visual-question-answering-via-clustered-in-context-sequence-configuration&#34;&gt;Enhancing Visual Question Answering Via Clustered In-Context Sequence Configuration&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;祝贺贺子龙同学！该论文已发表在 &lt;em&gt;ICIP&lt;/em&gt;。&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;作者：&lt;/strong&gt; Zilong He、Yijun Pan、Hebei Li、Feipeng Ma、Yansong Peng、Siying Wu、Xiaoyan Sun&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表载体：&lt;/strong&gt; &lt;em&gt;ICIP&lt;/em&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表时间：&lt;/strong&gt; 2025年9月14日&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;相关链接：&lt;/strong&gt; &lt;a href=&#34;https://ieeexplore.ieee.org/abstract/document/11084650/&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;论文链接&lt;/a&gt; · &lt;a href=&#34;https://drive.google.com/file/d/1rivgSv2AEK1_1Q40pHnp-VK9QCfzskTK/view&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;PDF&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;论文介绍&#34;&gt;论文介绍&lt;/h3&gt;
&lt;p&gt;本文针对多模态大语言模型在多模态上下文学习中的演示序列配置问题，提出一种基于聚类的上下文配置方法。该方法自适应地对候选数据进行分组，并从每个簇中选取演示样本，以增强序列内多样性并保持语义一致性，从而减少高相似演示带来的归纳偏置，使模型更关注演示的主要意图。在OK-VQA、VQAv2、VizWiz和TextVQA四个视觉问答基准上的实验验证了其有效性。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Task navigator: Decomposing complex tasks for multimodal large language models</title>
      <link>https://vilab.team/publication/task-navigator-decomposing-complex-tasks-for-multimodal-larg/</link>
      <pubDate>Mon, 17 Jun 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/task-navigator-decomposing-complex-tasks-for-multimodal-larg/</guid>
      <description>&lt;p&gt;本文提出一种名为 Task Navigator 的框架，利用大语言模型作为导航器，将复杂多模态任务逐步分解为更易处理的子问题，并引导多模态大语言模型按步骤求解。该方法无需重新训练模型，而是系统化地调用 MLLM 已有的多种能力，如 OCR、识别、推理等，从而提升复杂任务的处理效果。作者还构建了包含数学推理、嵌入式文本问答和视觉规划等任务的基准，验证了框架的有效性。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
