
一、研究问题与动机现有RAG的局限大多数RAG系统局限于单一模态如纯文本和固定粒度如全文或段落的语料库。尽管有多模态RAG出现但它们通常也基于单一模态的语料库。现实需求用户查询可能涉及文本、图像、视频、表格等多种模态且所需信息的粒度从简短片段到完整文档/视频也各不相同。核心挑战将不同模态数据强行嵌入统一空间进行检索会导致模态鸿沟即检索结果偏向于与查询模态相同的条目忽略了跨模态的相关信息。二、提出的方法UniversalRAGUniversalRAG是一个任意到任意any-to-any的RAG框架能够动态路由查询到最合适的模态和粒度语料库。1.模态感知路由不将所有模态合并到一个向量空间。引入路由模块先预测查询所需的模态如文本、图像、视频、表格等。仅在对应的模态特定语料库中进行检索避免模态鸿沟。支持跨模态检索如同时检索文本图像。2.粒度感知路由每种模态内部再分为多个粒度级别如段落、文档片段、完整视频。根据查询复杂度动态选择细粒度如短段落或粗粒度如完整文档的语料。包含“无检索”选项处理无需外部知识的简单查询。3.路由器实现基于训练的路由器利用现有数据集的归纳偏差自动构造标签训练轻量级LVLM作为路由器如Qwen3-VL-2B。免训练路由器直接提示前沿模型如GPT-5进行路由选择适应性强泛化性好。集成策略结合两者优势提升域内准确率和域外泛化能力。三、实验验证评测基准涵盖10个数据集覆盖文本、表格、图像、视频以及多种粒度的RAG任务并包含域外OOD测试集。对比基线包括单模态RAG、统一嵌入多模态RAG如UniRAG、GME、以及多语料库RAG如MultiRAG。主要结果UniversalRAG在所有数据集上平均性能最佳显著优于各类基线。跨模态检索比单模态检索更有效能整合互补证据。粒度感知能避免上下文不足或过载问题提升生成质量。模态路由有效缓解模态鸿沟检索模态分布更均衡召回率更高。效率通过缩小检索空间在大规模语料下延迟亚线性增长优于统一索引方法。鲁棒性在域外数据集上免训练路由器和集成策略表现出良好的泛化能力。四、理论分析模态路由有效性证明当统一空间存在模态偏差时模态感知路由的检索正确率严格优于统一检索。粒度选择优势证明针对不同查询选择不同粒度能获得比固定粒度策略更高的期望质量。效率分析在大规模语料下路由定向检索的延迟远低于全量统一检索。五、贡献总结提出UniversalRAG首个同时支持多种模态和多种粒度的通用RAG框架。模态感知路由机制有效解决模态鸿沟问题实现跨模态精准检索。粒度感知检索根据查询需求动态选择最优信息粒度提升生成质量。灵活的路由器设计支持训练式和免训练式路由器并可通过集成策略兼顾准确性与泛化性。全面的实验验证在10个基准测试上证明其有效性、效率和鲁棒性并提供理论支撑。六、局限与未来方向训练路由器需要自动标注的标签可能存在噪声。当前仅对文本和视频划分了两级粒度未来可引入更细粒度和更丰富的标注。路由器的准确率依赖于数据质量未来可构建人工标注的路由数据集。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示官方项目主页地址在这里如下所示项目主页地址在这里如下所示摘要检索增强生成RAG在通过将与查询相关的外部知识作为模型回答的依据从而提高事实准确性方面已展现出巨大潜力。然而大多数现有方法仅限于纯文本语料库并且尽管近期的研究已尝试将RAG扩展到图像和视频等其他模态但它们通常基于单一模态的特定语料库进行操作。相比之下现实世界中的查询所需的知识类型千差万别单一类型的知识源无法满足所有需求。为解决此问题我们引入了UniversalRAG这是一个任意到任意 (any-to-any)的RAG框架旨在从具有不同模态和粒度的异构源中检索并整合知识。具体而言我们观察到将所有模态强制映射到源自单一聚合语料库的统一表示空间会导致模态鸿沟即检索结果倾向于偏好与查询模态相同的条目。受此启发我们提出了模态感知路由它能够动态识别最合适的模态特定语料库并在其中执行有针对性的检索并通过理论分析进一步证明了其有效性。此外除了模态之外我们将每种模态组织为多个粒度级别从而实现针对查询复杂性和范围的精细化检索。我们在10个覆盖多种模态的基准测试上验证了UniversalRAG结果表明其性能显著优于各种模态特定和统一检索的基线方法。图1对比现有RAG策略与我们提出的UniversalRAG的概念示意图。1. 引言大型语言模型LLMs在各种任务中展现出了卓越的性能并已被广泛用于协助用户的日常生活Gemini Team, 2023; OpenAI, 2025。然而LLMs常常生成事实错误或具有误导性的信息尤其是在那些它们在训练期间接触较少或未曾接触的主题上Zhang et al., 2025d; Huang et al., 2025。为了解决这个问题检索增强生成RAG已成为一种有前景的方法它允许模型的回答以从外部知识源检索到的与查询相关的知识为依据从而提高事实准确性Lewis et al., 2020; Gao et al., 2023; Chen et al., 2024a。尽管RAG很有效但现有方法通常为单一语料库和模态设计这限制了它们处理需要多样化知识源的查询的能力。在实际应用中如图1所示用户查询所需的知识类型差异很大有些问题最好通过文本例如表层事实来回答另一些问题则需要通过图像或视频空间或时间线索进行视觉理解还有一些问题则需要这些模态的组合。然而RAG领域主要起源于文本语料库Lewis et al., 2020; Jiang et al., 2023; Yan et al., 2024尽管近期的努力已将其扩展到文本之外的模态如图像和视频Abootorabi et al., 2025; Jeong et al., 2025; Shalev-Arkushin et al., 2026但现有的RAG方法单独考虑时通常是特定于模态和语料库的因此它们作为能够灵活处理知识需求各异的广泛查询的通用型“一揽子”框架可能并非最优选择。在这项工作中我们提出了UniversalRAG一个新颖的任意到任意 RAG 框架它汇聚了分布在多个模态特定语料库中的知识并利用这些知识在通用工作流程中为查询生成有依据的回答。为实现此目标一种直接的方法可能是聚合来自收集到的异构知识库中的所有条目并使用多模态编码器该编码器通常经过训练能在语义相似的输入来自不同模态时将它们对齐将它们嵌入到一个统一空间中。然而我们发现尽管进行了对齐努力但这种策略仍会受到模态鸿沟Liang et al., 2022; Meng et al., 2026的影响即输入倾向于根据其模态而非语义相关性进行聚类见图2和图7的可视化。结果检索过程偏向于与查询共享相同模态的知识源而忽略了来自其他模态的相关内容。图2统一嵌入空间的t-SNE图。2022; Meng et al., 2026即输入倾向于根据其模态而非语义相关性进行聚类见图2和图7的可视化。结果检索过程偏向于与查询共享相同模态的知识源而忽略了来自其他模态的相关内容。为了解决这一挑战我们没有将所有模态强制放入单个嵌入空间而是采取了不同的方向引入了模态感知路由。UniversalRAG 预测查询的模态需求并将检索路由到相应的模态特定语料库当查询需要跨模态证据时可能涉及多个语料库之后检索到的知识被联合用于生成回答。值得注意的是这种策略不仅通过避免跨模态比较来规避模态鸿沟而且还可以通过扩展路由逻辑来无缝集成新模态而无需修改现有的模态特定检索器。除了模态数据粒度即语料库中每个条目的大小或单位也会影响检索精度和生成质量Chen et al., 2024b; Zhong et al., 2025因为即使在同一模态内不同的查询也可能受益于不同的粒度过于细粒度的条目可能会稀释上下文而过于粗粒度的条目则可能捆绑不相关的信息。例如复杂的分析性问题可能需要完整的文档或视频而简单的事实性问题则更适合用单个段落或短视频片段来回答。为了适应这一点我们进一步将每种模态分解为多个粒度级别并将它们组织成不同的语料库。例如文档被进一步分割成段落并存储在段落级语料库中类似地视频被分割成短视频片段并存储而图像则因其本质上是独立的而保持原样。总的来说通过建立这些模态和粒度感知的语料库包括段落、文档、表格、图像、片段和视频以及一个额外的“无检索”选项来高效处理那些无需外部知识的直接查询我们的UniversalRAG能够动态地将每个查询路由到最相关的知识源最终支持现实世界用户多样化的信息需求。我们在10个覆盖不同模态和粒度的数据集上验证了UniversalRAG其在平均性能上大幅优于所有基线证明了其在处理各种类型查询方面的有效性。此外UniversalRAG通过模态感知检索和适当的粒度选择提高了效率同时在分布外数据集上保持了鲁棒性。2. 方法我们从描述预备知识开始。2.1. 预备知识2.2. UniversalRAG我们引入 UniversalRAG它能够动态识别查询并将查询路由到最合适的模态和粒度以进行有针对性的检索。2.3. 路由器实现策略UniversalRAG 的一个关键组件是路由器它负责为查询确定最优的知识模态和粒度。基于训练的路由器为了执行路由任务我们首先考虑训练可用模型来预测每个查询的适当模态-粒度对。然而由于关于查询应路由到何种模态和粒度的真实标签不可用我们利用现有基准测试中的归纳偏差将每个数据集映射到与其任务特征匹配的路由目标从而允许我们在无需手动标注的情况下自动获得带标签的语料库。然后我们使用多热标签表示和交叉熵损失来训练开源 LVLMs 作为路由器。在推理时路由器生成关于模态-粒度对的 sigmoid 分布并返回所有分数超过预定义阈值的配置从而在必要时实现跨模态和多粒度检索。免训练路由器或者我们也探索了一种免训练的方法该方法利用现代前沿模型如 Gemini Gemini Team, 2023的广泛知识和强大的推理能力。该模型并非从标记数据中学习而是直接被提示prompt以充当路由器。为实现此目标我们首先设计用于引导路由的提示模板该模板描述了目标并包含了演示不同类型查询如何对应特定检索目标的示例详见 Figure 8。然后在推理时使用此模板提示模型以从预定义集合中预测最合适的模态-粒度对。这消除了对监督标签或任务特定训练的需求提供了适应新领域的灵活性。3. 实验表1使用 Qwen3-VL-8B-Instruct 的不同 RAG 方法在不同模态上的结果。加粗表示最佳性能下划线表示 UniversalRAG 变体使用基于训练或免训练路由器中的次优性能。R-L 和 BERT 分别代表 ROUGE-L 和 BERTScore。3. 实验3.1. 实验设置我们现在解释实验设置包括数据集、模型和实现细节。数据集为了评估 UniversalRAG我们编译了一个全面的基准测试涵盖了跨越七种模态和粒度的 RAG 任务。对于“无检索”设置我们使用 MMLU (Hendrycks et al., 2021)。对于基于文本的 RAG我们包括用于单跳、段落级检索的 Natural Questions (NQ) (Kwiatkowski et al., 2019) 和用于多跳、文档级检索的 HotpotQA (Yang et al., 2018)。为了考虑不同场景我们包括用于文本和表格推理的 HybridQA (Chen et al., 2020)用于图像 RAG 的 MRAG-Bench (MRAG) (Hu et al., 2025)以及用于跨模态文本和图像RAG 的 WebQA (Chang et al., 2022) 和 InfoSeek (Chen et al., 2023a)。最后对于视频 RAG我们使用用于短时或局部视频片段查询的 LVBench (Wang et al., 2025a)以及用于基于长视频或完整视频查询的 VideoRAG-Wiki 和 VideoRAG-Synth (Jeong et al., 2025)。更多细节请参考 A 节。知识语料库为了支持上述多样化的、具有不同模态和粒度的 RAG 场景我们考虑它们对应的语料库。回顾一下我们定义了七个路由路径无、段落、文档、表格、图像、片段和视频跨模态路由允许查询跨越多种模态。对于段落和文档语料库我们分别使用段落级别 (Karpukhin et al., 2020) 和文档级别 (Jiang et al., 2024b) 的 Wikipedia。表格语料库通过从 HybridQA 基准测试中收集表格构建。对于图像我们采用来自 MRAG-Bench、WebQA 和 InfoSeek 数据集的语料库。最后我们构建了两个不同规模的视频语料库一个是由 LVBench 和 VideoRAG 数据集中的完整视频组成的视频级语料库另一个是通过将这些视频分割成多个短视频片段而构建的片段级语料库。图4检索到的数据模态分布。方法我们将我们的 UniversalRAG 与12个不同的基线进行比较分为四组。第一组是Naive它直接回答查询而不检索外部知识。此外单模态 RAG组包括 ParagraphRAG、DocumentRAG、TableRAG、ImageRAG、ClipRAG 和 VideoRAG 方法这些方法仅从其各自的语料库中检索信息并用于生成回答。第三组统一嵌入多模态 RAG使用多模态编码器将不同模态对齐到共享嵌入空间进行检索包括 UniRAG (Sharifymoghaddam et al., 2025)、GME (Zhang et al., 2025b)、PEcore (Bolya et al., 2025) 和 VLM2Vec-V2 (Meng et al., 2026)。MultiRAG被包含在最后一组多语料库多模态 RAG中它在所有可用语料库上进行检索并将检索结果整合用于生成回答。值得注意的是由于 UniversalRAG 可以通过不同的路由策略操作我们实现了基于训练的变体利用 Qwen3-VL-2B-Instruct (Bai et al., 2025)、InternVL3.5-1B (Wang et al., 2025b) 和 T5Gemma 2 270M (Zhang et al., 2025a)在自动构建的路由数据集上微调以及免训练变体提示 GPT-5 (OpenAI, 2025) 和 Qwen3-VL-8B-Instruct (Bai et al., 2025) 选择适当的模态-粒度对。最后我们包含了一个Oracle设置它将每个查询路由到其理想的语料库该设置与其他方法不具有可比性。实现细节对于回答生成我们使用多个 LVLM包括 Qwen3-VL-8B-Instruct (Bai et al., 2025)、InternVL3.5-8B (Wang et al., 2025b) 和 Molmo2-4B (Clark et al., 2026)。此外为了利用 UniversalRAG 将检索过程路由到模态特定语料库的优势我们使用模态特定的编码器用于文本的 Qwen3-Embedding-4B (Zhang et al., 2025c)用于视觉的 VLM2Vec-V2 (Meng et al., 2026)以及用于表格的与文本编码器结合的密集行级嵌入 (Ji et al., 2024)。我们在 B 节提供了更多细节包括路由器训练。3.2. 实验结果与分析现在我们展示在不同 RAG 场景下的总体结果随后进行详细分析。总体结果我们在表1中展示了模态和粒度特定的结果并在图3中展示了不同 LVLM 的平均结果从中我们观察到 UniversalRAG 在平均性能上始终达到最佳。具体来说表1中与单模态 RAG 基线比较的结果证实了我们的假设即从与查询信息需求最匹配的模态或粒度进行检索能够获得最高准确率然而查询与检索源之间的不匹配会导致性能显著下降这支持了我们的主张即在通用工作流程中考虑多样化模态对于现实世界的 RAG 是必要的。此外每种模态内的粒度水平也会影响性能这表明细粒度的检索和生成是必要的。除此之外UniversalRAG 显著优于统一嵌入的多模态 RAG 基线证实了其中固有的模态鸿沟问题见图2和图7。最后与 MultiRAG 基线属于多语料库多模态 RAG 类别相比后者由于在生成中包含了来自无关模态的噪声而导致性能次优我们的 UniversalRAG 仍然保持有效。其强大性能归功于其核心思想——模态感知路由使其能够动态地从最相关的模态和粒度进行检索尽管使用了多个语料库但仍能获得性能提升。跨模态检索的有效性虽然许多查询可以通过使用单一的最主要模态来解决但某些任务受益于整合来自多种模态的证据。例如HybridQA 需要跨越结构化表格和附带文本来源的推理而 WebQA 则涉及将文本与图像配对的视觉基础问题。表2显示与单模态检索每个查询路由到单一相关源相比跨模态检索持续获得更强的性能。通过允许查询跨多个模态路由跨模态检索可以利用互补的证据而这些证据是单模态方法可能会遗漏的。这些结果突显了 UniversalRAG 灵活路由机制的有效性该机制能够动态地从多个源检索信息而不是依赖单一模态。模态路由的有效性为了研究我们路由方法的有效性我们在图4中比较了 VLM2Vec-V2、GME 和 UniversalRAG使用 Qwen3-VL-2B检索到的模态分布。通过对每个基准测试的200个采样查询并归一化分布我们发现 VLM2Vec-V2 仅检索文本而 GME 同样表现出强烈的文本偏好无论查询所需模态如何这反映了统一嵌入空间固有的模态鸿沟。相比之下UniversalRAG 在模态间检索更为均匀表明路由器有效地减轻了模态偏差并自适应地选择了适当的知识源。这导致了更高的模态检索准确率并因此获得更高的检索召回率如表3所示。尽管 GME 在文本和图像语料库上达到了相当的召回率但它无法从正确的模态准确检索导致在多模态包括视频语料库上的召回率较低。然而UniversalRAG 始终从正确的模态进行检索使其在所有场景下都能达到比基线更高的召回率。多粒度的有效性鉴于表1中观察到的语料库选择带来的益处我们通过在不同粒度级别上比较 UniversalRAG 来研究其超越模态的影响¹。表4显示结合粒度感知的语料库选择能够带来持续的性能提升因为它避免了检索那些要么不足例如缺少多跳推理关键实体的短段落要么过度例如当仅需短视频片段时却检索完整视频的上下文这两者都可能阻碍准确的回答生成。此外随着引入额外的粒度级别我们在某些情况下观察到进一步的改进尽管收益并非在所有任务中都严格单调增加这反映了上下文充分性与噪声之间的权衡。关于支持这些发现的理论分析请参见 C.2 节。表4不同粒度数量 (#Gn) 下免训练路由器模型的性能比较。用于路由到更细粒度的提示如图9所示。表5两种设置下检索方法的路由器准确率和生成性能。在 UniversalRAG 变体中GPT-5 是唯一的免训练路由器。模态特定检索的效率除了准确性之外UniversalRAG 还通过缩小搜索空间来提高效率它利用模态和粒度感知的路由将检索限制在最相关的源上而不是查询一个聚合了所有模态的巨型语料库的统一嵌入索引。此外路由的开销很小因为在大规模下这一成本被搜索空间的大小所抵消导致随着语料库大小的增加延迟呈亚线性增长如图5所示。在此UniversalRAG 在大型语料库规模下最终实现了比统一嵌入方法更低的延迟并且在非常大的规模超过1000万条目下差距进一步扩大。这种可扩展性使 UniversalRAG 成为现实世界应用的实用解决方案在这些应用中语料库通常比我们的实验设置大得多。我们在 C.3 节提供了效率方面的深入理论分析。路由器规模分析为了检验是否可以通过使用更小的模型作为路由器来进一步降低路由成本而不牺牲准确性我们训练了三个参数范围从256M到4B的模型 (Wang et al., 2025b; Zhang et al., 2025a; Marafioti et al., 2025) 并测量了路由器准确率。如图6所示在每种架构内路由器准确率随模型规模的增加而持续提高这表明了我们路由方法的可扩展性。虽然最大的模型达到了近乎完美的路由性能但一个1B参数的模型达到了大约 90%90% 的准确率表明紧凑型模型可以作为 UniversalRAG 中有效的路由器。在域外场景的泛化能力如表1所示带有训练路由器的 UniversalRAG 优于免训练路由器有时甚至接近 Oracle 性能一个自然的问题是这些路由器在未见过的、域外OOD数据集上的表现如何。为了研究这一点我们在六个 OOD 数据集上进行了评估详见 A.2 节结果如表5和表10所示。与域内设置相比训练路由器表现出明显的性能下降而免训练路由器则能稳健地泛化甚至超越了训练变体。尽管如此UniversalRAG 在 OOD 场景中仍然有效并且始终优于所有基线包括那些使用统一嵌入空间或随机分配模态和粒度的基线突显了自适应、模态和粒度感知检索的优势。用于鲁棒路由的集成策略基于训练路由器在域内的高准确率和免训练路由器在 OOD 的强泛化能力之间的权衡我们提出了集成策略以利用它们的互补优势。具体来说我们探索了基于置信度的集成当训练路由器的置信度超过阈值时使用其预测否则回退到免训练路由器的预测以及多数投票从三个路由器基于训练的和免训练的中选择多数预测并在必要时随机打破平局。表5显示采用集成路由的 UniversalRAG 在准确性和泛化性之间实现了稳健的平衡使其非常适合具有未见或变化分布的现实世界场景。案例研究我们在表6中展示了一个 UniversalRAG 的案例研究。该查询询问密歇根士兵和水手纪念碑上的人物雕像数量。TextRAG 和 ImageRAG 都检索到了相关且正确的证据然而单独使用任何一种模态都不足以确定完整数量。TextRAG 缺乏汇总所有雕像所需的信息而 ImageRAG 则因部分遮挡而受限。VideoRAG 未能检索到相关证据因为视频语料库不包含对此查询有用的信息。相比之下UniversalRAG 将查询路由到“段落”和“图像”语料库允许进行跨模态推理并正确识别出全部九座雕像。更多案例研究见 F 节。表6将具有固定模态和粒度的单模态 RAG 与 UniversalRAG (我们的方法) 进行对比的案例研究。4. 相关工作大型视觉语言模型在 LLMs 显著性能的基础上 (Gemini Team, 2023; OpenAI, 2024)近期的研究已将它们扩展到视觉领域。Liu 等人 (2023) 整合了基于 CLIP 的 (Radford et al., 2021) 图像编码器将视觉输入与语言表示对齐随后出现了使用不同编码器的模型 (Bai et al., 2023; Chen et al., 2024c; Liu et al., 2024) 以及扩展到视频的模型 (Li et al., 2025a; Wang et al., 2025b; Bai et al., 2025)。然而尽管由于更大的数据集和改进的架构在多模态基准测试上 (Mathew et al., 2021; Yue et al., 2024; Li et al., 2024; Fu et al., 2025) 性能有所提升但当仅依赖参数化知识时LVLMs 仍然常常遭受幻觉问题 (Huang et al., 2025)。检索增强生成为了解决上述仅参数化模型的局限性RAG 在回答生成过程中融入了外部知识。虽然传统的 RAG 专注于文本语料库 (Lewis et al., 2020; Ram et al., 2023)但近期的工作已将其扩展到多模态源如图像和视频 (Chen et al., 2022; Jeong et al., 2025; Shalev-Arkushin et al., 2026)。然而这些方法假设固定的单模态检索这使得它们难以适应可能需要来自不同模态信息的现实世界查询。多模态编码器 (Radford et al., 2021; Zhang et al., 2025b; Bolya et al., 2025; Meng et al., 2026) 能够实现跨模态的统一嵌入空间Sharifymoghaddam 等人 (2025) 从这些空间中进行检索但常常无法为文本查询检索到视觉内容。RAG-Anything (Guo et al., 2025) 通过将所有多模态知识转换为文本形式来规避这一问题但这以大量的预处理和丢失模态特定信息为代价。其他方法 (Cui et al., 2024; Liu et al., 2025a) 从所有模态检索随后进行额外的选择机制这带来了显著的计算成本。最后自适应检索策略 (Jeong et al., 2024; Islam et al., 2024; Ding et al., 2025; Yao et al., 2025; Tang et al., 2025) 解决了查询多样性的问题但仍局限于单一语料库 (Zhang et al., 2024; Li et al., 2025b)。检索粒度虽然大多数现有的 RAG 方法以固定粒度例如完整文档、段落或句子操作但现实世界的查询通常需要根据所需知识的不同而具有不同级别的特定信息这反过来影响文本 (Chen et al., 2024b; Liu et al., 2025b; Zhong et al., 2025) 和基于视频的检索系统 (Chen et al., 2023b) 的性能和效率。相比之下UniversalRAG 在模态和粒度维度上执行查询级路由从而能够从最相关的源和适当的级别进行检索。5. 结论在本文中我们提出了 UniversalRAG一种新颖的 RAG 框架旨在从具有不同模态和粒度的语料库中进行检索。通过模态和粒度感知的路由机制UniversalRAG 动态地为每个查询选择最合适的知识源有效地解决了模态鸿沟和固定粒度检索带来的局限性我们通过理论结果进一步证明了这一点。在10个基准测试上的实证评估表明UniversalRAG 优于模态特定和统一的基线展示了其在各种模态上的鲁棒性能。此外我们的分析强调了细粒度检索的重要性以及免训练和训练路由器的互补优势。我们相信这些发现证明了 UniversalRAG 作为用异构外部知识为 LVLMs 提供依据的自适应解决方案的潜力为统一支离破碎的现有语料库特定 RAG 的一揽子 RAG 铺平了道路。局限性所提出的 UniversalRAG 旨在利用 RAG 中的异构多模态语料库通过语料库感知路由灵活地利用模态和粒度特定的语料库。值得注意的是路由机制是其核心部分为了提高其准确性可能需要高质量的样本进行训练然而现有的数据集或基准测试缺乏指示每个查询理想模态或粒度的真实标签。尽管如此我们通过自动标注查询基于数据集固有的归纳偏差或使用所有可用语料库测量的下游性能来解决这一问题详见 A 节。然而由于这些标注可能包含一些噪声构建高质量的人工标注路由数据集将是未来一个有价值的方向。此外由于类似的原因缺乏标注数据特别是查询-粒度对我们将每个文本和视频模态分割为两个粒度级别以获得路由器训练的监督信号。同样收集覆盖更广泛查询-模态和查询-粒度对的更细粒度标注将是扩展 UniversalRAG 适用性的一个令人兴奋的方向。附录论文补充材料A. 关于数据集的更多细节表7提供了我们实验中使用的所有数据集及其对应知识语料库的概览包括目标模态类型以及查询和语料库的大小。我们将每个数据集按3:7的比例划分为训练集和测试集。每个数据集的详细信息如下。表7域内和域外基准测试的数据集摘要。平均语料库长度表示文本语料库的平均令牌数视频语料库的平均时长。A.1. 域内数据集MMLU作为包含无需检索即可回答的查询数据集我们使用 MMLU (Hendrycks et al., 2021)这是一个涵盖广泛任务的基准测试包括问题解决能力例如初等数学、计算机科学和世界知识例如法律、世界宗教。具体来说我们使用开发分集中所有任务的问题。Natural Questions (NQ)我们还使用 Natural Questions (Kwiatkowski et al., 2019)这是一个由提交给谷歌搜索引擎的真实用户查询组成的问题回答数据集其答案基于支持的维基百科文章进行标注。我们从开发分集中随机采样了2,000个问答对并通过将维基百科语料库分割成最多100个词的段落来构建文本语料库。HotpotQAHotpotQA (Yang et al., 2018) 是一个基于维基百科的问答基准但它包含需要推理多篇文章的复杂查询。我们使用了测试分集中随机采样的2,000个问答对。由于它需要对多个文档进行多跳推理我们按照 LongRAG (Jiang et al., 2024b) 的方法将多个相关文档分组构建文本语料库其长度可超过4K个令牌。HybridQAHybridQA (Chen et al., 2020) 是一个需要同时推理表格和文本信息的基准测试。每个问题都基于一个维基百科表格但通常需要链接到相关的文本信息才能找到正确答案。我们从开发分集中随机采样了2,000个问答对。与原始基准测试直接将表格和文本证据连接不同我们将它们分成独立的表格和文本语料库以更好地验证我们基于模态特定路由的检索框架。MRAG-Bench (MRAG)我们使用 MRAG-Bench (Hu et al., 2025)一个以视觉为中心的 RAG 基准测试它仅需要相关图像而不依赖其他模态并评估了所有1,353个问题。与传统的纯文本查询不同MRAG-Bench 中的每个查询都是多模态的包含穿插了查询图像的文本问题。我们通过收集所有问题中的图像来构建一个单一图像语料库。WebQAWebQA (Chang et al., 2022) 是一个旨在评估 LVLMs 在开放域环境中对包括文本和图像在内的多个信息源进行推理能力的基准测试。由于该数据集最初是使用特定于问题的检索源结合了文本和图像构建的我们提取了需要检索图像来回答的问题子集。然后我们使用 GPT-4o (OpenAI, 2024) 并使用图10所示的提示进一步过滤这些子集以确保问题不特定于某张图像最终得到2,000个问答对。最后我们通过提取和聚合每种模态的证据构建了独立的文本和图像语料库。InfoSeekInfoSeek (Chen et al., 2023a) 是一个开放域基准测试包含与图像交错的问题最好通过检索相关的文本和视觉信息来回答。在我们的实验中我们从开发分集中采样了2,000个问答对并收集与每个问题关联的文本和图像证据以构建相应的文本和图像语料库。LVBenchLVBench (Wang et al., 2025a) 是一个为长视频理解开发的基准测试其问题由标注者基于平均时长超过一小时的 YouTube 视频生成。由于该基准测试最初是为非 RAG 任务设计的我们使用 GPT-4o 将原始的视频与文本交错查询重新表述为纯文本格式以符合我们的实验设置并使用了视频元数据和提示图11。每个查询都与一个特定的视频和一个对应的时间范围相关联。值得注意的是大多数查询标注的时间戳跨度不到五分钟因此聚焦于较长视频中的短片段。由于某些视频目前不可用我们对可用视频及其对应问题进行了评估。在训练中我们使用这些短时间戳查询作为片段级数据集。VideoRAG我们还使用了 VideoRAG-Wiki 和 VideoRAG-Synth 基准测试它们由 VideoRAG (Jeong et al., 2025) 引入旨在评估基于视频语料库的 RAG。这些基准测试建立在 HowTo100M (Miech et al., 2019) 语料库一个大规模的教学性 YouTube 视频集合之上其查询分别来源于 WikiHowQA (Bolotova-Baranova et al., 2023) 和基于视频合成的问答对。由于它们缺少时间戳标注我们使用 GPT-4o 来识别那些更适合通过完整视频检索而非来自真实视频的短片段的查询然后将这些查询作为视频级数据集来训练路由器。A.2. 域外数据集与域内数据集不同域外数据集仅用于评估以评估我们路由方法的泛化能力并且仅由测试分集组成。TruthfulQATruthfulQA (Lin et al., 2022) 包含旨在测试 LLMs 是否能避免常见错误信念或误解的通用知识问题涵盖健康、法律和政治等多个类别。我们使用该数据集的多项选择题版本每个问题只有一个正确答案。TriviaQATriviaQA (Joshi et al., 2017) 是一个阅读理解数据集包含来自维基百科和网络的事实型问题及其对应的证据文本。为了区分需要文本检索和不需要检索的查询我们根据 GPT-4o 是否能在不借助外部文本的情况下给出精确匹配的答案来对每个查询进行分类。我们从开发分集中随机采样问答对。遵循 SQuAD 和 NQ 中使用的预处理策略所有支持证据文档都被分割成不超过100个词的段落。SQuADSQuAD v1.1 (Rajpurkar et al., 2016) 是一个基准数据集包含由众包工作者基于一组维基百科文章生成的问题。每个问题都可以在给定的上下文中找到答案。从数据集的100,000多个问答对中我们从开发分集随机采样2,000对。对于上下文检索我们使用提供的完整维基百科语料库将每篇文章分割成最多100个词的段落。2WikiMultiHopQA我们还使用了 2WikiMultiHopQA (Ho et al., 2020)这是一个旨在评估跨两篇维基百科文章进行多跳推理的基准测试。我们从开发分集随机采样2,000个问答对并通过为每个问题聚合所有标注的候选段落级上下文来构建文档级语料库。Visual-RAGVisual-RAG (Wu et al., 2025) 是一个为视觉知识密集型问题设计的问答基准测试专门针对文本到图像的检索任务。我们使用提供的所有查询但每类采样五张图像来构建图像检索池以确保高效的文本到图像检索。CinePileCinePile (Rawal et al., 2025) 是一个长视频问答基准测试包含基于 YouTube 电影片段的问题。由于该基准测试最初是为视频理解任务而非 RAG 设计的我们使用与 LVBench 相同的方法重新表述每个查询。对于144个可用视频中的每一个我们从测试分集中随机选择10个问题。由于 CinePile 不提供粒度标注我们使用 GPT-4o 将问题分为两类如片段级和完整视频级粒度遵循与 VideoRAG 相同的方法。A.3. 评估指标我们使用标准指标报告结果。对于多项选择题的数据集我们报告Top-1 准确率 (Acc)即正确回答问题的比例。对于简答题数据集我们使用精确匹配 (EM)和F1分别衡量预测与参考答案之间的精确一致性和词级重叠度对于 InfoSeek我们使用原始论文和官方代码库中定义的自定义准确率指标。对于答案较长的自由形式数据集我们使用ROUGE-L它捕捉预测和参考答案之间最长公共子序列 (Lin, 2004)以及BERTScore它评估它们的语义相似性 (Zhang et al., 2020)。我们报告平均分数即首先在每种模态内取平均然后跨模态取平均。结果是在有限计算资源下从单次运行获得的同时我们通过在多个骨干模型上的验证来确认我们框架的通用性。B. 更多实现细节为了有效利用视觉和文本信息进行视觉元素检索我们采用了一种集成方法以0.8的权重系数结合视觉和文本相似度分数。文本信息包括图像标题和视频脚本。为了处理长视频我们使用PySceneDetect(Castellano, 2014)这是一个开源工具通过分析内容变化例如颜色直方图差异或基于阈值的检测来检测场景边界将长视频分割成平均时长不超过3分钟的短视频片段。此外对于检索和生成阶段我们统一为每个视频采样32帧。对于那些本身不支持视频输入的基线模型特别是 UniRAG使用 CLIP和 GME我们对这些采样帧的嵌入进行平均以获得一个单一的代表性嵌入向量。基于训练的路由器在骨干模型之上使用一个轻量级分类头为多标签预测生成 logits。多标签目标被转换为多热向量训练通过在这些目标和预测 logits 之间使用二元交叉熵损失进行。路由器训练5个周期学习率为2e-5LoRA 秩为 r32。在推理时路由决策使用预定义的阈值0.8选择所有 sigmoid 概率超过该阈值的模态-粒度组合。相比之下对于免训练变体我们使用一个精心设计的提示来提示模型该提示指定了任务目标并包含少量示例如图8所示。大多数实验在配备96GB VRAM 的 NVIDIA RTX Pro 6000 Max-Q GPU 上进行。C. UniversalRAG 的理论分析在本节中我们对 UniversalRAG 的每个模块进行形式化分析包括模态路由C.1节和多粒度C.2节的有效性以及模态感知路由C.3节的效率。C.1. 模态路由的有效性为了严格分析模态路由的有效性我们重述命题2.1并提供完整证明。C.3. 模态特定检索的效率虽然第3.2节的实证结果展示了模态感知路由的效率优势延迟趋势如图5所示但我们对其计算优势提供了更严谨的分析。设 N 表示每个模态和粒度特定语料库的大小为简化起见假设语料库大小均匀k 为可用路由选择的数量即模态-粒度对的数量。在统一嵌入方法下检索是在一个规模为 kN 的单一聚合语料库上进行的其搜索成本与总语料库规模成比例。相比之下UniversalRAG 首先执行轻量级路由以选择最相关的模态-粒度子集然后仅在选定的小子集上进行检索。命题 C.4.设 T(m) 表示在固定检索后端下对规模为 m 的语料库进行单次查询的预期检索延迟并设路由成本为固定常数 C与可用路由选择数量 k1 无关。那么在大规模语料库上UniversalRAG 实现的延迟低于统一嵌入空间检索。D. 更多实验结果D.1. 使用不同 iVLM 的额外结果表8显示了使用 InternVL3.5-8B 和 Molmo2-4B 作为生成模型时基线和 UniversalRAG 模型在10个基准测试上的详细生成结果。在这两种设置下UniversalRAG 均优于所有基线并取得了与 Oracle 相当的平均分数。这些结果表明 UniversalRAG 在各种 LVLM 生成器中具有鲁棒性和泛化性。表8使用不同 LVLM (InternVL3.5-8B 和 Molmo2-4B) 的不同 RAG 方法在不同模态上的结果。加粗表示最佳性能下划线表示 UniversalRAG 变体使用基于训练或免训练路由器中的次优性能。R-L 和 BERT 分别代表 ROUGE-L 和 BERTScore。D.2. 关于多粒度的额外结果表4展示了两种免训练模型在粒度级别数量与端到端性能之间的关联利用了我们的方法在无标注数据场景中的灵活性。我们将此分析扩展到基于训练的路由器比较了有无粒度时的性能。表9报告了三种基于训练的路由器模型的结果一致表明在纳入粒度时具有性能优势。这些发现强调了在免训练和基于训练的方法中将粒度纳入路由决策的有效性。表9基于训练的路由器模型的粒度对性能的影响。Gn 表示粒度 (Granularity)。表10在域外数据集上使用 Qwen3-VL-8B-Instruct 的不同 RAG 方法在不同模态上的结果。加粗表示最佳性能下划线表示 UniversalRAG 变体使用基于训练或免训练路由器中的次优性能。R-L 和 BERT 分别代表 ROUGE-L 和 BERTScore。图7各种多模态编码器的统一嵌入空间可视化。D.3. 域外数据集的详细结果我们在表10中提供了 UniversalRAG 变体和基线方法在每个域外数据集上的生成结果。总体而言UniversalRAG 在平均性能上始终优于所有基线。值得注意的是免训练路由器变体在所有数据集上都表现出强劲的性能显示了它们对未见查询的卓越泛化能力。相比之下训练路由器在域外数据集上的性能低于在域内数据集上的表现然而它们仍然保持鲁棒性并大幅超越基线方法。E. 统一嵌入空间中的模态鸿沟图7可视化了六个多模态编码器 (Jiang et al., 2024a; Bolya et al., 2025; Lin et al., 2025; Zhang et al., 2025b; Meng et al., 2026; Li et al., 2026) 的统一嵌入空间中的模态鸿沟。PCA 图显示嵌入按模态聚类文本嵌入以绿色显示与其他模态的嵌入距离更大。E5-V、GME 和 Qwen3-VL-Embedding 等近期方法专注于更好地对齐这些模态以缩小差距。然而尽管做出了这些努力模态之间仍然存在明显的分离表明当前的多模态编码器仍难以完全统一文本、图像和视频的嵌入空间。因此UniversalRAG 的模态路由机制是必要的它能够将每个查询动态地引导到其对应的模态特定嵌入空间从而有效弥合模态鸿沟并增强检索性能。F. 定性结果我们提供案例研究以展示 UniversalRAG 的有效性。表11比较了各种 RAG 方法包括传统的单模态方法和 UniversalRAG在 WebQA 数据集查询上的结果。传统方法如 TextRAG 和 VideoRAG 未能生成准确答案TextRAG 检索到的段落缺乏相关的视觉细节而 VideoRAG 更适用于时间推理任务。相比之下UniversalRAG 正确地将查询路由到图像模态识别出关于颜色的视觉信息是必需的并成功生成了正确的回答。这突显了模态感知路由在利用来自正确模态语料库的适当数据方面的优势展示了 UniversalRAG 自适应选择信息最丰富的模态和粒度以生成准确答案的能力。除了模态路由我们还观察到 UniversalRAG 也能从以适当粒度检索信息中获益。表12显示了 HotpotQA 的结果该查询需要对多个文本源进行复杂推理。虽然段落级粒度无法为推理提供足够的上下文但 UniversalRAG 将查询路由到文档级语料库以检索准确推理所需的所有文本信息。类似地对于视频查询表13显示了 LVBench 上的结果该查询仅需要完整长视频中的短视频片段来回答。虽然完整视频级检索包含不相关内容并且均匀采样的帧无法捕获必要信息但片段级检索表11案例研究单模态 RAG 与 UniversalRAG (我们的方法) 的比较。传统的 RAG 模型受限于模态特定的检索常常遗漏来自其他模态的相关知识。UniversalRAG 动态地将每个查询路由到最合适的模态从而实现更准确的检索和回答生成。表12案例研究比较不同文本粒度的效果。用户查询需要涉及多个实体的复杂检索。ParagraphRAG 检索到的上下文范围有限聚焦于单个实体导致回答错误。UniversalRAG 将查询路由到文档语料库并检索到更丰富的文档级信息使其能够捕获两个相关实体并生成正确的回答。表13案例研究比较不同视频粒度的效果。用户查询仅需要视频的一个片段来确定答案。VideoRAG 检索视频中的广泛帧范围可能包含不相关内容或遗漏关键帧导致回答错误。UniversalRAG 将查询路由到片段级粒度检索到更聚焦和相关的视觉信息使其能够生成正确的回答。表14案例研究比较 UniversalRAG 在单模态和跨模态场景下的表现。在单模态设置中仅使用单一显著模态信息有时可能不完整因为它们需要跨模态的证据。UniversalRAG 具有跨模态能力可以从多种模态收集证据以生成更全面的回答。表15UniversalRAG 模态路由的失败案例。图8免训练查询路由的提示。图9具有额外粒度选择的免训练查询路由提示。仅显示与图8不同的部分包括任务目标和少量示例。图10用于过滤 WebQA 查询的提示。图11用于为 LVBench 重新表述查询的提示。