
一、文章主要内容总结该研究聚焦金融领域问答场景,针对大型语言模型(LLMs)的检索增强生成(RAG)技术展开系统性评估,核心内容如下:研究背景:现有RAG技术在金融文档处理中缺乏向量型与非向量型架构的系统对比,且先进RAG技术对检索精度、答案质量、延迟和成本的实证影响尚不明确。金融文档(如SEC 10-K、10-Q、8-K文件)具有篇幅长、术语专、多跳推理需求高等特点,给问答系统带来独特挑战。研究对象与方案:对比两种检索架构:基于向量的智能体RAG(融合混合搜索与元数据过滤)和基于层级节点的推理系统(无嵌入,通过文档目录结构遍历检索)。评估两种先进增强技术:交叉编码器重排序(提升检索精度)和“从小到大”片段检索(保障上下文完整性)。实验数据:1200份SEC filings文档、150个涵盖单跳、多跳、摘要类的问答对,从检索指标(MRR、Recall@5)、答案质量(LLM-as-a-judge)、延迟、预处理成本四方面评估。核心结论:向量型智能体RAG表现更优:以68%的胜率优于层级节点系统,延迟相当(5.2s vs 5.98s),且能为所有问题检索到相关上下文。交叉编码器重排序效果显著:最优参数(k_initial=10, k_final=5)下,MRR@5从0.160提升至0.750(绝对提升59%),Recall@5达1.00。“从小到大”检