ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

RAG检索评测指标原理及应用(纯小白简单易懂)

RAG检索评测指标原理及应用(纯小白简单易懂) 一、样本分类真实的正样本真实的负样本模型预测为正样本TP(True Positive)FP(False Positive)模型预测为负样本FN(False Negative)TN(True Negative)一、准确率公式全局所有文档里模型预测正确的占比它要求正负样本分布均衡。准确率正负样本数量大致均衡且你关心全局整体预测对错准确率才有参考意义。1、典型能用准确率的场景1正负样本均衡的二分类任务最常用样本里正、负样本数量差不多。 举例图片分类区分猫 / 狗样本对半分。公式表现TP、TN 体量接近FP、 FN增加会明显拉低准确率指标能真实反映模型好坏。2多分类任务比如手写数字识别0~9 十类、商品品类分类各类别样本分布均匀时整体准确率是核心评价指标。二、准确率Accuracy不适用于评测RAG检索但RAG 检索是典型负样本远多于正样本候选文档几千 / 上万相关文档只有少数在公式层面上就是说如果一个模型正常的话TN是远大于TP、FP、FN的哪怕模型全返回无关文档FPTP0啥有用内容都没返回但因为绝大多数无关文档都被判断正确TN 极多全局准确率依然接近 100%指标完全失效。二、RAG检索评测指标原理及应用一检索阶段指标向量匹配环节检索质量1、精确率Precision可以把精确率理解为查准率公式只看模型预测为正样本的样本也就是RAG检索返回的内容分母是所有模型预测为正样本(有可能把负样本预测为正样本即NP的样本数分子是真实样本为正样本且模型预测为正样本的样本数。作用评测检索返回文档的纯净度。精确率低代表向量库检索到大量无关文档。无关文档会干扰大模型产生幻觉。2、召回率recall可以把召回率理解为查全率公式分母是全部真实的正样本FPNP可以理解为真正存在的跟用户的问题相关的文档,分子是被成功检索没被检索出来的NP就说明那本分正样本被模型误判为了负样本就是被模型误判为了与用户问题不相关的文档出来的正样本TP。作用评测有没有漏掉关键信息。召回率低核心上下文缺失大模型回答信息不全答非所问。3、F1分数F1-Score公式是精确率和召回率的调和平均数调和平均会同时约束两个数值不会出现单一指标虚高。作用精确率和召回率相互拉扯很难同时都100%。设置检索返回top10条满足了精确率文档如果想拉高召回率把所有相关文档都捞出来就得放宽检索相似度只要沾一点边的文档都拿出来那么这是精确率就会下降二者很难两全。F1分数均衡两个指标能客观反应检索链路整体性能通常用F1对比不同文档切片、向量嵌入方案Embedding模型的优劣的检索效果。比如精确率召回率F1模型A0.90.50.64模型B0.70.70.7则B的综合检索效果更好。4、平均倒数排名MRR针对top-K检索场景取每条样本第一个检索到的真实相关文档的排名然后取排名倒数最后排名倒数全部相加再除以样本总量相关文档越靠前单条倒数值就越大整体MRR总分越高检索排序效果越好。作用模拟真实使用场景用户会下意识地查看检索靠前的文档衡量相关文档排序质量。
返回列表