ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

解密prompt系列40. LLM推理scaling Law

解密prompt系列40. LLM推理scaling Law 前言OpenAI的O-1出现前其实就有已经有大佬开始分析后面OpenAI的技术路线其中一个方向就是从Pretrain-scalingPost-Train-scaling向Inference Scaling的转变这一章我们挑3篇inference-scaling相关的论文来聊聊前两篇分别从聚合策略和搜索策略来优化广度推理最后一篇全面的分析了各类广度深度推理策略的最优使用方案。广度打分策略Are More LM Calls All You Need? Towards the Scaling Properties of Compound AI Systems第一篇论文的出发点比较简单简单说就是论证Inference Ensemble是否有效既让模型多次回答同一个问题再通过voting或filter-voting等不同的ensemble打分策略对答案进行投票分析对回答准确率的影响。这里filter vote借助以下LLM prompt对推理得到的答案进行筛选再做major votte[User Question]:{query}[Answer]:{answer}Instruction:Review your previous answerandfind problemswithyour answer.Finally,concludewitheither ’[[correct]]’ifthe above answeriscorrector’[[wrong]]’ifitisincorrect.Think step by step.Verdict:论文在MMLU和QA等有标准答案的数据集上进行了测试结果得到了下图非单调的曲线会发现随着推理次数的上升不论是vote还是filter vote的回答准确率都是非单调的其中vote会先上升在下降filter vote的表现在不同数据集上存在差异。这里我们就看下major vote毕竟filter vote又引入一步模型推理所以其实有两层变量。回到了最熟悉的data analysis领域U-Shape∩-shape模式多数情况下都是因为数据中存在多个表现各异的分组有的组内指标先上升后稳定有的组内指标稳定下降多个小组的指标汇总后就会出现先升后降或者先降后升的模式。所以这种U-Shape∩-shape模式的解决思路就是寻找那个可以显著区分指标走势的confounder变量。论文定位到的confounder变量是Query难度使用一个问题最终能否被回答作为衡量这个问题难度的定义。其实个人认为不是query难度而是该问题在模型内化知识空间中对的答案和错的答案本身的概率分布当模型更高的概率得到正确答案时更多的LLM推理和major vote才能生效。所以随着推理次数增加简单问题的回答准确率先上升后趋于平稳而复杂问题的准确率持续下降合并起来就出现了先升后降的趋势。第一篇论文其实是用来做个首尾呼应这里论文发现了Query难度会影响推理打分策略的效果和后面谷歌的推理策略最优化不谋而合。广度搜索策略REBASEAn Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models广度推理策略其实包含两个部分一个是如何生成推理链路搜索策略一个是如何对推理链路进行打分广度搜索包括像前一篇论文直接随机采样生成多个推理还有更复杂类似TOTMCTS的树形多步推理打分包括major votefilter major vote weighted major vote还有基于reward打分的best-of-n包括基于结果的ORM和基于过程的PRM前面一篇论文说了major vote等打分策略但搜索策略只用了简单的多次随机推理这里我们再看一篇对搜索策略进行优化的论文REBEASE。论文采用了树形搜索在搜索逻辑上REBEASE和TOT相似通过实验提供了推理准确率和推理成本之间balance的一些insight。树形搜索的流程如下第一步针对问题生成N个候选答案推理BudgetN使用PRM模型对N个候选推理步骤进行打分同时使用模型判断这N个候选步骤中是否有推理完成的节点如果有C个节点推理完成则budget-C对未完成的节点根据PRM打分进行加权采样采样后的节点进行下一步推理直至Budget0也就是成功生成N个推理结果后终止对最终得到的N个候选答案可以使用各类广度打分策略来进行聚合这里论文采用了理论上效果更好的weighted major vote和Best-of-N在MATH和GSM8k数据集上论文使用PRM数据集微调了Llemma-34B模型作为Reward模型分别使用在MeatMath数据集上微调过的Mistral-7Bllema-7B,Llema-34B作为推理模型以下是REBEASE和其他广度搜索策略以及不考虑Budget的属性搜索策略的效果对比效果上相同的推理错误率使用REBEASE搜索策略相比随机采样和MCTS需要更低的推理成本并且随错误率降低推理量级的上升幅度相比其他策略更低。同时在同一个模型系列中相同错误率下使用推理广度或者树形搜索策略7B模型相比34B所需的推理成本更低。这里的观点就很有意思了也就是小模型通过更优的推理策略是有可能用更低的成本达到大模型的效果的这个观点在后面谷歌的论文中得到了更全面细致的论证。全面分析Test Time ScalingScaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model ParametersRISE:Recursive introspection: Teaching foundation models how to self-improveMATH-SHEPHERD: VERIFY AND REINFORCE LLMS STEP-BY-STEP WITHOUT HUMAN ANNOTATIONS如果说前两篇论文各自选了推理策略中的一个方向去做优化和分析那谷歌的这篇论文就是一网打尽式的把各个推理策略和优化方向都全面考虑在内给出了一个综合的推理策略选择最优方案。论文的目标就是回答在给定prompt和推理budget的前提下如何选择最优的推理策略 以及该推理策略对推理效果的提升是否比直接换个大模型要来的更显著论文提出优化推理效果本质上是调整模型推理的token分布一种是让模型自我调整例如通过RL对齐让模型生成中间推理过程STaR也可以让模型通过自我优化对推理结果给出优化建议并针对建议进行优化论文称之为“Proposal”。另一种就是面向一个打分模型进行搜索优化论文称之为“Verifier”。我理解其实前者的本质就是深度策略例如self-refineself-critiqueself-reflection而后者的本质广度策略例如best-of-n)。论文提出以上不同的策略适配不同难度的问题那第一步就是对问题的难度进行分类这里论文使用MATH数据集使用基座模型对每个样本生成2048个推理结果然后使用打分模型评估这些推理结果是否正确对正确率进行分桶总共分成5个桶代表不同的难度分层。有了难度分类下面我们分别看下优化Verifier和Proposal的效果VerifierVerifier依赖打分模型所以首先是PRM模型的训练不熟悉PRM的可以先读这篇解密prompt系列34. RLHF之训练另辟蹊径循序渐进 青出于蓝。这里论文参考了MATH-SHEPHERD的全自动标注方案通过对同一个问题生成多个推理过程过程中的每个节点都使用该节点通向正确答案的概率作为该节点的标签来训练PRM模型。至于如何使用PRM来优化推理其实包含两个步骤多个推理链路的搜索生成以及对多个链路打分投票得到最终答案。先说推理链路的搜索策略这里论文尝试了三种方案包含简单广度搜索和树形搜索分别是Best-of-N随机采样生成N个推理链路Beam Search生成N个初始节点每一步都基于PRM选择Top M个节点继续推理最终保留N个得分最高的推理链路Lookahead Search同样是Beam Search只不过每一步保留哪些节点不由当前节点的打分决定而是再向前推理K步由K步之后的节点打分决定当K0其实就是Beam Search。虽然看起来是最科学的搜索策略但是也带来了额外的计算成本。再来说下打分投票策略以上不同的搜索策略都会得到N个推理链路论文对每个推理链路进行整体打分这里没有使用多个步骤的PRM打分聚合而是直接使用了最后一个节点的PRM打分作为整个推理链路的得分。得到打分后使用weighted best-of-n来得到最终答案也就是对每个答案计算所有得到该答案的推理链路的总分得分最高的答案作为最终答案。不同策略的效果对比能得到以下几个结论当推理budget有限时Beam Search的效果最好当N逐渐变大后Best-of-N逐渐展现出了暴力就是奇迹的优越性能相同Budget下Lookahead的效果是最差的论文怀疑是过度的搜索层的优化会导致一些例如推理链路过短的过度优化问题先前推N步后early stop了。但我有点怀疑是因为向前推的部分论文使用的是temperature0进行外推影响了推理质量在不同难度的问题上简单问题level 1-2随着budget上升Best-of-N的效果会逐渐变得更好提示广度策略对于简单问题的有效性。而较难的问题level3-4beam-search持续有更优的效果对于最难的问题level5啥也不好使一言以蔽之问题越简单搜索策略越简单推理资源越多搜索策略越简单ProposalProposal依赖模型自我反思优化的能力所以首先是训练Revision模型论文参考了RISE的方案只不过采用了离线构建多轮回答的方案。论文对每个样本独立采样64次从中把正确的回答和0-4个错误的回答随机采样进行配对把错误回答作为上文正确回答作为最终的回答构建多轮对话作为训练数据。配对过程选用了编辑距离来挑选和正确回答最相近的错误回答帮助模型更容易找到正确和错误之间的关联性真的是去学习从错误中定位原因进行优化而非跳过错误的上文直接去尝试生成正确答案。然后使用以上样本对模型进行微调。但以上的样本存在bias也就是上文只有错误答案最终的推理答案都和上文不同而真正在推理过程中使用多个结果作为上文其中是可能存在正确答案的也就是有可能模型会把正确答案给改成错误答案。因此论文选择把revision和verifier进行结合也就是使用打分模型从revision序列生成的多个推理结果中选择最正确的。效果上论文发现在不同的推理budget下同样是N个推理链路revision深度搜索的效果都要优于parallel广度搜索。但论文认为本质上两种策略应该在不同场景中各有优劣广度策略更善于全局搜索而深度策略依赖最开始已经选择了正确的方向然后进行持续的局部优化。因此论文尝试把广度策略和深度策略进行合并并寻找最优的合并比例给定budget多少用来做深度搜索多少做广度搜索。论文认为在不同的budget和问题难度下应该存在广度和深度策略的最优ratio老实说下图的趋势并不是非常的明显能推理出的结论有Budget有限revision更多的效果更好Budget很大时存在最优ratio。但我的感觉是这并非balance ratio而是广度策略对budget的依赖更明显存在突变点就是当budgetthreshold会在部分问题上效果有更显著的提升而revision随budget的效果提升更平滑简单问题revision更多效果更好复杂问题存在最优ratio在解决复杂问题时深度和广度策略可以互相补充最后还有一个问题没有回答就是推理效果提升和预训练之间的balance直接上图具体数据不是很重要因为和模型以及数据集都相关所以只说下insight简单问题更多推理资源能覆盖更多预训练能解决的问题所以小模型更多推理资源更合适复杂问题对于模型能力以外的复杂问题预训练是提升模型能力的核心最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表