
一文看懂Awesome-LLM-Eval大模型评测资源宝库里到底有什么【免费下载链接】Awesome-LLM-EvalAwesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表主要面向基础大模型评测旨在探求生成式AI的技术边界.项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-LLM-EvalAwesome-LLM-Eval 是一个大模型评测LLM Evaluation资源宝库以精选列表的形式收录了评测工具、基准数据集、排行榜、论文与大模型清单主要面向基础大模型评测旨在探求生成式 AI 的技术边界。本文带你快速看懂这个「宝库」里到底有哪些内容以及新手该如何上手。 一句话理解Awesome-LLM-Eval 是什么它围绕工具、数据集/基准、演示、排行榜、论文、模型六大类整理资源还延伸出 LLMOps、训练框架、课程等板块同时也是一篇大模型评测综述论文的官方开源仓库。对新手有三点友好设计中英双语仓库同时提供README_CN.md、README_EN.md和主文件README.md可按语言阅读表格化组织每个条目都带简介、机构、适用场景直接按名称检索即可持续更新News板块记录了每次新增内容的时间线从 2023 年首个评测列表一直更新到 2025 年的「拟人化评测分类法」。 评测资源全景图IQ、EQ、PQ 三大维度仓库中最直观的一张图就是 2025 版大模型评测分类树文件位于docs/llm-eval-tree-2025.png。它把「评测大模型」这件事拆成了三条主线维度中文名考察什么代表基准IQ智商通用智能推理、知识、数学MMLU-Pro、AIME、GSM8K、MATH、GPQAEQ情商对齐能力安全、公平、指令遵循HarmBench、IFEval、TrustLLM、AlignBenchPQ专业商专业素养垂直领域能力MedBench、LawBench、HumanEval、SWE-bench这棵树还按时间轴2020 → 2025把各代模型GPT-3、GPT-4、Llama、DeepSeek 等和对应出现的基准连在一起一眼就能看出大模型评测领域「每个模型时代解决了什么新问题」。 评测工具清单快速上手的工具箱Tools 板块收录了 20 多个大模型评测工具新手重点看这几个OpenCompass司南——上海 AI 实验室的一站式大模型评测平台覆盖 5 大能力维度、50 多个数据集、约 30 万道题目支持万亿参数模型分布式评测中文场景首选lighteval——Hugging Face 出品的轻量级评测框架支持 CPU/GPU 与分布式评测兼容 Open LLM Leaderboard 上的全部基准DeepEval——像 Pytest 一样给 LLM 输出做「单元测试」内置 G-Eval、幻觉、答案相关性等指标HELM——斯坦福提出的综合评测方法从语言能力、知识、推理、公平性、安全性多角度打分lm-evaluation-harness——EleutherAI 的经典任务评测工具适合批量跑客观题基准。选型捷径中文场景选 OpenCompass英文开源模型选 lighteval自建评测流水线选 DeepEval。 基准数据集9 大场景一站直达Datasets / Benchmark 板块细分为 9 个场景几乎覆盖大模型评测的所有方向场景评测重点代表数据集通用知识、推理、数学MMLU-Pro、TrustLLM、LV-Eval、FELM垂直领域医疗、金融、法律、电信MedBench、Fin-Eva、LAiW、LawBenchRAG 评估噪声鲁棒、负向拒答、幻觉BERGEN、CRAG、RGB、ARESAgent 能力工具调用、任务规划、记忆AgentBench、SuperCLUE-Agent代码能力补全、理解、调试McEval、HumanEval-XL、DebugBench多模态图表理解、视觉语言ChartVLM、ReForm-Eval、LVLM-eHub长上下文100K 长文本理解InfiniteBench、BAMBOO推理速度首 token 时延、吞吐llmperf、llm-inference-bench量化压缩训练后量化效果LLM-QBench两个值得细看的细节RAG 评估聚焦噪声鲁棒性、负向拒答、信息整合、反事实鲁棒性四项能力是构建 RAG 应用时的直接参考长上下文方向的 InfiniteBench 平均数据长度超过 10 万 token是目前少见的 100K 基准。 排行榜汇总大模型排名一站直达Leaderboards 板块收录了 40 余个主流大模型评测排行榜包括 Hugging Face Open LLM Leaderboard、Chatbot Arena、C-Eval、SuperCLUE、HELM、LawBench、MathEval 等不需要逐个平台搜索。更有价值的是仓库内维护的热门模型性能-成本对比表横向对比 GPT-4o、Claude 3、Gemini 1.5、Llama 3、DeepSeek-V2 等模型的基准均分、吞吐量tokens/秒、输入输出价格与性价比商用选型时可直接查阅。 大模型清单一张可视化演化树LLM-List 板块将模型分为五类预训练 LLM、指令微调 LLM、对齐 LLM、开源 LLM、热门 LLM并配有详细的参数量、层数、注意力头、预训练 token 数、是否 RLHF 等参数表。这张「LLM 演化树」按时间线还原了从 Word2Vec、BERT、GPT-1/2 到 LLaMA、PaLM、GPT-4 的模型血缘开源与闭源两条路线一目了然适合想系统了解大模型发展脉络的读者。 论文、课程与生态资源宝库不只有工具和数据还有学习资源Papers30 余篇大模型评测经典论文涵盖评测综述、G-Eval、HELM 全要素评测等Courses大模型课程 Notebook 合集、Full Stack LLM Bootcamp 等学习路线LLMOpsLangChain、LlamaIndex、Dify、LiteLLM、promptfoo 等 25 余个大模型运维工具Frameworks for TrainingDeepSpeed、PyTorch、ColossalAI、MindSpore 等训练框架Other Awesome ListsLLM 压缩、多模态、高效大模型等相关资源合集方便延伸阅读。 快速上手三步开始使用第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/aw/Awesome-LLM-Eval第 2 步选语言读 README中文读者从README_CN.md入手英文读者从README_EN.md入手。第 3 步按场景检索在文件中直接搜索 RAG、Agent、Long Context 等关键词即可定位对应基准清单。两个使用小贴士许可证区分对待——LICENSE.txt为 MIT 协议代码与列表LICENSE-DATA.txt为 CC BY-NC-SA 4.0数据部分商业使用前请留意建议关注News板块大模型评测领域更新很快定期回看能掌握最新基准动态。❓ 新手常见疑问这个仓库适合零基础读者吗适合。它是「查阅型」资源库不需要跑代码所有条目都以表格 简介形式呈现按需查找即可。必须把所有基准都跑一遍吗不必。建议「1 个通用基准 1 个场景基准」如 RAG 或代码作为第一轮模型对比的起点之后再按业务需求扩展。【免费下载链接】Awesome-LLM-EvalAwesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表主要面向基础大模型评测旨在探求生成式AI的技术边界.项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-LLM-Eval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考