LLM-eval-survey:一份按评测维度组织的论文索引,而不是评测工具
The official GitHub page for the survey paper "A Survey on Evaluation of Large Language Models".
秒懂
- 它是什么?
- 这个仓库是综述论文《A Survey on Evaluation of Large Language Models》的配套索引,按「评什么」和「在哪评」两条主线收集论文链接。它不提供任何代码或评测脚本,价值取决于你是否需要一份人工维护的文献地图。
- 适合谁用?
- 如果你需要按评测维度(情感分析、推理、鲁棒性、医疗、Agent 等)快速定位 LLM 评测方向的代表性论文,这个仓库的组织方式比通用搜索引擎更省事,可以直接从目录跳到对应小节。如果你需要的是可运行的评测框架、数据集加载器或评分脚本,这里没有,应该去看 README 中提到的 PromptBench 或 LLM-eval 站点。
- 能商用吗?
- 未经许可不能。GitHub 在这个仓库里没有找到许可证文件;没有许可证,默认即「保留所有权利」:你可以阅读代码,但不能复用。使用前请看看 README,或先征得作者同意。
- 还在维护吗?
- 在维护。仓库最近一次提交在 3 天前。
- 用什么语言写的?
- GitHub 没有给出这个仓库的主要语言。
以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。
开源项目深度解析
它解决的是文献检索问题,不是评测执行问题
LLM 评测领域的论文数量在 2023 年前后迅速膨胀,同一个任务上往往同时存在多篇结论不一致的评测工作。这个仓库做的事情很窄:把综述论文里讨论过的论文按主题整理成带链接的清单。README 开头写明它是「A collection of papers and resources related to evaluations on large language models」,正文也说明论文的组织方式与综述一致。
它的目标读者是准备写综述、做选题调研或需要给团队梳理评测现状的人。对这类读者,按维度分好的清单能省掉一轮关键词试错。对另一类读者,也就是想找现成评测代码的人,这个仓库帮不上忙:仓库结构里只有 imgs 目录下的框架图和 logo,没有 src、没有 requirements.txt、没有评测入口脚本。把两者混为一谈是最常见的误判。
目录结构就是它的数据模型
README 里的 Table of Contents 分三层:News and Updates、What to evaluate、Where to evaluate,加上 Contributing、Citation、Acknowledgments。What to evaluate 下面再分自然语言处理、鲁棒性与伦理与可信性、社会科学、自然科学与工程、医疗应用、Agent 应用、其他应用七个子类。自然语言处理这一支继续细分到自然语言理解(情感分析、文本分类、自然语言推理、其他)和推理。
条目格式高度统一:编号、论文标题、作者与发表信息、年份,最后是一个指向 arXiv 或 SSRN 的链接。这种结构的代价是信息密度低,同一条论文会在多个小节重复出现,例如 Holistic Evaluation of Language Models 同时出现在情感分析和文本分类下。重复不是错误,它反映的是同一篇工作覆盖多个评测维度,但读者如果按顺序通读,会反复遇到相同条目。
「评什么」与「在哪评」这两条线并不对称
What to evaluate 部分有大量实际条目支撑,从情感分析到医疗推理都有具体论文。Where to evaluate 在目录中是一个指向 #where-to-evaluate 的锚点链接,但 README 中该锚点对应的标题写作 href="where-to-evaluate",缺少井号前缀。这是一个链接写法上的不一致,实际效果取决于渲染器,不能保证点击后能正确跳转。
更实质的问题是内容密度不对称。前半部分按任务和应用领域铺开,条目密集;「在哪评」这条线本应回答评测发生在哪些平台、榜单或数据集上,但从提供的材料看,这一节的可见内容远少于前半部分。如果你的关注点是评测基础设施而不是评测对象,这个仓库能提供的线索有限。
没有代码可以运行,只有需要人工核对的链接
仓库没有 release,也没有可安装的包。使用方式是浏览器打开 README,或者把仓库 clone 到本地用编辑器检索。既然没有入口脚本,就不存在配置项、命令行参数或环境变量可谈。README 中出现的唯一可执行层面的引用是相关项目链接:microsoft/promptbench 和 llm-eval.github.io。前者在 README 中被描述为「Prompt benchmark for large language models」,后者被描述为 LLM 评测站点。这两个才是可能包含代码的入口,本仓库本身不是。
因此,任何把它当作评测工具链来评估的做法都会落空。它的实际工作流是:定位小节、点开论文链接、回到原论文确认方法。
维护节奏与时效性风险
README 明确写道,由于无法实时更新 arXiv 论文,请以仓库为准,论文可能后续更新。这句话说明了维护模型:仓库是比论文更新的那一侧,但更新依赖人工提交。News and updates 只记录了两条:2023 年 7 月 7 日第一版论文发布,2023 年 7 月 12 日第二版发布并附带中文博客。
条目中的论文绝大多数标注为 arXiv 2023 或 ACL 2023,这符合综述的写作时间。仓库的最后推送时间在元数据中显示为 2026 年 9 月,但 News and updates 没有对应记录,也没有 release 说明改了什么。这种「推送活跃但更新日志沉默」的组合意味着你无法从仓库自身判断哪些小节是新的、哪些是旧的。要确认某个小节是否覆盖了近期工作,只能逐条看论文年份,这个成本不低。
什么时候该用别的方案
如果你的目标是复现一次评测,这个仓库的替代品是 README 自己列出的 PromptBench,它被描述为面向 LLM 鲁棒性评测的 prompt 基准。两者的差别在交付物:PromptBench 提供可执行的评测流程,本仓库提供论文清单。另一个方向是聚合型榜单与评测站点,例如 LLM-eval 站点,它们通常给出模型在具体基准上的分数,而本仓库给的是研究这些基准的论文。
还有一种情况是这个仓库不适合的:你需要的是数据集本身而不是关于数据集的论文。清单里的链接指向论文页面,不指向数据下载地址,也不保证论文附带开源数据。这一点在动手前必须自己确认。
许可证与引用上的空白
元数据中 License 字段为空,仓库也没有 release 记录。这意味着无法从仓库信息判断条目内容的复用条件。清单本身是事实性链接集合,但 README 的正文、框架图和 logo 属于作者团队的产出,使用前应当查看仓库是否补充了许可证声明。
引用方面,README 提供了 Citation 小节,说明作者期望的引用方式是那篇综述论文,而不是仓库本身。作者列表包含吉林大学、微软研究院、中科院自动化所、卡内基梅隆大学、西湖大学、北京大学、伊利诺伊大学、香港科技大学等机构,标注了共同第一作者和共同通讯作者。仓库也说明欢迎 pull request 和 issue,贡献者会被列入 acknowledgements。如果你打算基于这份清单做二次整理,走 issue 或 PR 通道比直接复制更符合作者的预期。
编辑结论
如果你需要按评测维度(情感分析、推理、鲁棒性、医疗、Agent 等)快速定位 LLM 评测方向的代表性论文,这个仓库的组织方式比通用搜索引擎更省事,可以直接从目录跳到对应小节。如果你需要的是可运行的评测框架、数据集加载器或评分脚本,这里没有,应该去看 README 中提到的 PromptBench 或 LLM-eval 站点。采用前先确认三件事:目标小节最近一次更新是什么时候、条目里的论文链接是否仍然可达、以及你关心的评测维度是否根本没有被收录。仓库本身没有 release,也没有声明许可证,这意味着你无法从仓库信息判断条目内容的复用条件,引用时应当回到原论文。
社区笔记