graph-fraud-detection-papers:一份图与 Transformer 欺诈检测论文索引怎么用
A curated list of Graph/Transformer-based fraud, anomaly, and outlier detection papers & resources
秒懂
- 它是什么?
- 这是一个由 safe-graph 维护的论文与资源清单,覆盖基于图神经网络和 Transformer 的欺诈、异常与离群点检测研究。它本身不是代码库,而是一份带交互式面板和本地 RAG 问答工具的文献入口,适合在选题和补文献时用。
- 适合谁用?
- 如果你正在做图神经网络或 Transformer 方向的欺诈、异常检测选题,需要一份按年份和主题分好类的文献入口,这份清单可以直接用,尤其是配合它的交互式 dashboard 做筛选。如果你的目标是拿到一个能跑在自有数据上的检测系统,它不是你要的东西,Toolbox 和 Dataset 两个小节只是指向别处的链接。
- 能商用吗?
- 未经许可不能。GitHub 在这个仓库里没有找到许可证文件;没有许可证,默认即「保留所有权利」:你可以阅读代码,但不能复用。使用前请看看 README,或先征得作者同意。
- 还在维护吗?
- 在维护。仓库最近一次提交在 2 天前。
- 用什么语言写的?
- GitHub 没有给出这个仓库的主要语言。
以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。
开源项目深度解析
这份清单解决的是找文献的问题,不是建模的问题
做图欺诈检测的人常遇到一个具体的麻烦:这个方向横跨图神经网络、Transformer、异常检测、垃圾信息识别和金融风控几个圈子,会议也散在 KDD、AAAI、NeurIPS、ACL、EMNLP、ACM MM、CCS 以及 Expert Systems with Applications 这类期刊上。想系统看一遍,靠关键词搜索很容易漏掉改过名字的方法。这个仓库做的事情就是把这些论文按年份和主题收进一张表,每行给出年份、标题、发表venue、论文链接和代码链接。它的目标读者是做研究或做技术选型前期调研的人,不是想直接调用模型接口的工程师。README 开头自称是一份 curated list,措辞是克制的,实际内容也确实以索引为主,没有附带训练脚本或推理代码。
表格结构:年份、venue、论文链接、代码链接四列
清单的主体是 Markdown 表格。以 LLM and Transformer Papers 这一节为例,列头依次是 Year、Title、Venue、Paper、Code。Year 从 2026 一路往回排到 2025,Venue 一列混着 arXiv 预印本和正式会议,比如 KDD 2026、AAAI 2026、ACL 2026、NeurIPS 2025、ACM CCS 2025、EMNLP 2025、ACM MM 2025、KDD 2025。Paper 列是 arXiv PDF 或出版社链接,Code 列要么是 GitHub 地址,要么写着 Link 但没有实际指向,也就是说相当一部分条目没有公开实现。目录把内容分成几块:LLM and Transformer Papers、按年份分组的 Deep Learning Graph Papers(2026、2025、2024 直到 Before 2020)、Non-Deep-Learning Graph Papers since 2014、Toolbox、Dataset、Survey Paper、Other Resource。这个划分本身透露了维护者的判断:图方法按年份线性排列,LLM 相关单独成节,说明后者被当作一条相对独立的线在跟踪。
dashboard 与本地 RAG 聊天机器人是两个外挂
仓库首页挂了两个链接,都不是仓库自身的代码。一个是交互式 dashboard,地址在 safe-graph.github.io/paper_dashboard/,README 说可以用它查看、筛选和搜索清单里的论文。对于表格已经长到需要滚动很久的清单来说,这个入口比直接读 Markdown 实用。另一个是本地 RAG 聊天机器人,README 写的是为了 deep research 而开发,基于 250 篇公开可访问的论文,代码在另一个仓库 YingtongDou/paper_chatbot,部署说明在那个仓库自己的 README 里。这里有一个需要留意的地方:250 篇是一个明确的数字,而清单本身按年份累积的条目数量显然不止这个规模,所以机器人覆盖的是子集而不是全部。把它当成检索辅助可以,把它当成清单的完整问答接口会失望。
它不提供可运行代码,Toolbox 和 Dataset 只是指路
这是最容易产生预期落差的一点。仓库名里有 papers,内容也确实是 papers。Toolbox 和 Dataset 两个小节在目录里存在,但给定材料中没有展开具体条目,因此无法确认里面收录了哪些工具和数据集。也就是说,你不能指望从这里拿到一个 GNN 欺诈检测的训练框架,也不能假设它整理了可直接下载的标注数据。如果你的任务是搭一套能上线的检测流程,这份清单的价值仅限于帮你判断某个方法是否有人做过、代码是否公开。反过来,如果某篇论文的 Code 列写着 Link 却没有实际地址,那就意味着在公开渠道找不到作者实现,复现成本要自己承担。
2026 年的条目里有大量预印本,引用前要分辨
翻 LLM and Transformer Papers 这一节会发现,2026 年的条目中 arXiv 占了大半,标题后面跟着 arXiv 2026,链接指向 arxiv.org 的 PDF。同一节里也有明确标为 KDD 2026、AAAI 2026、ACL 2026 的条目,还有一条发表在 Expert Systems with Applications。预印本和正式发表混排在同一张表里,年份一列只写数字,venue 一列才区分。这对做文献综述的人是个实际风险:预印本的方法描述和最终版本可能有出入,实验设置也可能被审稿意见改过。清单本身没有标注哪些条目已经正式出版、哪些还只是投稿状态,需要读者自己点开链接确认。另外,同一篇 DGP 在表里出现了两次,一次标 AAAI 2026 并给出 ojs.aaai.org 链接,一次标 arXiv 2026 并给出 arXiv 链接,这属于清单维护中常见的重复,不影响使用,但说明去重不是自动的。
和 Papers with Code 这类自动聚合站的区别
同样是想找图欺诈检测的论文,Papers with Code 这类站点靠抓取和关键词自动聚合,覆盖面广,但主题边界是算法推断出来的,容易把只是顺带提到欺诈的论文也收进来。这份清单是人工维护的,边界由维护者决定,代价是更新依赖人工提交,README 里挂着 makeapullrequest.com 的 PRs-welcome 徽章,说明接受外部贡献。另一个区别在于组织维度:自动站点通常以任务和榜单为中心,这份清单以发表年份和主题分节为中心,更接近一篇综述的骨架,适合按时间线看一个方向怎么演进,比如从纯图方法过渡到 LLM 与 GNN 结合的软提示框架。代价是没有统一的评测口径,你无法从清单本身判断哪个方法在哪个数据集上更强。
维护成本低,但许可证信息缺失
作为一份 Markdown 清单,它没有构建步骤,没有依赖,也没有需要升级的运行时。使用成本主要是阅读和核对链接的时间。需要说明的是,给定材料中 License 字段为空,仓库没有检索到任何 release,因此无法判断再分发或商用的许可条件。清单里链接的论文和代码各自有自己的许可,这跟仓库本身的许可不是一回事。如果你的团队打算把清单内容整理进内部知识库或对外文档,先到仓库页面确认 License 字段的实际取值,不要基于这份材料做判断。这一点无法从现有信息推断,只能自行核实。
什么时候该换别的路子
如果你的需求是复现某篇具体论文并在自有交易或社交图上跑通,这份清单帮不上太多,你需要的是那篇论文的代码仓库和它依赖的数据集,清单只能告诉你代码是否存在。如果你的需求是找一个已经工程化、带 API 的欺诈检测服务,那更不该从这里入手,清单里没有任何部署或服务化的内容。它的适用场景相当窄:选题调研、补文献、确认某个方法是否已有人提出、按年份梳理一个子方向的发展脉络。超出这个范围,投入产出比会迅速下降。
编辑结论
如果你正在做图神经网络或 Transformer 方向的欺诈、异常检测选题,需要一份按年份和主题分好类的文献入口,这份清单可以直接用,尤其是配合它的交互式 dashboard 做筛选。如果你的目标是拿到一个能跑在自有数据上的检测系统,它不是你要的东西,Toolbox 和 Dataset 两个小节只是指向别处的链接。采用前先确认三件事:仓库的 License 字段在给定材料中没有给出,商用或再分发前需要自行到仓库核实;README 里 2026 年的条目包含尚未正式出版的 arXiv 预印本,引用前要核对最终发表版本;本地 RAG 聊天机器人是独立仓库 paper_chatbot,部署方式和它对 250 篇论文的覆盖范围要看那个仓库自己的 README,不能默认它覆盖了整份清单。
社区笔记