模型 / 数据集
Barca0412/Introduction-to-Quantitative-Finance avatar
Barca0412/Introduction-to-Quantitative-Finance

Introduction-to-Quantitative-Finance:一份中文量化知识库的组成与边界

AI+金融(量化):1.多因子股票量化框架开源教程 2.学界和业界的经典资料收录 3.AI + 金融的相关工作,包括LLM, Agent, benchmark(evaluation), etc.

1,749 个 Star186 个 ForkPythonMIT

秒懂

它是什么?
这个仓库把多因子投研教程、AI + Finance 论文雷达和资料清单放在一起,用 VitePress 站点和一条 arXiv 抓取管线串起来。它更像路线图和索引,不是能直接下单的策略代码。
适合谁用?
适合正在建立量化投研知识体系的中文读者,以及需要持续跟踪 AI + Finance 论文的人;不适合想直接拿一套可回测、可上线的策略框架的人。上手前先确认三件事:data/papers.json 与 data/stats.json 是否为最新(README 的状态块给出 Latest update 和 Indexed papers 两项,可以据此比对)、Node 环境能否跑通 npm run arxiv:update、以及资料清单里的外部链接是否仍然有效。
能商用吗?
可以。MIT 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 4 天前。
用什么语言写的?
主要是 Python(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

它解决的是资料散落,而不是策略缺失

量化学习的实际困难往往不是找不到材料,而是材料散在知乎、公众号、GitHub 仓库和券商研报里,彼此之间没有统一的组织方式。这个仓库做的事情是把三类内容收进同一个入口:一条从研究框架到因子、回测与组合优化的多因子教程学习路线,一个工作日自动抓取并聚类论文的 arXiv Radar,以及一份按数据源、回测、因子挖掘、组合优化、机器学习、强化学习分类的公开资料清单。README 把这三类内容分别对应到「系统学习量化投研」「跟踪 AI + Finance 最新论文」「查找工具、课程与资料」三种使用意图。

目标读者是中文语境下的量化学习者和研究者。仓库说明多因子教程部分计划开源自湖南大学金融科技协会 Quant Group 的研究内容,这意味着教程带有社团内部培训材料的性质,而不是一份面向外部用户的完整产品文档。资料清单的条目以仓库链接形式给出,例如 microsoft/qlib、kernc/backtesting.py、polakowo/vectorbt、stefan-jansen/zipline-reloaded、dcajasn/Riskfolio-Lib、AI4Finance-Foundation/FinRL 等,每个条目配一句定位说明。这种写法的价值在于筛选和分类,不在于替代原项目文档。

arXiv Radar 的管线:从抓取到 embeddings 索引

Radar 是这个仓库里工程成分最重的部分。站点以 VitePress 的 /arxiv/ 子区块形式集成,README 说明它替换了旧版 arXiv 文档体验。功能上列出论文列表、趋势图、语义检索、机构筛选、标签聚合五项。

数据落在三个 JSON 文件里:data/papers.json 存论文条目,data/stats.json 存统计结果,data/embeddings_index.json 存向量索引。语义检索依赖 embeddings_index.json,也就是说检索能力是离线构建的,不是每次查询时调用在线模型。管线代码在 scripts/arxiv_radar/ 目录下。README 中有一段由机器更新的状态块,给出最新更新时间、已索引论文数、重点论文数、最新发表日期和监控分类数。状态块带有 ARXIV_RADAR_STATUS 标记,说明它是被脚本自动改写的,而不是人工维护的数字。

这种设计的直接后果是:Radar 的新鲜度取决于管线有没有被运行。仓库最后一次 push 时间是 2026-09-09,状态块显示的 Latest update 是同一天,两者一致。但如果你克隆下来自己用,索引就停在克隆的那一刻,除非你按下面的命令重新跑一遍。

跑起来需要什么:npm 脚本与数据文件

README 给出的运行入口很简洁。刷新数据与 README 状态块执行 npm run arxiv:update。文档站和 Radar 子站通过 VitePress 构建,README 里给出的访问路径是 https://barca0412.github.io/Introduction-to-Quantitative-Finance/ 和其下的 /arxiv/。

需要注意的是,README 没有列出 Node 版本要求、依赖安装步骤或环境变量配置。从 VitePress 与 npm script 的组合可以推断需要 Node 环境,但具体版本区间在给定材料中无法确认。如果你打算本地跑通,需要先补上 npm install 这一步,而这一步并没有出现在 README 的快速开始表格里。快速开始给出的是一张意图到入口的对照表,指向教程章节、Radar 站点、资料整理和 Discussions,不是一份安装指南。

数据文件路径是硬编码在管线里的(data/papers.json、data/stats.json、data/embeddings_index.json),所以自定义数据源意味着改脚本而不是改配置。仓库没有提供配置文件示例。

教程部分的完成度是个已知缺口

README 在「我的资料」一节里明确区分了「暂时包括」和「待添加」两组。待添加项列出量化笔试与 MFE 刷题、组合优化、机器学习因子挖掘。也就是说,组合优化和机器学习因子挖掘这两块在资料清单里已有外部项目链接(Riskfolio-Lib、PyPortfolioOpt、AlphaAgent、alpha-gfn 等),但仓库自己的教程内容尚未覆盖。

多因子教程部分引用了湖南大学金融科技协会 Quant Group 的研究内容,框架图以图片形式给出(pic/image.png),正文没有把框架的文字描述完整展开。这意味着读者如果只看 README,能拿到的是学习路线的名称和顺序,拿不到每一步的具体方法。真正的内容在文档站里,而文档站的内容不在本次给定的材料范围内。

把这三件事放在一起看:教程在补,资料清单在扩,Radar 在自动更新。三者的成熟度不一样,但共用同一个仓库和同一个站点。对读者来说,这意味着不能假设三者同步。

它不会给你一套能回测的策略代码

这是最需要说清楚的一点。仓库的定位是资料整理与教程,不是策略框架。README 里出现的回测能力全部来自被收录的外部项目,例如 backtesting.py、vectorbt、zipline-reloaded。仓库自身提供的是 arXiv 抓取管线,不是回测引擎、不是因子计算库、也不是交易接口。

如果你需要的是「克隆下来,接上行情数据,跑出一个多因子回测」,这个仓库不解决那个问题。你会在资料清单里找到指向正确工具的链接,然后需要去读那些工具自己的文档。同样,仓库没有给出任何实盘相关的内容,高频交易一节收录的是 hftbacktest、VisualHFT 等外部项目,不是仓库自研模块。

另一个边界是语言。全部内容以中文组织,教程面向中文读者,被收录的项目则中英文都有。如果你的团队以英文文档为主要工作语言,这个仓库的分类结构和筛选结论仍然有参考价值,但阅读成本会上升。

与 awesome 类清单的差别在于那条自动管线

同为资源整理,leoncuhk/awesome-quant-ai 这类 awesome 列表的做法是人工维护一组链接,按主题分组,更新靠提交 PR。这个仓库的公开资料整理部分用的是同样的模式,按数据源与另类数据、回测、因子挖掘、投资组合优化与风控、基金研究与 FoF 等文件分节,链接到仓库内或外部资源。

差别在 Radar。awesome 列表不会自己产生内容,这个仓库会:scripts/arxiv_radar/ 下的管线在工作日抓取论文,写入 data/papers.json,更新 data/stats.json 的统计,并重建 embeddings_index.json 供语义检索使用。README 的状态块由脚本改写,带起止标记,所以状态数字和实际数据文件是同一套流程的产物。

代价是可维护性要求更高。awesome 列表的失效模式是链接 404,改一行就好;Radar 的失效模式是管线中断、索引过期、embeddings 与 papers.json 不一致,需要有人去看脚本跑没跑成功。仓库用机器更新的状态块把这个问题显性化了,这个做法值得肯定,但也说明维护者需要持续投入。

MIT 许可与维护成本的实际情况

仓库采用 MIT License。对使用者来说,这意味着可以复制、修改、分发仓库内的原创内容,包括教程文本和管线脚本,前提是保留版权声明与许可声明。需要注意两点:一是被收录的外部项目和资料各自有自己的许可,MIT 只覆盖本仓库原创部分,不能因为清单里出现了某个 GPL 项目就认为它可以按 MIT 使用;二是仓库里的卖方金工研报、论文等第三方材料,其版权归属不在 MIT 覆盖范围内,再分发前需要自行确认来源条款。以上是许可文本层面的说明,不构成法律意见。

维护成本方面,材料支持的信息有限。仓库没有 release,README 没有版本号或兼容性声明。Radar 的持续运行依赖定时执行 npm run arxiv:update,README 提到它按工作日更新,但没有说明这个定时任务跑在哪里。对想长期自建实例的人来说,需要自己解决调度问题。教程部分的更新节奏取决于内容贡献,README 提到小型修正可直接提交 Pull Request,大型改动建议先在 Discussions 交流。

编辑结论

适合正在建立量化投研知识体系的中文读者,以及需要持续跟踪 AI + Finance 论文的人;不适合想直接拿一套可回测、可上线的策略框架的人。上手前先确认三件事:data/papers.json 与 data/stats.json 是否为最新(README 的状态块给出 Latest update 和 Indexed papers 两项,可以据此比对)、Node 环境能否跑通 npm run arxiv:update、以及资料清单里的外部链接是否仍然有效。这三项都通过,再决定是否把它作为长期索引使用。

官方来源

  1. Barca0412/Introduction-to-Quantitative-Finance on GitHub
  2. Issues
  3. License: MIT
  4. Project website
  5. README
社区笔记

社区笔记