模型 / 資料集
Barca0412/Introduction-to-Quantitative-Finance avatar
Barca0412/Introduction-to-Quantitative-Finance

Introduction-to-Quantitative-Finance:中文量化投研知識庫與 arXiv Radar 的實際邊界

AI+金融(量化):1.多因子股票量化框架开源教程 2.学界和业界的经典资料收录 3.AI + 金融的相关工作,包括LLM, Agent, benchmark(evaluation), etc.

1,749 個 Star186 個 ForkPythonMIT

秒懂

它是什麼?
這個倉庫把兩件事放在同一個 MIT 授權的 repo 裡:一份仍在撰寫中的多因子投研教程,以及一個工作日自動更新的 AI + Finance 論文雷達。前者是內容,後者是管線,兩者的成熟度並不相同。
適合誰用?
如果你要的是中文量化投研的入門路線與一份持續更新的 AI + Finance 論文索引,這個 repo 值得 clone 下來當作起點;如果你要的是拿來跑實盤或當成可依賴的資料服務,它不是。採用前先確認三件事:教程章節的完成度(README 自己標了「待添加」的項目,例如組合優化、機器學習因子挖掘),Radar 資料檔 data/papers.json 與 data/embeddings_index.json 的實際更新時間是否落後於 README 的狀態塊,以及 npm run arxiv:update 在你的環境能否跑通。
可以商用嗎?
可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 4 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

它解決的是「不知道從哪裡開始」而不是「跑不出回測」

量化投研的入門門檻很少在程式能力上,而在資訊的組織方式。資料源有哪些、回測框架怎麼挑、因子從哪裡挖、組合優化用什麼庫,這些問題的答案散落在知乎貼文、賣方研報、GitHub 專案與課程講義裡,格式不統一,連結會失效。這個倉庫做的事是把這些東西收進一份中文文件站,並用 VitePress 呈現。README 開頭對自己的定位寫得很清楚:「面向量化研究者與學習者的中文開源知識庫」。

它的目標讀者是中文母語、正在建立量化研究知識體系的人,包括在校學生、轉職者,以及需要一份可轉發給新人的內部教材的團隊。倉庫說明提到教程部分計畫開源湖南大學金融科技協會 Quant Group 的研究內容,框架圖以英文版呈現。這意味著內容帶有特定組織的研究脈絡,不是通用教科書。

要留意的是,這個 repo 的分類標籤裡有 quant、trading、llm、agent,但標籤描述的是涵蓋範圍,不是功能承諾。倉庫本身不是交易系統,也不是資料供應商。把它當成索引與教材來讀,預期才不會落空。

兩個子系統:教程是內容,Radar 是管線

這個 repo 實際上由兩塊組成,維護成本與風險完全不同。

第一塊是多因子股票量化投研教程。README 列出「暫時包括」的內容:量化金融、機器學習、數學參考書與資料,技術指標回測程式碼,賣方金工研報,投資者情緒與行為金融相關論文。同一個清單也列出「待添加」的項目:量化筆試與 MFE 刷題、組合優化、機器學習因子挖掘。這份待辦清單本身就是最誠實的完成度聲明,讀者不該假設這些章節已經存在。

第二塊是 AI + Finance arXiv Radar,這部分有可驗證的機制。README 說明它整合在 VitePress 的 /arxiv/ 子區塊,具備論文列表、趨勢圖、語意檢索、機構篩選與標籤聚合。資料落在三個檔案:data/papers.json、data/stats.json、data/embeddings_index.json;管線程式碼在 scripts/arxiv_radar/。README 中的狀態塊由機器更新,列出最新更新日期、已索引論文數、重點論文數、最新發表日期與監控類別數,並註明監控 10 個類別。

兩塊的差別在於:教程的品質取決於作者寫了多少,Radar 的品質取決於抓取與嵌入流程是否持續執行。前者可以慢慢補,後者一旦停更,語意檢索的價值就開始衰減。

Radar 的資料流:從 arXiv 到 embeddings_index.json

從 README 能確認的資料流大致是這樣:scripts/arxiv_radar/ 底下的程式在工作日抓取 arXiv 上受監控類別的論文,經過篩選後產生 papers.json 作為論文主體,stats.json 保存統計數字供趨勢圖與狀態塊使用,embeddings_index.json 保存向量索引以支撐語意檢索。前端在 VitePress 的 /arxiv/ 路徑讀取這些檔案,提供列表、趨勢、機構與標籤等視圖。

有幾個設計選擇值得指出。第一,資料以 JSON 檔案而非資料庫形式隨站點發布,這讓部署簡化成靜態檔案,代價是每次更新都要重新產生整個檔案,論文量成長後檔案會變大,瀏覽器端載入與檢索都得在客戶端處理。第二,語意檢索依賴預先算好的嵌入索引,這意味著新論文的檢索能力取決於嵌入是否已重建,而不是即時計算。第三,README 明確說「工作日自動抓取」,週末與假期的論文不會即時進入索引。

README 沒有說明嵌入模型是哪一個、向量維度多少、相似度用什麼度量。這不是缺陷,但如果你打算在自己的系統裡重用 embeddings_index.json,這些是必須先自己確認的參數。

實際操作:更新 Radar 只需要一條 npm 指令

這個 repo 的執行面很窄,README 給出的操作指令只有一條。若要刷新資料與 README 中的狀態塊,執行:

npm run arxiv:update

這條指令同時負責更新 data/ 底下的資料檔與 README 裡被 <!-- ARXIV_RADAR_STATUS:START --> 與 <!-- ARXIV_RADAR_STATUS:END --> 包住的狀態塊。狀態塊的內容包括最新更新日期、已索引論文數、重點論文數、最新發表日期與監控類別數。這種把狀態寫回 README 的做法讓倉庫首頁能反映管線健康度,但也表示 README 會被自動改寫,手動編輯該區塊會被覆蓋。

文件站的入口是 https://barca0412.github.io/Introduction-to-Quantitative-Finance/,Radar 子站在其 /arxiv/ 路徑下,README 提到這是替換舊版 arXiv 文件體驗的新版。

需要說明的是,README 沒有提供安裝依賴、建立虛擬環境或設定 arXiv 抓取參數的步驟。npm run arxiv:update 之前需要哪些前置條件,得從 scripts/arxiv_radar/ 的內容自行判斷。這是文件缺口,不是可以從現有材料推測的部分。

限制:教程未完成,Radar 是公開 arXiv 的鏡像

最明顯的限制是教程的完成度。README 的「待添加」清單包含組合優化與機器學習因子挖掘,這兩項恰好是多因子框架從學習走向實作的關鍵環節。讀者若是衝著「多因子量化框架開源教程」而來,會發現部分章節仍是佔位狀態。倉庫的框架圖以圖片形式呈現,README 中沒有對應的文字說明各模組之間的關係。

Radar 的限制來自資料來源本身。它監控的是 arXiv 的 10 個類別,arXiv 是預印本平台,論文未經同儕審查;README 用「重點論文」這個詞區分篩選後的子集,但沒有說明篩選準則是什麼。若把 Radar 的論文列表當成研究品質的排序,會誤用它。

另一個限制是更新節奏綁定在抓取管線上。狀態塊顯示的是機器更新的數字,如果管線中斷,README 上的數字會停在最後一次成功執行的時間。判斷 Radar 是否還活著,看狀態塊的「Latest update」比看其他任何指標都直接。

最後,這個 repo 不包含任何交易執行、下單介面或風控模組。它的資源清單裡列了 vnpy、freqtrade 等交易框架,但那是外部連結,不是本專案的功能。

替代方案:qlib 與 awesome-quant-ai 走的是不同路

同樣被這個 repo 收錄在資源清單裡的 microsoft/qlib,是一個 AI 導向的量化投資平台,README 描述它支援自動因子挖掘。兩者的差異在於交付物:qlib 交付的是可執行的平台與 API,你安裝後用它跑資料處理、模型訓練與回測;這個 repo 交付的是文件與索引,你讀它、查它、把它當成學習路線圖。想解決「我的因子挖掘流程要跑在哪」的人需要 qlib,想解決「我該先學什麼、業界在做什麼」的人需要這個 repo。

另一個方向是 leoncuhk/awesome-quant-ai,同樣出現在本 repo 的綜合平台分類下。它是一份 AI/ML 量化的資源精選清單,與本 repo 的「公開資料整理」章節性質接近。差別在於本 repo 額外維護了 arXiv Radar 這條自動化管線,以及一份帶有特定組織脈絡的多因子教程。若你只需要一份連結清單,awesome 類專案更輕;若你需要論文層面的持續追蹤,Radar 是這裡比較難被取代的部分。

這兩個替代方案都不是本專案的競爭者,因為它們同時是這個 repo 的收錄對象。這也說明這個 repo 的定位是索引層,而不是工具層。

維護成本與 MIT 授權的實際含義

維護這個 repo 的成本分成兩塊。教程部分依賴人工撰寫與審閱,README 的 Contributing 章節要求貢獻者先在 GitHub Discussions 交流想法,小型修正可直接提交 Pull Request,並說明資料來源與適用場景。這套流程的成本主要落在維護者的審閱時間上,而不是技術基礎設施。

Radar 部分的成本是另一種:抓取、嵌入與資料檔產生需要定期執行,README 說這是工作日自動進行的,並提供 npm run arxiv:update 作為手動刷新方式。若自動化中斷,維護者就得手動跑這條指令。這是一個有明確恢復路徑的依賴,比純人工維護的資料清單好處理。

授權是 MIT。這表示你可以取用、修改、再散布,包括商業用途,條件是保留著作權聲明與授權條款。需要提醒的是,MIT 只覆蓋這個 repo 自身的內容;倉庫收錄的第三方連結、賣方研報、參考書與圖片各有自己的授權狀態。README 的資料整理章節列出多個外部文件與飛書連結,這些內容的可用範圍不受本 repo 的 MIT 授權影響。實際使用前應逐一確認來源條款,這裡不構成法律意見。

編輯結論

如果你要的是中文量化投研的入門路線與一份持續更新的 AI + Finance 論文索引,這個 repo 值得 clone 下來當作起點;如果你要的是拿來跑實盤或當成可依賴的資料服務,它不是。採用前先確認三件事:教程章節的完成度(README 自己標了「待添加」的項目,例如組合優化、機器學習因子挖掘),Radar 資料檔 data/papers.json 與 data/embeddings_index.json 的實際更新時間是否落後於 README 的狀態塊,以及 npm run arxiv:update 在你的環境能否跑通。這三點決定了你拿到的是可用資產還是一份待辦清單。

官方來源

  1. Barca0412/Introduction-to-Quantitative-Finance on GitHub
  2. Issues
  3. License: MIT
  4. Project website
  5. README
社群筆記

社群筆記