模型 / 資料集
ruc-datalab/DeepAnalyze avatar
ruc-datalab/DeepAnalyze

DeepAnalyze:把資料分析整條流程交給一個 8B 代理模型

DeepAnalyze is the first agentic LLM for autonomous data science. 🎈你的AI数据分析师,自动分析大量数据,一键生成专业分析报告!

4,623 個 Star733 個 ForkPythonMIT

秒懂

它是什麼?
DeepAnalyze 是中國人民大學與清華大學團隊釋出的開源代理式 LLM,主打在無人介入下完成資料準備、分析、建模、視覺化到報告產出。這篇從它的訓練資料、執行環境與部署門檻,判斷它適合誰、不適合誰。
適合誰用?
如果你要的是一個可以自己部署、自己微調、跑在內部資料上的資料分析代理,DeepAnalyze 把模型權重、訓練語料(DataScience-Instruct-500K)與 WebUI 一起放出來,這在同类專案裡並不常見,值得先下載 DeepAnalyze-8B 權重並照 demo/chat_v2/README.md 起一次 Docker 沙箱,確認你的資料在容器內的掛載與網路策略符合內部規範。如果你的場景只是單一 CSV 的問答,或團隊沒有可跑 8B 推論的 GPU,這個專案的整套管線與沙箱反而增加維運面,用一般程式代理加 pandas 就夠。
可以商用嗎?
可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 4 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

它想解決的不是「寫一段 pandas」,而是整條分析鏈的斷點

多數資料分析助理停在生成程式碼那一步:使用者貼上欄位說明,模型回一段 pandas,跑不跑得起來、欄位對不對、結論有沒有依據,全交給人。DeepAnalyze 的定位是把這條鏈補完。README 列出的範圍包含資料準備、分析、建模、視覺化與報告生成,並且明確寫到可以處理結構化(資料庫、CSV、Excel)、半結構化(JSON、XML、YAML)與非結構化(TXT、Markdown)資料,最後產出所謂 analyst-grade 的研究報告。

目標使用者因此不是隨手查數的業務人員,而是需要反覆對多來源資料做探索、又不想每次重寫腳本的分析團隊。README 也提到它被用作 2026 年中國大學生計算機設計大賽大數據主題賽的官方代理,這透露了它的典型負載:題目給定一批異質檔案,參賽者要找出相關資料、寫出可執行程式、給出答案。這與後來釋出的 CoDA-Bench 描述一致,該 benchmark 在 Linux 沙箱中放入數百個資料檔案,要求代理自行發現資料並產出結果。

需要說清楚的是,README 用 first agentic LLM for autonomous data science 這種表述,屬於團隊自己的定位宣稱,不是可驗證的排名。它的實際能力邊界要看你餵進去的資料形態與沙箱設定,而不是這句標語。

模型、語料、WebUI 三件套:開源範圍到底開到哪裡

DeepAnalyze 的開源不是只放推論程式。README 明確列出四項:模型權重(Hugging Face 上的 RUC-DataLab/DeepAnalyze-8B)、程式碼(GitHub 上的 ruc-datalab/DeepAnalyze)、訓練資料(DataScience-Instruct-500K)與 demo。訓練語料一併釋出這件事,決定了你能不能針對自家領域做後訓練,而不只是拿現成權重硬套。

參數量是 8B。這個數字是整個專案最重要的約束:它意味著單張消費級或工作站級 GPU 有機會跑得動,也意味著它在需要長鏈推理、跨多檔案比對的任務上,會比更大的通用模型更容易在中途偏離。README 沒有給出任何推論延遲、吞吐或硬體需求的數字,所以任何關於「跑多快」的說法都不該從這份材料推導。

授權是 MIT。對企業內部部署而言這是相對寬鬆的條款,但要注意 MIT 涵蓋的是這個 repo 的程式碼;模型權重與訓練語料各自掛在 Hugging Face 上,其授權條件需要另外確認,README 沒有在此交代。把 MIT 直接套用到權重上是不準確的推論。

另外,README 的 News 區塊提到 DeepPrep 這個資料準備的配套系統,以及 DA-Studio 被 VLDB 2026 Demonstration Track 接受,後者是 DeepAnalyze WebUI v2(demo/chat_v2)背後的系統。這些是路線圖與學術發表層面的資訊,不代表你現在 clone 下來就能用到。

代理迴圈與沙箱:資料流從哪裡進、從哪裡出

從 repo 結構與 News 可以拼出執行架構的輪廓。代理接收一個自然語言問題,在環境中探索可用的資料檔案,撰寫並執行程式,根據執行結果決定下一步,直到產出報告。這是典型的 code-as-action 迴圈,與單純的 RAG 問答不同:模型不是檢索文字片段後作答,而是真的在環境裡跑程式、看輸出。

關鍵設計在於執行程式的地方是沙箱。2026.03.16 的更新寫明 WebUI v2 支援 Docker-based sandboxed code execution,並支援 HeyWhale API。把程式執行放進容器,是這類代理能不能在真實環境用的分界線:模型產生的程式碼會讀檔、寫檔、可能連資料庫,若直接在宿主機執行,一次錯誤的刪除或路徑穿越就是事故。

同一則更新也提到支援 OpenAI-style API endpoints 與命令列終端介面(終端機支援由貢獻者 @LIUyizheSDU 加入),以及 JupyterUI 的整合。這些入口的意義是:你可以把 DeepAnalyze 當成一個服務接進既有工具鏈,而不是只能開它的網頁介面。

CoDA-Bench 的描述補上了另一半:代理面對的是 Linux 沙箱中數百個檔案,必須先做資料發現,也就是判斷哪些檔案與問題相關。這一步往往比寫程式更難,因為它需要對檔名、schema 與內容做取捨。README 沒有說明 DeepAnalyze 在檔案檢索上用了什麼機制(是索引、是逐檔掃描、還是靠模型自己列目錄),這是一個材料無法回答、但你部署前應該實測的環節。

跑起來需要的東西:從權重到容器

README 本身沒有給出安裝指令,這是這份材料的明顯缺口。可以確認的入口有三個:Hugging Face 上的 RUC-DataLab/DeepAnalyze-8B 取得權重、GitHub repo 取得程式碼、以及 demo/chat_v2/README.md 取得 WebUI v2 的部署說明。README 明確寫到 WebUI v2 的細節在 ./demo/chat_v2/README.md,所以真正的安裝步驟要以那份文件為準,而不是根目錄這份。

能從材料確認的設定面向包括:Docker 沙箱執行、HeyWhale API 支援、OpenAI-style API endpoints、以及 API key 的申請流程(透過 Google Form 或 Feishu Form,使用說明在 docs/DeepAnalyze_API_Key_Usage_Guide.md)。如果你不想自架模型,走 API key 這條路是門檻最低的起點;如果要自架,就要準備能承載 8B 的 GPU 與容器執行環境。

這裡有一個實務上的順序建議,且是綁定本專案的:先照 demo/chat_v2/README.md 把 Docker 沙箱起起來,確認容器內看得到你掛載的資料目錄,再去接模型權重。反過來做的話,你會先花時間在推論環境上,卻還不知道代理能不能讀到你的檔案。

至於版本管理,README 的 Recent releases 欄位沒有檢索到任何正式 release,所有變更都以 News 條目的日期呈現。這表示沒有語意化版本可以鎖,升級時你得自己對照 commit 或日期,這對需要可重現環境的團隊是一個額外成本。

什麼情況下它會讓你失望

第一個限制來自模型規模。8B 的代理在單一資料表、明確問題上通常夠用;但當任務需要在數百個檔案間做多輪比對、還要維持中間結論一致時,長鏈推理的穩定性會是瓶頸。README 與 News 都沒有提供任何準確率或任務成功率的數字,所以無法從材料判斷它在 CoDA-Bench 上的表現。要採用就得自己拿內部題目測。

第二個限制是沙箱的維運責任。Docker-based sandboxed code execution 把安全邊界交給了容器設定,而容器設定是你的事。README 沒有描述沙箱的資源上限、網路隔離或檔案系統唯讀策略。代理產生的程式碼若在容器內有網路,就可能把資料往外送;若掛載了宿主目錄,容器隔離的意義就大打折扣。這些是部署者要自己決定的事,不是專案幫你決定的事。

第三個限制是資料庫連線。README 把 Databases 列為支援的結構化資料來源之一,但沒有說明連線憑證如何管理、是否支援唯讀帳號、代理能否執行寫入語句。在生產資料庫上直接讓代理自由生成並執行 SQL,風險等級與在 CSV 上跑 pandas 完全不同。

第四個是報告的可信度。專案承諾產出專業分析報告,但報告的價值取決於每個結論能否回溯到具體欄位與計算。材料沒有描述引用機制。若你的場景需要審計軌跡,這一點必須先驗證。

與通用程式代理的差別在哪裡

最直接的替代方案是通用程式代理,例如把一個通用 LLM 接上程式執行工具,讓它在容器裡寫 pandas 或 SQL。兩者的執行迴圈其實很像,差別在訓練資料。DeepAnalyze 的訓練語料是 DataScience-Instruct-500K,README 說明它與模型、程式碼一起開源,這意味著模型在資料清理、欄位推斷、圖表選擇這類動作上有針對性的先驗,而不是靠通用推理臨時拼湊。

第二個差別是輸出形態。通用代理通常回一段程式碼或一段文字答案;DeepAnalyze 的目標是產出報告,README 把它描述為 analyst-grade research reports,涵蓋視覺化與敘述。如果你的下游要的是給人看的交付物而不是程式碼,這個差異會體現在整合成本上。

第三個差別是可後訓練性。通用代理你只能調 prompt 或換模型;DeepAnalyze 因為釋出了 DataScience-Instruct-500K,你可以在此基礎上做領域適配。代價是你得有能力做後訓練,這對多數團隊不是小事。

反過來說,通用代理的優勢是生態與彈性:工具鏈成熟、模型選擇多、遇到非資料科學任務不必換系統。如果你只需要偶爾跑一次分析,通用代理加現成工具的成本更低。DeepAnalyze 的價值在於把資料科學這條窄而深的流程做成一體,窄與深既是它的優勢也是它的邊界。

維護成本與採用判斷

維護成本有三塊。第一塊是模型推論環境,8B 權重需要 GPU 與相應的服務框架,這部分與其他自架 LLM 專案沒有本質差別。第二塊是沙箱,Docker 映像需要跟著更新,容器策略需要隨你的資料治理要求調整,這塊是持續的。第三塊是版本追蹤,由於沒有正式 release,你得自己盯 News 條目與 commit 來決定何時升級。

授權方面,repo 採用 MIT,這是相對寬鬆的選擇,允許商用與修改。但如前所述,模型權重與資料集託管在 Hugging Face,其授權條件不在這份 README 的範圍內,採用前應自行確認。這裡不提供法律意見,只指出資訊缺口的位置。

至於該不該用,判斷點很具體:你有沒有可跑 8B 的硬體、你的資料能不能放進容器、以及你能不能用內部題目驗證它在多檔案檢索上的表現。這三題有一題答不出來,這個專案對你就還是觀望階段。

編輯結論

如果你要的是一個可以自己部署、自己微調、跑在內部資料上的資料分析代理,DeepAnalyze 把模型權重、訓練語料(DataScience-Instruct-500K)與 WebUI 一起放出來,這在同类專案裡並不常見,值得先下載 DeepAnalyze-8B 權重並照 demo/chat_v2/README.md 起一次 Docker 沙箱,確認你的資料在容器內的掛載與網路策略符合內部規範。如果你的場景只是單一 CSV 的問答,或團隊沒有可跑 8B 推論的 GPU,這個專案的整套管線與沙箱反而增加維運面,用一般程式代理加 pandas 就夠。評估時先驗證三件事:模型在你的資料庫連線下能否正確產生可執行 SQL、沙箱是否真的隔離了檔案系統、以及報告輸出的引用是否指回真實欄位。

官方來源

  1. Issues
  2. License: MIT
  3. Project website
  4. README
  5. ruc-datalab/DeepAnalyze on GitHub
社群筆記

社群筆記