模型 / 資料集
SkyworkAI/Skywork-R1V avatar
SkyworkAI/Skywork-R1V

Skywork-R1V3:38B 多模態推理模型的推論腳本與採用門檻

Skywork-R1V is an advanced multimodal AI model series developed by Skywork AI, specializing in vision-language reasoning.

3,170 個 Star282 個 ForkPythonMIT

秒懂

它是什麼?
SkyworkAI 釋出的多模態推理模型系列,以 InternVL3-38B 為底座、經強化學習後訓練,開源的是權重與推論程式碼,而非訓練流程。本文聚焦它實際提供的東西:兩個推論腳本、一套評測重現路徑,以及 38B 規模帶來的硬體代價。
適合誰用?
如果你需要一個可商用、權重開放的多模態推理模型,而且手上有 38B 等級的推論資源,Skywork-R1V3 值得納入候選;若你只有單張 24GB 卡、或需要自行微調訓練流程,這個倉庫目前給不了你。動手前先確認三件事:你的硬體能否承載 38B(README 對 R1V2 提到 AWQ 量化版可在 30GB 以上單卡推論,但沒有對 R1V3 給出同樣的量化版本),你的評測協定是否與倉庫 eval 目錄可比,以及你是否接受以 MMMU 76.0 這類自報數字作為選型依據。
可以商用嗎?
可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 49 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

它解決的是視覺推理,不是視覺辨識

多模態模型過去幾年的進步集中在「看得懂」:圖片分類、OCR、圖表問答。但工程上真正卡住的是「看得懂之後能不能推」。一張幾何圖形加上文字條件,模型要能串起多步推導;一份物理試題的示意圖,模型要能從圖中抽取量綱關係再代入公式。這類任務的失敗通常不是辨識錯誤,而是推理鏈斷掉。Skywork-R1V 系列就是針對這個縫隙:README 把它定位為「multimodal reasoning model by reinforcement finetuning」,R1V3 的說明寫得更直接,主要透過後訓練階段的 RL 演算法強化多模態推理能力。

目標讀者相當明確。一是做評測或研究、需要一個開源權重可重現的對照組;二是產品團隊想在不把資料送進閉源 API 的前提下,處理帶圖的推理型問題,例如教育題解、工程圖審、報表推理。反過來說,如果你的需求是高速圖片分類或大規模 OCR,這個模型是過重的工具,38B 的參數量換來的推理能力在那些任務上沒有回報。

底座是 InternVL3-38B,開源的是結果不是過程

README 的 License 段落寫明,這個專案使用 InternVL3-38B 作為 base model,而後者同樣採 MIT 授權。這點對採用決策的影響比表面看起來大:模型的視覺編碼器與語言主幹來自 InternVL3,Skywork 的貢獻集中在後訓練階段。倉庫裡放的是模型權重與推論程式碼,README 自己的措辭是「you'll find the model weights and inference code」。

也就是說,如果你想理解 RL 是怎麼跑的、獎勵訊號怎麼設計、資料怎麼篩,這個倉庫不提供。技術報告以 arXiv 論文形式存在(R1V3 對應 2507.06167,R1V 初版對應 2504.05599),但程式碼層面的訓練管線並未開源。對純推論使用者這無所謂;對想在自己的領域資料上重跑後訓練的團隊,這是一道實質的牆。倉庫的 topics 裡列了 grpo 與 reinforcement-learning,但那是主題標籤,不等於可執行的訓練腳本。

推論路徑有兩條:Transformers 與 vLLM

倉庫把推論程式碼放在 inference 目錄下,README 給的起手式是先複製倉庫再切進去。環境分成兩套 conda 環境:一套給 Transformers,用 setup.sh 建置;另一套給 vLLM 與評測,用 eval/vlmevalkit/build_env.sh。兩者都指定 Python 3.10。

Transformers 路徑的呼叫方式是指定模型路徑、一張或多張圖片路徑,以及問題字串,並用 CUDA_VISIBLE_DEVICES 控制可見的 GPU。vLLM 路徑多了 tensor_parallel_size 參數,README 範例給的是 4,同時示範了多圖輸入(image_paths 後面接兩個路徑)。這個差異值得注意:vLLM 那條路是為了張量平行推論準備的,38B 的規模在單卡上通常不現實,範例用 4 路張量平行暗示了作者預期的部署形態。

量化方面,README 的 news 段落顯示 R1V 與 R1V2 都釋出過 AWQ 版本,並註明支援 30GB 以上單卡推論。但 R1V3 的公告裡沒有提到對應的 AWQ 版本。這是選型時必須自己確認的一點:如果你打算靠量化把 38B 塞進單張卡,R1V3 目前在這份材料裡沒有保證。

評測數字是自報的,重現路徑要看清楚

README 附了一張跨模型的比較表,涵蓋 MMMU、MMMU-pro、MathVista、MathVerse、MathVision、Visulogic、PhyX 等,並用獎盃標記 Skywork-R1V3 在該項的領先位置。MMMU (val) 一項標為 76.0,對照組包含 QVQ-72B、InternVL-78B、Qwen-72B、Claude 3.7 與 GPT-4o。表格註腳說明,標星號的數字來自作者自己的評測框架。

這裡有兩個需要讀者自己拿捏的地方。第一,這些數字由模型發布方產出,不是第三方獨立複核,表格裡同時混入了自家框架跑出的他人成績,跨欄比較的公平性取決於評測協定是否一致。第二,表格並非全面領先:EMMA (mini-cot) 一項 Claude 3.7 的 56.5 明顯高於 Skywork 的 40.3,MMBench-en-1.1 由 Qwen-72B 的 88.0 居首,LogicVista 由 GPT-4o 的 64.4 領先。倉庫提供 eval 目錄讓使用者重跑,這是比較誠實的做法,但重跑要花多少算力、與原表能否對齊,材料裡沒有說明。

38B 這個數字決定了誰用得起

整個系列的旗艦都是 38B 級別:R1V-38B、R1V2-38B、R1V3-38B。這個規模不是隨手選的,它直接決定了部署形態。README 對 R1V 與 R1V2 的 AWQ 版本註明「supporting single-card (above 30GB) inference」,換句話說,未量化的原版連單張 30GB 卡都放不下。

於是採用門檻變得具體:多卡推論、或等待量化版本。vLLM 範例的 tensor_parallel_size 4 是作者給出的參考值,不是下限也不是上限,實際需要幾張卡取決於精度、序列長度與批次大小。對比之下,社群裡同類定位的模型有不少 7B 到 13B 的選項,能在單張消費級卡上跑起來,代價是推理深度通常較淺。這是一個純粹的取捨,沒有免費的午餐。

另一個容易被忽略的成本是推論延遲。推理型模型會產生較長的思考鏈,token 數遠高於一般視覺問答模型,在批次吞吐吃緊的服務裡,這會直接反映在單次回應時間與單位成本上。材料沒有給出延遲或吞吐數字,這點只能靠實測。

什麼情況下該選別的方案

最直接的替代是底座本身:InternVL3-38B。兩者同為 MIT 授權,Skywork-R1V3 是在它之上做 RL 後訓練的產物。差別在於,如果你要的是穩定的通用視覺理解與較短的輸出,原版底座是更保守的選擇;如果你要的是多步推理與可展示的思考過程,R1V3 的後訓練才是價值所在。這個差異不是效能高低,而是輸出形態。

另一個方向是體積小得多的推理型視覺模型。它們的優勢很實際:單卡可跑、延遲低、微調成本可控。劣勢同樣實際:在 MMMU-pro、MathVerse 這類需要長鏈推理的項目上,小模型的表現通常下降明顯。選哪邊取決於你的任務裡「推理深度」佔多少比重,而不是取決於排行榜名次。

還有一種情況是根本不需要開源模型。如果你能接受資料出境、且任務量不大,直接呼叫閉源 API 在工程成本上往往更低。開源權重的價值在於資料主權、可本地部署、可審計,若這三點對你不成立,38B 的維運負擔就是純粹的支出。

授權寬鬆,但授權不是唯一的風險面

倉庫採 MIT 授權,README 用勾叉列表概括:允許商業使用、允許修改、允許散布、不承擔責任。底座 InternVL3-38B 同樣是 MIT。就授權條款本身而言,這對商業採用是相對友善的組合,沒有看到額外的使用限制條款。

但有兩件事授權條款不會替你解決。第一,模型權重來自 Hugging Face 上的獨立倉庫(Skywork/Skywork-R1V-38B),倉庫本身的授權與權重頁面的授權聲明是否完全一致,採用前值得自己核對一次。第二,訓練資料的來源與合規性不在 MIT 的涵蓋範圍內,README 沒有交代資料組成,這一點在需要做合規審查的場景下是個空白。以上是對條款的閱讀,不構成法律意見,涉及具體產品請諮詢法務。

維護層面,README 的 news 時間線顯示 2025 年 3 月到 7 月間連續發布了 R1V、R1V2、R1V3 三個版本,節奏相當快。這對採用者是雙面訊號:模型在持續演進,但也意味著版本更迭可能帶來重新驗證的成本。倉庫在 2026 年 7 月底仍有推送,表示專案未封存,但這份材料裡沒有取得任何 release 資訊,無法判斷版本管理的嚴謹程度。升級前建議先確認新版本的評測協定是否與你現有的驗證流程一致,否則每次換版都要重跑一遍基準。

編輯結論

如果你需要一個可商用、權重開放的多模態推理模型,而且手上有 38B 等級的推論資源,Skywork-R1V3 值得納入候選;若你只有單張 24GB 卡、或需要自行微調訓練流程,這個倉庫目前給不了你。動手前先確認三件事:你的硬體能否承載 38B(README 對 R1V2 提到 AWQ 量化版可在 30GB 以上單卡推論,但沒有對 R1V3 給出同樣的量化版本),你的評測協定是否與倉庫 eval 目錄可比,以及你是否接受以 MMMU 76.0 這類自報數字作為選型依據。

官方來源

  1. Issues
  2. License: MIT
  3. Project website
  4. README
  5. SkyworkAI/Skywork-R1V on GitHub
社群筆記

社群筆記