vox-director:把一行主題變成 Vox 紙拼貼影片的 agent skill
Turn one topic into a finished Vox-style paper-collage explainer/ad video — automated end to end on Atlas Cloud + ffmpeg. An agent skill.
秒懂
- 它是什麼?
- vox-director 是一個 Python 撰寫的 agent skill,讓 Claude Code、Codex 這類編碼代理依固定流程呼叫 Atlas Cloud 上的影像、影片、語音與音樂模型,再用本機 ffmpeg 合成紙拼貼風格的說明或廣告影片。它真正賣的不是模型,而是兩個人工決策關卡與一套被寫死的製作順序。
- 適合誰用?
- 若你已經有 Atlas Cloud API key,想用一行主題快速產出 15 到 60 秒的紙拼貼風格短片,vox-director 的價值在於它把「先定節拍、再定視覺」的順序寫進 SKILL.md,讓代理不能跳過 GATE 1 與 GATE 2。若你不能接受素材上傳到第三方雲端、或需要逐格可控的動態,這個工具不是合適的起點,因為它的動態預設由模型整張生成,本機關鍵影格引擎只是可選路徑。
- 可以商用嗎?
- 可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
- 還在維護嗎?
- 有在維護。儲存庫最近一次提交在 35 天前。
- 用什麼語言寫的?
- 主要是 Python(依據 GitHub 的語言統計)。
以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。
開源專案深度解析
它解決的是「有主題、沒有片子」這個缺口
多數文字轉影片工具處理的是單一鏡頭:給一句描述,回一段幾秒的動態。vox-director 處理的是另一種缺口,你手上只有一個題目,例如「墨西哥街頭小吃的歷史」,卻要交出一支有敘事、有旁白、有字幕、有配樂的成品。README 把它定位成 agent skill,而不是獨立 CLI,這點決定了它的使用方式:你對 Claude Code 或 Codex 說一句話,代理去讀 SKILL.md,照著裡面的階段跑腳本。目標使用者是已經在用編碼代理、也願意為雲端模型付費的人。純剪輯工作者不會從這裡得到什麼,因為它不提供時間軸介面,唯一的控制點是 beats.json 與兩次人工確認。
beats.json 是唯一的事實來源
整個流程由每個專案一份 beats.json 驅動,這是理解這個專案最快的方式。README 給出的資料流是六個階段:beat map 寫出 beats.json、style bake-off 用三到四種主題渲染同一個 beat、keyframes 用 nano-banana-2 產出每 beat 一張拼貼海報、motion 把海報動起來、voice 與 music 各出一軌、最後 ffmpeg 串接並把配樂壓在旁白之下、燒上字幕與浮水印。關鍵在於階段之間的介面是檔案而不是記憶體:每一階段讀上一階段的產物,寫下自己的輸出。這讓流程可以中斷後重跑,也讓你能手動改 beats.json 再從第三階段繼續。代價是它假設每階段都成功,README 沒有描述部分失敗時的回滾策略,只提到 A-roll 會在 video-edit 失敗時自動重試 seedance-2.0/reference-to-video。
兩個人工關卡是這個專案最誠實的設計
README 在流程圖上標了 GATE 1 與 GATE 2。GATE 1 是你審核 beat map,也就是在花錢生成任何影像之前先確認敘事結構。GATE 2 是 style bake-off,同一個 beat 用三到四種主題各渲染一次,你憑眼睛挑一個。這個安排承認了一件事:模型能不能生出好看的拼貼海報,事前無法預測,只能先看樣張。它也把成本攤開,bake-off 階段會多跑三到四倍的影像生成,這是刻意的浪費。相較之下,市面上多數同類工具把風格參數化成一串關鍵字就開始生成,出錯只能整支重來。vox-director 把判斷點提前,但代價是流程需要你中途回來做決定,無法完全無人值守。
三種輸入模式共用同一個引擎
B-roll 是最完整的一條路:只給主題,六個階段全自動。A-roll 處理你已經有真人對嘴影片的情況,README 說它用 ASR 切分成 beats,再以 gemini-omni-flash/video-edit 重新風格化成拼貼外觀,並保留原本的臉、對嘴與手勢,失敗時自動改用 seedance-2.0/reference-to-video。C-roll 處理只有一張靜態照片的情況,主體會被切成「攝影貼紙」而不重繪,每個 beat 的海報圍繞它生成,旁白還可以用 bytedance/seed-audio-1.0 複製主體的聲音。三條路共用同一套 beats.json 與後段組裝。這裡有個值得注意的邊界:A-roll 聲稱保留 frame-for-frame 的真實畫面,但這取決於 video-edit 模型的輸出品質,README 沒有提供任何比對樣本,實際落差需要你自己跑一支來確認。
安裝與執行:從 clone 到 final.mp4
安裝有兩條路。從 repo 安裝是 git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director,Claude Code 會自動辨識成 skill;非 Claude 的代理則讀 AGENTS.md 再進 SKILL.md。另一條路是下載打包好的 vox-director.skill 從 skills UI 安裝。接著要設環境變數 export ATLASCLOUD_API_KEY="sk-...",金鑰從 Atlas Cloud 主控台取得。本機需求是 ffmpeg 與 ffprobe(README 給的是 brew install ffmpeg)、Python 3 加 Pillow(pip install pillow),後者用於字幕與浮水印疊圖。實際使用是對代理說一句話,例如指定語言、16:9、15 秒,代理會先草擬 beat map 等你確認,跑 bake-off 讓你挑風格,再生成 keyframes、motion、voice、music,最後輸出 out/<project>/final.mp4。模型 ID 會變動,所以 skill 在執行前會先打 GET https://api.atlascloud.ai/api/v1/models 取即時清單,這個設計避免了硬編碼模型名稱的腐化問題,但也意味著你的產出會隨雲端目錄變動而改變。
模型依賴與可替換性
README 列出的模型分工很細:nano-banana-2 負責文字生圖與 C-roll 的圖片編輯,gemini-omni-flash 負責圖生影片與 A-roll 的影片重繪,kling-video-o3-pro 專門處理真實人物與品牌的動態,xai/tts-v1 做旁白,minimax/music-2.6 做配樂,youchuan/v8.1/remove-background 是進階路徑的抠圖。這份清單全部綁在 Atlas Cloud 上,沒有本地推論選項。也就是說,這個專案的可用性等於 Atlas Cloud 的可用性,模型下架、改名或定價調整都會直接反映在你的流程上。README 用「verified on Atlas Cloud」描述這張表,但沒有說明驗證時間或驗證方式,所以把它當成一份當下的對照表,而不是長期保證。若你已經有其他供應商的額度,這裡沒有抽象層讓你換掉單一模型。
什麼情況下它是錯的工具
有兩個明確的排除條件。第一,素材不能離開你的環境。B-roll 要把生成的影像送到雲端動畫化,A-roll 要把真人影片上傳做重繪,C-roll 要把照片上傳做貼紙化,這三條路都涉及第三方處理,README 沒有描述任何本地替代方案。第二,你需要逐格可控的動態。README 說預設路徑是讓 AI 影片模型整張動畫化,也就是「活海報」;逐片拼裝的動態要另外走本機關鍵影格引擎,把海報切成部件再逐格驅動。README 把這條路描述為沒有內容過濾、像素精確、適合真人,但它是可選的,不是預設。如果你的需求是精確的排版動態,預設路徑會讓你失望。另外,README 沒有提到任何渲染時長、失敗率或成本數字,所以無法從文件判斷一支 60 秒影片要跑多久或花多少錢。
替代方案與真正的差異
同類工具裡,Remotion 走的是另一條路:你用 React 元件描述每一格,動態由程式碼決定,渲染在本機完成,輸出完全可重現。vox-director 把動態交給模型,換來的是你不用寫任何動畫程式碼,代價是每次輸出不一樣,也無法保證某個元素會出現在某個時間點。兩者的分界線是「可重現性」對「題材廣度」:Remotion 適合品牌規範明確、要重複產出同系列影片的團隊,vox-director 適合一次性的題材探索,例如你只是想看看某個題目用紙拼貼風格講起來是什麼樣子。另一個差異在拼貼外觀本身,Remotion 不會幫你生成手撕紙邊與半色調網點,你得自己準備素材;vox-director 把這些視覺特徵放在 references/prompt-guide.md 的 9 組主題預設裡,這是它相對省事的地方。
維護成本、授權與升級路徑
專案採 MIT 授權,README 也標示 License: MIT。這代表你可以修改與再散布,包含商用,但授權不涵蓋 Atlas Cloud 的 API 使用條款,也不涵蓋生成內容的權利歸屬,這兩件事要各自去讀對應的服務條款。維護面上,這個 repo 沒有發過 release,最後推送時間是 2026 年 8 月 11 日。它的外部依賴有三層:Atlas Cloud 的模型目錄、ffmpeg 的版本行為、以及 Python 的 Pillow。模型目錄那層由 skill 執行時動態抓取,相對安全;ffmpeg 那層取決於你本機版本,README 只給了安裝指令沒有指定版本;Pillow 用在字幕與浮水印疊圖,屬於低風險但仍是必要依賴。升級時最需要複查的是 references/ 底下的 prompt-guide.md 與 beat-layer.md,因為 9 組主題預設與 14 條敘事弧是這個專案的創意核心,模型換代後這些提示詞結構未必還成立。
編輯結論
若你已經有 Atlas Cloud API key,想用一行主題快速產出 15 到 60 秒的紙拼貼風格短片,vox-director 的價值在於它把「先定節拍、再定視覺」的順序寫進 SKILL.md,讓代理不能跳過 GATE 1 與 GATE 2。若你不能接受素材上傳到第三方雲端、或需要逐格可控的動態,這個工具不是合適的起點,因為它的動態預設由模型整張生成,本機關鍵影格引擎只是可選路徑。動手前先確認三件事:GET https://api.atlascloud.ai/api/v1/models 回傳的清單是否仍含 nano-banana-2 與 gemini-omni-flash;本機 ffmpeg 與 ffprobe 是否可用;以及 references/ 底下的主題預設是否符合你的品牌色。這三項任一不成立,流程會停在對應階段而不是產出 final.mp4。
社群筆記