PyGPT 桌面 AI 助理:把多供應商模型、外掛與 RAG 收進同一個 Python 桌面程式
Desktop AI Assistant powered by GPT-5, GPT-4, o1, o3, Gemini, Claude, Ollama, DeepSeek, Perplexity, Grok, Bielik, chat, vision, voice, RAG, image and video generation, agents, tools, MCP, plugins, speech synthesis and recognition, web search, memory, presets, assistants,and more. Linux, Windows, Mac
秒懂
- 它是什麼?
- PyGPT 是一個以 Python 撰寫的桌面 AI 助理,把 OpenAI、Gemini、Claude、Grok、DeepSeek、Perplexity 與本機 Ollama 等模型接進同一個介面。它的價值在於整合度,代價是安裝與相依鏈的複雜度,而授權條款在倉庫中並未給出明確的 SPDX 標識。
- 適合誰用?
- 如果你需要一個能在本機同時操作多個供應商模型、要 RAG、要語音、要外掛與排程,而且願意接受 Python 3.10 到 3.13 的相依鏈與桌面應用程式形態,PyGPT 值得裝起來試。若你只需要單一供應商的對話介面,或你的環境不允許應用程式執行本機 Python 與系統指令,這個工具帶來的攻擊面與維護成本並不划算。
- 可以商用嗎?
- 請先確認。這個儲存庫使用的授權不在我們自動分類的範圍內,商用前請閱讀儲存庫中的 LICENSE 檔案。
- 還在維護嗎?
- 有在維護。儲存庫在最近一天內有新的提交。
- 用什麼語言寫的?
- 主要是 Python(依據 GitHub 的語言統計)。
以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。
開源專案深度解析
PyGPT 要解決的是模型散落各處的問題
多數人使用大型語言模型的日常是這樣:瀏覽器開著 ChatGPT,另一個分頁是 Claude,本機跑著 Ollama,某個專案的檢索流程又寫在另一支腳本裡。對話紀錄分散、API key 分散、檔案上傳方式各異。PyGPT 的定位就是把這些收斂成一個桌面程式。README 開頭寫得直白,它是一個 all-in-one desktop AI assistant,支援 OpenAI 的 GPT-6 Astra、GPT-5.6、GPT-4、o1、o3,以及 Google Gemini、Anthropic Claude、xAI Grok、Perplexity / Sonar、DeepSeek,還有透過 HuggingFace、LlamaIndex、OpenAI 相容 API 與本機 Ollama 取得的模型,例如 Gemma 4、Qwen 3.6、Llama 4、Mistral Small 3.2、Bielik、Nemotron、gpt-oss。
目標使用者不是模型研究者,而是把模型當工具的人。README 明說 Requires no previous knowledge of using AI models,並列出 11 種操作模式:Chat、Chat with Files、Realtime + audio、Research(走 Perplexity)、Completion、Image and Video generation、Experts、Computer use、Agents v2(beta)、Agents 與 Autonomous Mode。這種廣度是它的賣點,也是它難以被輕量替代的原因。你不需要為每個供應商準備一套介面,但你也必須接受一個功能很多、更新很頻繁的桌面程式。
值得注意的是憑證模型:PyGPT 不代管 API key,使用者用自己的帳號與金鑰連線,本機模型則不需要外部憑證。這對在意資料流向的人是好消息,因為請求直接從你的機器送往供應商,不經過第三方中轉。
Agents v2 與 LlamaIndex 在架構上的分工
從 README 能確認的架構輪廓是分層的。最底層是模型接入層,透過各家 API 與 OpenAI 相容介面統一呼叫。往上一層是 LlamaIndex 驅動的檢索層,負責 Chat with Files。再往上是外掛與工具層,包含 Files I/O、Code Interpreter、Web Search、Google、Facebook、X/Twitter、Slack、Telegram、GitHub、MCP 等內建外掛。最上層是模式與代理編排,包含 node-based Agents Builder,以及 README 描述為 advanced orchestrated multi-agent mode 的 Agents v2(beta),其中有一個面向使用者的 Orchestrator 與動態管理的 worker agents。
檢索部分值得單獨看。README 列出可對話的資料型別:txt、pdf、csv、html、md、docx、json、epub、xlsx、xml,加上網頁、Google、GitHub、影片與音訊、圖片。它內建向量資料庫支援與自動化的檔案與資料嵌入,也可以把對話歷史本身當成額外上下文餵給模型。這個設計意味著長期記憶不是靠把整段歷史塞進 prompt,而是靠嵌入與檢索。
工具執行是另一個關鍵機制。README 提到內建 Python/OS 工具具備 real-time Python / IPython execution,模型可以操作檔案、執行 Python 與系統或自訂命令、傳輸檔案、呼叫外部 API、以 DuckDuckGo、Google、Microsoft Bing 搜尋網頁。這條路徑是 PyGPT 能力最強也最需要警戒的地方,因為它把模型輸出直接接到本機執行環境。
安裝路徑:pip、Snap、AppImage 與編譯版
README 給出的安裝來源有幾個。PyPi 上的套件名是 pygpt-net,Snap Store 有 pygpt,Microsoft Store 有對應條目,GitHub Releases 提供 AppImage,官網另提供 Linux 與 Windows 的 64 位元編譯版下載。Python 版本限制寫得很明確:Python: >=3.10, <3.14。
編譯版的部分,README 說明 Linux 與 Windows 10/11 有現成的安裝檔或壓縮檔,下載後解壓或安裝即可執行。Mac 沒有編譯版,必須從 PyPi 或原始碼執行。這是實際選型時容易忽略的一點:如果你的團隊以 macOS 為主,部署方式就跟 Windows 同事不同,得自己處理 Python 環境。
需要留意的還有金鑰設定。README 說 PyGPT 使用你自己的 API 憑證連線到 OpenAI、Google、Anthropic、xAI、Perplexity、Mistral、OpenRouter 等供應商,依所選模型與供應商而定,可能需要該服務的帳號與有效 API key。本機模型不需要外部憑證。若透過 LlamaIndex 接 HuggingFace 等其他模型,可能還需要額外的 API key。
README 沒有在提供的內容中列出完整的設定檔路徑或 config key 清單,因此無法在此給出精確的設定鍵名稱。實際設定項目需要對照官方文件 pygpt.readthedocs.io。
外掛與 MCP:能力邊界等於風險邊界
PyGPT 的外掛不是裝飾。README 明列 Files I/O、Code Interpreter、Web Search、Google、Facebook、X/Twitter、Slack、Telegram、GitHub、MCP,並提到可以建立自訂命令。搭配內建的 Python/OS 工具,這代表一個模型回應可以觸發本機檔案存取、Python 執行、系統命令執行,或對外服務的呼叫。
把這些能力放在同一個信任邊界裡,是這個專案最需要被嚴肅看待的設計取捨。提示注入不再只是讓模型說錯話,而是可能讓模型執行你沒打算執行的本機操作。README 對這層風險沒有給出對應的沙箱或權限隔離說明,至少在提供的內容中看不到。這不代表專案沒有相關機制,只代表從這份材料無法確認。
MCP 支援則意味著你可以把外部工具伺服器接進來,能力可以再擴張。對願意自己控管工具清單的人來說這是優點;對希望開箱即安全的人來說,這是一段需要自己補上的功課。
另一個實際限制是 Agents v2 仍標示為 beta。README 把它列為 advanced orchestrated multi-agent mode,但 beta 標籤本身說明介面與行為可能還在變動。把它放進正式流程前,要預期升級時可能需要重新調整。
與 Open WebUI 的差異:桌面程式對上自架服務
同類工具裡最常被拿來對比的是 Open WebUI。兩者都支援多供應商模型與檢索,差別在形態。Open WebUI 是自架的網頁服務,通常跑在伺服器或容器裡,使用者透過瀏覽器連線,多人的帳號與權限管理是它的核心場景。PyGPT 是安裝在個人電腦上的桌面程式,對話、檔案、向量索引與外掛執行都在本機。
這個差別會直接影響三件事。第一是資料位置:PyGPT 的檔案與嵌入留在你的機器上,Open WebUI 則取決於你把服務部署在哪。第二是執行權限:PyGPT 的內建 Python/OS 工具讓模型能操作本機環境,網頁服務形態的產品通常不會把這條路徑交給單一使用者。第三是多人協作:PyGPT 不是為團隊共用設計的,README 描述的是一台電腦上的一個助理。
如果你的需求是讓十幾個同事共用一組模型與知識庫,PyGPT 的形態不匹配。如果你的需求是個人深度操作本機檔案加上多模型切換,桌面程式的直接性反而是優勢。
無障礙、語音與排程這些容易被忽略的部分
README 有一項少見的宣告:included support features for individuals with disabilities,包含可自訂鍵盤快速鍵、語音控制,以及把螢幕上的動作透過語音合成轉成音訊。這不是行銷詞,而是具體的功能描述,對需要替代操作方式的鍵盤重度使用者有實際意義。
語音方面,語音合成支援 OpenAI、Microsoft Azure、Google Cloud / GenAI、Eleven Labs、xAI;語音辨識支援 OpenAI Whisper(API 或本機)、Google / Google Cloud / GenAI、Microsoft Bing、xAI Grok Voice。本機 Whisper 這條路徑對不想把音訊送到雲端的人有用。
排程方面,README 提到內建 crontab / task scheduler,以及整合的行事曆、每日筆記與依日期搜尋上下文。這讓 PyGPT 可以承擔定時任務的觸發角色,而不只是被動回應。圖像與影片生成則透過 gpt-image、Imagen、Gemini、Nano Banana 以及 Veo3、Sora2 等模型。這些功能是否可用,取決於你手上的供應商帳號與該模型的地區可用性,README 沒有逐一說明限制。
維護成本與授權的不確定性
從發布紀錄看,v2.8.13 於 2026-09-09 發布,前一版 v2.8.12 是 2026-09-08,v2.8.10 是 2026-09-06。三天內三個版本,代表維護活躍,也代表更新節奏快。對個人使用者而言這通常無感;對需要在組織內標準化版本、寫部署腳本、驗證每次升級的團隊而言,這是持續的人力支出。桌面程式的升級不像伺服器端服務那樣可以集中控制,每台機器都要各自處理。
授權是更該先確認的一點。倉庫的 License 欄位顯示為 NOASSERTION,也就是 GitHub 無法自動識別出標準授權標識。README 只說 The application is free, open-source,並未在提供的內容中指明具體授權條款。這不是說授權有問題,而是說從這份材料無法判斷條款內容。在把它納入公司流程之前,應該直接讀倉庫中的 LICENSE 檔案,確認使用、修改與再散布的條件,必要時請教法務。這裡不提供法律意見,只指出這是必須自行查證的欄位。
相依鏈也是成本。README 要求 Python >=3.10, <3.14,且整合了 LlamaIndex、向量資料庫、多家 TTS 與 STT 服務的 SDK。這些套件各自的更新與相依衝突,會反映在你每次重建環境的時間上。
編輯結論
如果你需要一個能在本機同時操作多個供應商模型、要 RAG、要語音、要外掛與排程,而且願意接受 Python 3.10 到 3.13 的相依鏈與桌面應用程式形態,PyGPT 值得裝起來試。若你只需要單一供應商的對話介面,或你的環境不允許應用程式執行本機 Python 與系統指令,這個工具帶來的攻擊面與維護成本並不划算。動手前先確認三件事:倉庫的 LICENSE 內容與你所在組織的合規要求是否相符,因為倉庫標示為 NOASSERTION;你的 Python 版本是否落在 >=3.10, <3.14 的區間;以及你是否接受外掛能觸及本機檔案系統與命令列。這三項確認完再決定要不要把它當成日常工作介面。
社群筆記