xiaozhi-esp32-server 後端服務:搭建自己的 ESP32 設備控制伺服器
xiaozhi-esp32 xiaozhi-esp32 的 ESP32 後端服務,協助您快速建置 ESP32 裝置控制伺服器。
秒懂
- 它是什麼?
- 為開源智慧硬體專案 xiaozhi-esp32 提供後端服務,支援 MQTT+UDP、WebSocket、MCP 接入點、聲紋辨識和知識庫。
- 適合誰用?
- xinnan-tech/xiaozhi-esp32-server 適合需要 README 所列功能、並能配合其環境條件的人,不適合把文件中的功能描述直接當成生產保證的場景。採用前請依 xinnan-tech/xiaozhi-esp32-server 的 README.md 執行其中的安裝或啟動命令,觀察本專案實際產生的輸出、錯誤訊息、權限需求與資料位置,再決定是否導入。
- 可以商用嗎?
- 可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
- 還在維護嗎?
- 有在維護。儲存庫最近一次提交在 1 天前。
- 用什麼語言寫的?
- 主要是 JavaScript(依據 GitHub 的語言統計)。
以上回答依據專案的 GitHub 資料(最近同步於 2026年9月14日)與我們的分析,不構成法律意見。
開源專案深度解析
xinnan-tech/xiaozhi-esp32-server:這個後端服務是做什麼的
xinnan-tech/xiaozhi-esp32-server 是開源智慧硬體專案 xiaozhi-esp32 的後端服務。根據 README 的說明,它使用 Python、Java 和 Vue 實作,遵循小智通訊協定。服務支援 MQTT+UDP 協定、Websocket 協定、MCP 接入點、聲紋辨識和知識庫。明確的目標使用者是已經擁有 ESP32 硬體、曾經連線過現有小智後端服務、現在想獨立搭建自己的後端服務的人。專案由華南理工大學劉思源教授團隊主導研發。
針對 xinnan-tech/xiaozhi-esp32-server 的第 1 節,可依 README.md 的安裝與使用說明檢查這一節提到的輸入、輸出或設定;文件沒有說明的相容性與效能,不延伸解讀。
xinnan-tech/xiaozhi-esp32-server:兩種部署方式和配置方案
README 記錄了兩種部署方式。簡化安裝面向低配置環境,資料儲存在配置檔案中,不需要資料庫,可以透過 Docker 或原始碼執行。全模組安裝增加了多使用者管理、多智慧體管理和智慧控制台,資料儲存在資料庫中。兩種方式都有 Docker 和原始碼路徑。同時還提供兩種配置方案:入門級免費設定,適合個人和家庭使用,全部元件採用免費方案;流式配置適合示範、培訓和兩個以上並發使用者的場景,從 0.5.2 版本開始支援,回應速度相比早期版本大約提升 2.5 秒。
針對 xinnan-tech/xiaozhi-esp32-server 的第 2 節,可依 README.md 的安裝與使用說明檢查這一節提到的輸入、輸出或設定;文件沒有說明的相容性與效能,不延伸解讀。
xinnan-tech/xiaozhi-esp32-server:已實現的功能模組
功能列表包括基於 MQTT+UDP 閘道器、WebSocket 和 HTTP 伺服器的核心架構,帶有完整的控制台管理和認證系統。語音互動支援流式 ASR、流式 TTS、VAD、多語言辨識和語音處理。聲紋辨識支援多使用者註冊、管理和即時說話人辨識,與 ASR 平行處理。智慧對話支援多種大型語言模型,視覺感知支援多種視覺大型模型。意圖辨識支援 function_call 和專用意圖模型,記憶系統包括本地短期記憶、mem0ai 和 PowerMem。知識庫整合 RAGFlow,讓 LLM 決定是否查詢知識庫。工具呼叫支援用戶端 IOT、用戶端 MCP、伺服器端 MCP、MCP 端點和自訂函式。管理後端提供 Web 介面,支援使用者、系統和裝置管理,介面支援簡繁中文和英文。還有測試工具、Docker 和本地部署支援,以及支援熱載入的插件系統。
針對 xinnan-tech/xiaozhi-esp32-server 的第 3 節,可依 README.md 的安裝與使用說明檢查這一節提到的輸入、輸出或設定;文件沒有說明的相容性與效能,不延伸解讀。
xinnan-tech/xiaozhi-esp32-server:支援的第三方元件和服務
README 用表格列出了支援的平台。LLM 方面,OpenAI 介面呼叫支援阿里雲百煉、火山引擎、DeepSeek、智譜、Gemini 和訊飛,其中智譜和 Gemini 標註為免費;還支援 Ollama、Dify、FastGPT、Coze、Xinference 和 HomeAssistant。說明指出任何支援 OpenAI 介面呼叫的 LLM 都可以整合。視覺模型支援智譜 ChatGLMVLLM 作為免費選項,其他 OpenAI 相容的 VLLM 也可以使用。TTS 包括 EdgeTTS、訊飛、火山引擎、騰訊雲、阿里雲等,本地服務包括 FishSpeech、GPT-SOVITS、Index-TTS 和 PaddleSpeech。VAD 使用 SileroVAD,本地免費。ASR 支援 FunASR 和 SherpaASR 本地使用,以及火山、訊飛、騰訊、阿里、百度和 OpenAI ASR 介面。聲紋辨識使用 3D-Speaker 本地執行。記憶選項有 mem0ai、PowerMem、mem_local_short 和 nomem。意圖辨識使用 intent_llm、function_call 或 nointent。RAG 透過 ragflow 提供。
針對 xinnan-tech/xiaozhi-esp32-server 的第 4 節,可依 README.md 的安裝與使用說明檢查這一節提到的輸入、輸出或設定;文件沒有說明的相容性與效能,不延伸解讀。
xinnan-tech/xiaozhi-esp32-server:測試工具和效能測量
專案提供兩個測試工具。音訊互動測試工具位於 main/digital-human/index.html,執行 python start.py 後開啟 http://127.0.0.1:8006/index.html,可以測試音訊播放和接收,驗證 Python 側音訊處理是否正常。模型回應測試工具位於 main/xiaozhi-server/performance_tester.py,執行 python performance_tester.py 可以測試 ASR、LLM、VLLM 和 TTS 三個核心模組的回應速度。README 特別說明,只有配置了 API 金鑰的模型才會被測試。另外還引用了一個獨立的效能研究倉庫,提供元件延遲測試方法。
針對 xinnan-tech/xiaozhi-esp32-server 的第 5 節,可依 README.md 的安裝與使用說明檢查這一節提到的輸入、輸出或設定;文件沒有說明的相容性與效能,不延伸解讀。
xinnan-tech/xiaozhi-esp32-server:警告、專案狀態和許可證
README 中有明確的警告。這是開源軟體,與其對接的第三方 API 服務提供商(包括語音辨識、大型模型、語音合成等)沒有商業合作關係,也不對其服務品質和資金安全提供任何形式的擔保。建議使用者優先選擇具有相關業務許可證的服務商,並仔細閱讀服務協定和隱私政策。該軟體不託管任何帳戶金鑰,不參與資金流動,不承擔充值資金損失的風險。專案功能並不完整,尚未通過網路安全評估,請不要在生產環境中使用。如果是為了學習目的部署在公網環境,請確保採取必要的防護措施。軟體採用 MIT 許可證,允許自由使用、複製、修改、合併、發布、分發、再許可和銷售,但不提供任何明示或暗示的擔保。
針對 xinnan-tech/xiaozhi-esp32-server 的第 6 節,可依 README.md 的安裝與使用說明檢查這一節提到的輸入、輸出或設定;文件沒有說明的相容性與效能,不延伸解讀。
xinnan-tech/xiaozhi-esp32-server:致謝和小智生態系統
專案在 README 中致謝了多個貢獻方。它受到百靈語音對話機器人的啟發並在此基礎上實現。Tenclass 被感謝為小智生態制定了標準通訊協定、多裝置相容方案和高並發場景實踐,並提供全鏈路技術文件。玄風科技貢獻了函式呼叫框架、MCP 通訊協定和基於插件的呼叫機制。huangjunsen 貢獻了智慧控制台行動端模組。慧遠設計和西安秦人資訊科技提供了視覺設計方案。README 還連結到小智生態中的其他開源專案,說明小智是一個生態系統。
針對 xinnan-tech/xiaozhi-esp32-server 的第 7 節,可依 README.md 的安裝與使用說明檢查這一節提到的輸入、輸出或設定;文件沒有說明的相容性與效能,不延伸解讀。
編輯結論
xinnan-tech/xiaozhi-esp32-server 適合需要 README 所列功能、並能配合其環境條件的人,不適合把文件中的功能描述直接當成生產保證的場景。採用前請依 xinnan-tech/xiaozhi-esp32-server 的 README.md 執行其中的安裝或啟動命令,觀察本專案實際產生的輸出、錯誤訊息、權限需求與資料位置,再決定是否導入。
社群筆記