オープンソースプロジェクト
xinnan-tech/xiaozhi-esp32-server avatar
xinnan-tech/xiaozhi-esp32-server

xiaozhi-esp32-server: ESP32音声端末を支える自前バックエンド

xiaozhi-esp32 xiaozhi-esp32 用の ESP32 バックエンド サービスは、ESP32 デバイス コントロール サーバーを迅速に構築するのに役立ちます。

スター 10,571フォーク 3,607JavaScriptMIT

ひと目でわかる

これは何?
xiaozhi-esp32向けにMQTT+UDP、WebSocket、音声処理、MCP、管理画面をまとめるバックエンドです。READMEは開発中でセキュリティ評価未実施と明記しています。
誰に向いている?
xiaozhi-esp32-serverは、対応するESP32ハードウェアを持ち、ASR、LLM、TTSを自分で選びながら音声端末のバックエンドを構築したい開発者向けです。第三者APIの料金や鍵管理を任せたい人、公開ネットワークへすぐ置きたい人には向きません。
商用利用できる?
できます。MIT は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 2 日前です。
何の言語で書かれている?
主に JavaScript です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月14日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

このバックエンドサービスの目的 | xinnan-tech/xiaozhi-esp32-server

xinnan-tech/xiaozhi-esp32-server は、オープンソースのスマートハードウェアプロジェクト xiaozhi-esp32 のバックエンドサービスです。README によると、Python、Java、Vue で実装され、小智通信プロトコルに従っています。このサービスは MQTT+UDP プロトコル、Websocket プロトコル、MCP アクセスポイント、声紋認識、ナレッジベースをサポートしています。明確な対象ユーザーは、ESP32 ハードウェアを所有し、既存の xiaozhi-esp32 バックエンドに接続したことがあり、自分専用のバックエンドを独立して構築したい人々です。プロジェクトは華南理工大学の劉思源教授チームが主導しています。

2つのデプロイ方法と設定オプション | xinnan-tech/xiaozhi-esp32-server

README には2つのデプロイ方法が記載されています。簡易インストールは低構成環境向けで、データは設定ファイルに保存され、データベースは不要です。Docker またはソースコードから実行できます。フルモジュールインストールは、マルチユーザー管理、マルチエージェント管理、インテリジェントコンソールを追加し、データはデータベースに保存されます。両方の方法に Docker とソースコードのパスがあります。また、エントリーレベルの無料設定とストリーミング設定の2つの設定スキームが説明されています。ストリーミング設定はデモや2人以上の同時ユーザー向けで、バージョン 0.5.2 からサポートされ、応答速度が以前のバージョンよりも約2.5秒向上すると報告されています。

実装済みの機能モジュール | xinnan-tech/xiaozhi-esp32-server

機能リストには、MQTT+UDP ゲートウェイ、WebSocket および HTTP サーバーに基づくコアアーキテクチャが含まれ、コンソール管理と認証システムを備えています。音声対話はストリーミング ASR、ストリーミング TTS、VAD、多言語認識、音声処理をカバーしています。声紋認識はマルチユーザー登録とリアルタイム話者識別をサポートし、ASR と並行して処理されます。システムは対話用の複数の大規模言語モデル、マルチモーダル対話用の複数の視覚言語モデル、関数呼び出しまたは専用インテントモデルによる意図認識、ローカル短期記憶、mem0ai、PowerMem を含むメモリシステムをサポートしています。RAGFlow とのナレッジベース統合により、LLM がナレッジベースを照会するかどうかを決定できます。ツール呼び出しは、クライアント IOT、クライアント MCP、サーバー MCP、MCP エンドポイント、カスタム関数をサポートしています。管理バックエンドはユーザー、システム、デバイス管理のための Web インターフェースを提供し、簡体字中国語、繁体字中国語、英語に対応しています。テストツール、Docker およびローカルデプロイのサポート、ホットロード対応のプラグインシステムもあります。

サポートされるサードパーティコンポーネントとサービス | xinnan-tech/xiaozhi-esp32-server

README にはサポートされるプラットフォームが表で一覧表示されています。LLM では、OpenAI 互換インターフェースとして、Alibaba Bailian、Volcano Engine、DeepSeek、Zhipu、Gemini、iFLYTEK が挙げられ、Zhipu と Gemini は無料とされています。Ollama、Dify、FastGPT、Coze、Xinference、HomeAssistant もサポートされています。OpenAI インターフェースをサポートする LLM は統合可能と記載されています。視覚モデルでは、Zhipu ChatGLMVLLM が無料オプションとして挙げられ、OpenAI 互換の VLLM も使用できます。TTS には EdgeTTS、iFLYTEK、Volcano Engine、Tencent Cloud、Alibaba Cloud などに加え、FishSpeech、GPT-SOVITS、Index-TTS、PaddleSpeech などのローカルサービスがあります。VAD は SileroVAD で、ローカルかつ無料です。ASR は FunASR と SherpaASR をローカルで、Volcano Engine、iFLYTEK、Tencent Cloud、Alibaba Cloud、Baidu Cloud、OpenAI ASR をクラウドでサポートしています。声紋認識は 3D-Speaker をローカルで使用します。メモリオプションは mem0ai、PowerMem、mem_local_short、nomem です。意図認識は intent_llm、function_call、または nointent を使用します。RAG は ragflow を通じて提供されます。

テストツールとパフォーマンス測定 | xinnan-tech/xiaozhi-esp32-server

2つのテストツールが文書化されています。音声対話テストツールは main/digital-human/index.html にあります。そのディレクトリで python start.py を実行し、http://127.0.0.1:8006/index.html を開くと、音声の再生と受信をテストして Python 側の音声処理を検証できます。モデル応答テストツールは main/xiaozhi-server/performance_tester.py にあり、python performance_tester.py で実行すると、ASR、LLM、VLLM、TTS の応答速度を測定できます。README は、設定された API キーを持つモデルのみがテストされることに言及しています。また、コンポーネントの遅延測定のための独立したパフォーマンス研究リポジトリを参照しています。

警告、プロジェクトステータス、ライセンス | xinnan-tech/xiaozhi-esp32-server

README には明確な警告があります。これはオープンソースソフトウェアであり、接続する第三者 API サービスプロバイダー(音声認識、大規模モデル、音声合成など)との商業的パートナーシップはなく、それらのサービス品質や財務的安全性に対する保証もありません。関連する事業ライセンスを持つプロバイダーを優先し、サービス契約とプライバシーポリシーをよく読むことを推奨しています。このソフトウェアはアカウントキーをホストせず、資金の流れに参加せず、チャージ資金の損失リスクを負いません。機能は完全ではなく、ネットワークセキュリティ評価を通過していないため、本番環境での使用は推奨されません。学習目的でパブリックネットワークにデプロイする場合は、必要な保護対策を講じてください。ソフトウェアは MIT ライセンスの下で提供され、使用、コピー、変更、マージ、公開、配布、サブライセンス、販売を許可しますが、商品性や特定目的への適合性に関する保証はありません。

謝辞と小智エコシステム | xinnan-tech/xiaozhi-esp32-server

プロジェクトは README で複数の貢献者に謝意を表しています。Bailing Voice Dialogue Robot に触発され、それを基に実装されました。Tenclass は標準通信プロトコル、マルチデバイス互換性、高並行シナリオの実践、および全リンクの技術文書を提供したとされています。玄風科技は関数呼び出しフレームワーク、MCP 通信プロトコル、プラグインベースの呼び出しメカニズムを貢献しました。huangjunsen はスマートコンソールモバイルモジュールを貢献しました。Huiyuan Design と西安秦人信息技術はビジュアルデザインを提供しました。README はまた、小智エコシステム内の他のプロジェクトへのリンクを提供し、小智をエコシステムと説明しています。

編集部の結論

xiaozhi-esp32-serverは、対応するESP32ハードウェアを持ち、ASR、LLM、TTSを自分で選びながら音声端末のバックエンドを構築したい開発者向けです。第三者APIの料金や鍵管理を任せたい人、公開ネットワークへすぐ置きたい人には向きません。まずDockerの簡易構成でMQTT、WebSocket、音声テスト、performance_tester.pyを確認し、READMEの本番利用禁止の警告を前提に隔離環境で扱ってください。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート