モデル / データセット
HKUDS/LightRAG avatar
HKUDS/LightRAG

LightRAG:グラフ構造と二重レベル検索を備えたRAGフレームワーク

[EMNLP2025] 「LightRAG: シンプルかつ高速な検索拡張生成。

スター 39,639フォーク 5,583PythonMIT

ひと目でわかる

これは何?
Python製の知識グラフRAGフレームワーク。グラフとベクトルのストレージ、5つのクエリモード、マルチモーダル文書解析、REST APIサーバーを備える。
誰に向いている?
LightRAGはMITライセンスで提供され、READMEには評価表と多数の設定・デプロイ文書が含まれています。READMEは本番性能、セキュリティ保証、特定バージョンの挙動については示しておらず、個別に検証する必要があります。
商用利用できる?
できます。MIT は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 1 日前です。
何の言語で書かれている?
主に Python です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月14日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

hkuds-lightrag-deep-analysis: LightRAGとグラフベースの手法

READMEでは、LightRAGは軽量な知識グラフRAGフレームワークであり、Microsoft GraphRAGに代わる効率的な選択肢であると説明されています。知識グラフとベクトル埋め込みの両方を管理する二重層アーキテクチャを採用し、従来のベクトルベースRAGとグラフベースRAGの間を橋渡しすることを目指しています。プロジェクトはPythonで書かれ、リポジトリのメタデータはEMNLP2025の論文(arXiv識別子2410.05779)に結び付けられています。READMEは、高いスケーラビリティを対象とし、計算オーバーヘッド、応答時間、増分更新のコストを削減することを目指し、30BのオープンソースLLMと組み合わせても高いRAG品質を維持できると述べています。

LightRAG は文書を投入し、エンティティと関係を抽出して検索する構成を読むためのリポジトリだ。README の API 例では挿入、ローカル検索、グローバル検索などの問い合わせ方法が分かれている。グラフの生成結果と元文書の保存先を同時に確認し、回答だけを根拠に品質を判断しないことが必要になる。

hkuds-lightrag-deep-analysis: 検索:local、global、その他のモード

LightRAGには5つのクエリモードがあります。localは知識グラフから候補エンティティと直接関連する属性を取得し、特定のオブジェクトや具体的な事実に関する質問に適しています。globalは広いテーマをカバーする関係チェーンを取得し、文書横断的な推論や要約に使います。hybridはlocalとglobalの結果を統合します。naiveは知識グラフを使わず、ベクトル類似度で元のテキストチャンクを検索します。mixはlocal、global、naiveの結果を統合するもので、READMEによるとデフォルトであり、通常最も理想的なクエリ結果が得られますが、naiveより少し時間がかかります。

導入では LightRAG のインストール手順、環境変数、利用する LLM と埋め込みモデルを固定する。短い一文と複数段落の文書を別々に insert し、同じ質問を検索モードごとに実行すると、局所的な情報と関係をまたぐ情報の差を見分けやすい。README にないモデル接続は動作するものとして扱わない。

hkuds-lightrag-deep-analysis: 文書解析とマルチモーダル入力

文書パイプラインはMinerU、Docling、Nativeパーサーをサポートし、第三者のパーサーで拡張できます。NativeエンジンはWordおよびMarkdown文書の画像、表、数式を解析し、Word文書のセクション見出しを検出します。READMEによると、v1.5以降、マルチモーダルコンテンツは知識グラフを通じて本文と接続され、クエリ時に使用されます。テキストチャンキング戦略は4つあります:固定長、再帰文字、ベクトル意味、段落意味です。段落意味戦略は、チャンク境界を文書の見出し、段落、表にできるだけ合わせます。

非同期 API とストレージの初期化順序は、LightRAG を組み込む際の具体的な確認点になる。README のコード例に出てくる await、作業ディレクトリ、KV やグラフの保存設定をそのまま追い、プロセス再起動後に同じ文書を二重投入しないかを確認する。データ削除の手順が明記されていない部分は別途調べる必要がある。

hkuds-lightrag-deep-analysis: ストレージバックエンドと更新の仕組み

LightRAGにはKV、ベクトル、グラフ、文書ステータスの4種類のストレージが必要です。デフォルトはローカルファイル永続化を備えたインメモリデータベースで、開発とデバッグ専用です。本番環境では、PostgreSQL、MongoDB、OpenSearchが4種類すべてを担え、Milvus、Qdrant、Neo4j、Memgraphは専用のベクトルまたはグラフストレージとして挙げられています。READMEは増分更新と選択的削除を説明しています:文書を削除すると、システムはインデックス作成中に作成されたLLMキャッシュを使って影響を受けたエンティティと関係を再構築できます。また、LightRAGには現在再埋め込みツールがないと述べています。

評価用の質問には、文書に明記された固有名詞、二つの文書を結ぶ関係、答えが存在しない質問を含める。LightRAG の検索結果、生成された回答、参照文書を保存すれば、検索の誤りと生成の誤りを分離できる。README の性能や品質の記述は、使うモデルとデータセットを変えた結果へそのまま広げない。

hkuds-lightrag-deep-analysis: サーバー、API、デプロイ方法

リポジトリにはWeb UIとREST APIを備えたLightRAGサーバーが含まれています。PyPIのapi extraまたはソースからインストールでき、READMEはパッケージ管理にuvを推奨しています。Docker Composeによるセットアップと、.envファイルを生成する対話型セットアップウィザードもあります。READMEにはセキュリティ警告があります:サーバーをネットワークに公開する前に、LIGHTRAG_API_KEYまたはAUTH_ACCOUNTSとTOKEN_SECRETで認証を設定するか、127.0.0.1にバインドしてください。認証がない場合、すべてのエンドポイントが公開され、Ollama互換の/api/*ルートはデフォルトで開いたままです。

hkuds-lightrag-deep-analysis: モデルロール、埋め込み、リランキング

LightRAGは4つのロールでLLMを必要とします:EXTRACTはエンティティ関係抽出、QUERYは最終回答の生成、KEYWORDはレイテンシに敏感なキーワード生成、VLMは画像入力です。READMEは抽出とキーワードのロールには非思考型モデルを、クエリのロールにはより強いモデルを推奨しています。埋め込みモデルは文書インデックス作成前に決定し、クエリ時にも同じモデルを使う必要があります。変更するにはすべてのチャンク、エンティティ、関係を再埋め込みする必要がありますが、LightRAGには再埋め込みツールがありません。リランキングはオプションで、約1から2秒の遅延が加わり、クエリ中にいつでも変更できます。

hkuds-lightrag-deep-analysis: 評価結果、SDK利用、ライセンス

READMEには、農業、コンピュータサイエンス、法律、混合領域でLightRAGとNaiveRAG、RQ-RAG、HyDE、GraphRAGを比較した性能表が含まれています。LightRAGはほとんどの比較で勝っていますが、混合領域の一部の指標ではGraphRAGが上回っており、例えば全体スコアは50.4%対49.6%です。READMEはプロジェクトに統合する際はREST APIを推奨し、SDKは組み込みアプリケーションや学術研究向けであり、一部の機能はSDKからのみアクセスできます。プロジェクトはMITライセンスで、使用、コピー、変更、マージ、公開、配布、サブライセンス、販売の権利を認め、ソフトウェアは保証なしで提供されるとしています。ライセンスはセキュリティ態勢、サポート、本番保証については何も述べていません。

編集部の結論

LightRAGはMITライセンスで提供され、READMEには評価表と多数の設定・デプロイ文書が含まれています。READMEは本番性能、セキュリティ保証、特定バージョンの挙動については示しておらず、個別に検証する必要があります。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート