オープンソースプロジェクト
open-metadata/OpenMetadata avatar
open-metadata/OpenMetadata

OpenMetadataはAIが参照するデータコンテキストを知識グラフに集約する

データと AI のオープン コンテキスト レイヤーである OpenMetadata は、人間、AI アシスタント、エージェント向けに信頼できるデータ コンテキストとビジネス セマンティクスを構築するためのオープン プラットフォームです。

スター 15,197フォーク 2,377TypeScriptApache-2.0

ひと目でわかる

これは何?
技術メタデータ、品質、リネージ、セマンティクス、ガバナンス、会話メモリをAPIやMCPで公開するオープンプラットフォームです。
誰に向いている?
複数のデータ基盤から来歴や品質、用語、所有者を集め、AIアシスタントにも同じ文脈を渡したい組織に向きます。MCPをつなぐだけで正確なデータ回答が得られると考える用途には不向きです。
商用利用できる?
できます。Apache-2.0 は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 1 日前です。
何の言語で書かれている?
主に TypeScript です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月14日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

コンテキストを第一級のデータにする

OpenMetadataは、信頼できるデータコンテキストとビジネスセマンティクスを人間、AIアシスタント、エージェントへ渡すオープンコンテキストレイヤーです。READMEはアセット、所有者、品質シグナル、使用状況、ポリシー、用語、会話を一つのメタデータ知識グラフへ接続します。130以上のコネクタという記載はREADMEの自己申告であり、全コネクタが同じ深さで対応するという意味ではありません。

収集からグラフへの流れ

スキーマファーストの流れは、ウェアハウス、レイク、BI、パイプライン、ML、SaaSなどから収集し、オープンスキーマで正規化し、エンティティと関係を接続する構成です。分類、ポリシー、ロール、品質、契約で文脈を管理し、API、SDK、イベント、Webhook、セマンティック検索、MCPで利用します。実装時は、どのコネクタがどの属性と更新頻度を提供するかを個別に確認します。

メモリナゲットの扱い

OpenMetadataのREADMEは、会話、決定、仮定、是正メモ、ランブックを管理されたメモリナゲットとして保存できると説明します。これらはアセット、チーム、スレッド、インシデントなどへ添付でき、後から取得する対象になります。ただし、ストレージ形式、保持期間、削除の伝播はREADMEに具体化されていません。記録の所有者と保持ルールを組織側で先に決める必要があります。

MCPとセマンティック検索

MCPサーバーを介してメタデータ検索、意味検索、エンティティ詳細、リネージ、契約、ポリシー、メモリの取得と更新、品質テストの作成を行えるとREADMEは列挙しています。自然言語クエリで関連アセットを探せる設計ですが、検索の精度やランキングのベンチマークはREADMEにありません。MCPクライアントへ渡す認証と更新権限を読み取り専用から始めます。

品質、契約、リネージの範囲

機能表にはODCS 3.1、スキーマ期待、SLA、プロファイリング、鮮度、分布、アラート、インシデント、根本原因、テーブルと列レベルのリネージ、OpenLineageが含まれます。豊富な項目は導入対象を選ぶ材料ですが、各ソースで同じ結果になる証明ではありません。一つのパイプラインで入力、変換、ダッシュボードまでの来歴と品質失敗の関連を実測します。

導入と評価の境界

リポジトリはApache-2.0で、クイックスタート、開発環境、MCP、コネクタ、OpenLineageの文書へ案内します。評価ではsandboxから始め、取り込んだアセットの説明、所有者、タグ、用語、品質テスト、リネージを画面とAPIの両方で照合します。SSOやMCP認証の詳細、保持ポリシー、実運用の負荷はREADMEだけでは決めず、対象版の文書と設定で確認します。

評価対象を一つのウェアハウスと一つのBIダッシュボードに絞り、取り込み前後でアセット名、列、所有者、タグ、用語、品質テストを照合します。列レベルのリネージがパイプラインとダッシュボードまでつながるか、鮮度の失敗がインシデントや根本原因の画面に現れるかを確認します。MCPクライアントには最初は検索と詳細取得だけを許可し、説明更新や品質テスト作成は別の資格情報で試します。会話から作ったメモリナゲットを検索し、削除したアセットや権限のないドメインが結果に残らないかを確認します。130以上というコネクタ数ではなく、利用する接続の更新方式と失敗時の再取り込みを採用基準にします。

データカタログの価値は、登録件数より文脈の結び付きで判断します。アセットに所有者とドメインを設定し、用語集やメトリクスを紐付けた後、自然言語検索が同じ対象へ到達するかを確認します。品質テストが失敗したとき、利用者へ古い品質状態を見せない更新順序になっているかを確認します。MCPで読み取りを行うアシスタントと、ポリシーや説明を変更する管理者を分離し、監査ログに利用者、対象エンティティ、変更前後が残るかを調べます。導入範囲を増やすのは、一つのソースで更新と削除が安定した後です。

取り込み対象の所有者と削除担当を決め、誤ったメタデータを訂正できる権限を限定します。AI向けに公開するコンテキストは、内部ポリシーや個人情報を含む可能性があるため、検索結果の範囲を実データで確認します。

OpenMetadataの検証では、グラフに入った情報の出典と更新時刻を確認します。検索に現れた文脈をそのままAIへ渡さず、利用者の権限とデータ契約に照らして公開範囲を決めます。

導入前には、対象版のリリースと実行環境を記録します。入力と出力を固定した小さな試験を作り、成功だけでなく失敗時の状態も保存します。設定ファイルの既定値を確認し、変更した値を一覧にします。権限は必要な範囲に絞り、管理者操作と通常利用を分けます。ログには時刻、版、対象、結果を残します。外部サービスを使う場合は通信先と認証の境界を確認します。更新時は同じ試験を再実行し、以前の結果との差を見ます。素材にない性能や安全性を数値として補いません。READMEの機能説明と実際の動作が異なる場合は、動作を優先して原因を調べます。

編集部の結論

複数のデータ基盤から来歴や品質、用語、所有者を集め、AIアシスタントにも同じ文脈を渡したい組織に向きます。MCPをつなぐだけで正確なデータ回答が得られると考える用途には不向きです。最初に一つのデータソースを取り込み、検索結果、列レベルのリネージ、品質テスト、アクセス制御、メモリ保持を実データで確認してから対象を広げます。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート