Projet open source
open-metadata/OpenMetadata avatar
open-metadata/OpenMetadata

OpenMetadata : une couche de contexte ouverte pour les données et l'IA

Couche de contexte ouvert pour les données et l'IA, OpenMetadata est la plate-forme ouverte permettant de créer un contexte de données fiable et une sémantique commerciale pour les humains, les assistants IA et les agents.

15 197 étoiles2 377 forksTypeScriptApache-2.0

En bref

De quoi s’agit-il ?
OpenMetadata construit un graphe de connaissances de métadonnées qui relie les métadonnées techniques, les signaux de qualité, la lignée, la sémantique, la gouvernance et la mémoire conversationnelle, avec des interfaces pour les assistants IA.
À qui s’adresse-t-il ?
L'approche d'OpenMetadata consiste à traiter le contexte comme un artefact de première classe, et non comme un sous-produit de l'ingestion. Le README décrit une plateforme qui collecte des métadonnées de nombreuses sources, les normalise selon des normes ouvertes et les expose via des API, un serveur MCP et une recherche sémantique.
Puis-je l’utiliser commercialement ?
Oui. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
Est-il encore maintenu ?
Oui. Les derniers commits datent d’il y a 1 jour.
En quel langage est-il écrit ?
Principalement TypeScript, d’après les statistiques de langage de GitHub.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 14 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Ce qu'est OpenMetadata

OpenMetadata se décrit comme la couche de contexte ouverte pour l'IA. Le dépôt le positionne comme une plateforme ouverte pour le contexte de données fiable, la mémoire organisationnelle et la sémantique métier. Il connecte les métadonnées techniques, les signaux de qualité, la lignée (y compris la lignée au niveau des colonnes), la propriété, l'utilisation, les politiques, les conversations, les mémoires, les glossaires, les classifications, les métriques, les domaines, les contrats de données et les produits de données dans un graphe de connaissances de métadonnées unifié. Le README liste plus de 130 connecteurs et mentionne les normes ouvertes de métadonnées, la recherche sémantique, les API, les SDK et un serveur MCP comme composants de cette plateforme. Il revendique également le titre de plus grand et plus rapide projet open source pour le contexte IA, le catalogage de données et la gestion des métadonnées ; le README ne fournit pas de mesures pour étayer cette affirmation.

Comment le graphe de contexte est construit

L'architecture suit une approche schéma d'abord. Le README décrit six étapes : collecter des métadonnées depuis des entrepôts, des lacs, des outils BI, des pipelines, des plateformes ML, des systèmes de messagerie, des systèmes de stockage, des API, des systèmes de recherche, des applications SaaS, des systèmes de métadonnées, des documents, des conversations et des flux de travail d'agents ; normaliser à l'aide de schémas et de normes ouverts ; connecter les entités et relations résultantes en un seul graphe ; préserver la mémoire en capturant les conversations, les fils IA, les décisions, les hypothèses, les runbooks et les notes de remédiation en tant que fragments de mémoire gouvernés ; gouverner le contexte avec des classifications, des politiques, des rôles, la qualité des données, des flux de travail de revue et des contrats de données ; et l'activer via la recherche sémantique, MCP, les API, les SDK, les événements, les webhooks, les applications de métadonnées et les flux de travail IA. Le graphe stocke les relations entre les actifs, les colonnes, les propriétaires, les équipes, les politiques, les tests de qualité, la lignée, les classifications, les termes de glossaire, les métriques, les domaines, les contrats de données, les produits de données, les conversations et les fragments de mémoire.

La mémoire comme entité de première classe

Le README souligne que la mémoire fait partie de l'architecture, et non d'un canal secondaire. Une mémoire est une entité ouverte et gouvernée qui peut être attachée à des actifs de données, des utilisateurs, des équipes, des fils, des domaines, des produits de données, des métriques, des politiques, des incidents et des flux de travail. Les ingénieurs peuvent capturer et récupérer des mémoires via des API, des SDK, MCP, le chat ou des applications IA. L'idée est de préserver pourquoi une métrique a changé, quelle hypothèse a été utilisée dans une analyse, quelle remédiation a résolu un problème de qualité des données, ou ce qu'un agent IA a appris en enquêtant sur un incident. Le README appelle cela la connaissance tribale et dit qu'elle devient réutilisable, gouvernée, recherchable et disponible pour chaque humain, assistant et agent qui touche aux données. Il ne spécifie pas les formats de stockage ni les politiques de rétention.

Interfaces pour l'IA et les développeurs

OpenMetadata est livré avec un serveur MCP qui permet aux assistants et agents compatibles MCP d'interagir avec le graphe de métadonnées via le langage naturel. Le README liste des actions comme rechercher des métadonnées, exécuter une recherche sémantique, récupérer des détails d'entité, inspecter la lignée, comprendre les contrats de données et le contexte des politiques, récupérer ou préserver des fragments de mémoire, mettre à jour des descriptions, des tags et des propriétaires, créer des termes de glossaire et de la lignée, lister et créer des tests de qualité des données, et analyser les causes profondes des échecs de qualité. La recherche sémantique trouve des actifs par sens plutôt que par mots-clés exacts, comme dans l'exemple de requête pour des ensembles de données d'achat clients fiables avec des problèmes de qualité connus et des notes de remédiation récentes. La plateforme expose également des API, SDK, événements et webhooks, y compris un SDK IA pour créer des applications IA personnalisées. Le README pointe vers des pages de documentation pour le serveur MCP et les connecteurs, mais ne fournit pas d'exemples de code dans le README lui-même.

Gouvernance, qualité et lignée

Le tableau des capacités de base du README regroupe les fonctionnalités en plusieurs domaines. Le contexte IA et la mémoire couvrent les fragments de mémoire, conversations, fils d'agents, décisions, hypothèses, notes de remédiation et runbooks. La découverte et la compréhension incluent la recherche d'actifs, la recherche sémantique, les descriptions, les données d'exemple, l'utilisation, la propriété, les conversations, les tâches et les annonces. La gouvernance et la sémantique incluent les glossaires, classifications, tags, métriques, KPI, domaines, produits de données, politiques, rôles, certification et états du cycle de vie. Les contrats de données et normes listent le support ODCS 3.1, l'import/export de contrats, les attentes de schéma, les SLA et les relations sémantiques. La qualité et l'observabilité des données incluent les tests, le profilage, la fraîcheur, le volume, les nulls, l'unicité, les vérifications de distribution, les alertes, les incidents et les flux de travail de cause racine. La lignée et l'analyse d'impact couvrent la lignée de table, de colonne, de tableau de bord, de pipeline, de métrique et de modèle ML, ainsi que le support OpenLineage et l'analyse d'impact. La sécurité et le contrôle d'accès mentionnent l'authentification, l'autorisation, les rôles, les politiques, le SSO, les jetons de bot, les jetons utilisateur et l'authentification MCP. L'extensibilité et l'automatisation listent plus de 130 connecteurs, API, SDK, webhooks, événements, applications, cadre d'ingestion, connecteurs personnalisés, propriétés personnalisées, outils MCP et flux de travail SDK IA. Le README ne décrit pas de protocoles d'authentification spécifiques au-delà de leur nom.

Démarrage et communauté

La section de démarrage rapide du README suggère d'essayer le bac à sable, d'installer via un guide de démarrage rapide, puis d'ingérer des métadonnées depuis un entrepôt, un outil BI, un système de pipeline, un outil de qualité des données, une source de lignée, une source de contrat ou un flux de travail produisant de la mémoire. Elle suggère ensuite de construire le contexte avec des descriptions, propriétaires, équipes, domaines, produits de données, tests de qualité, fraîcheur, utilisation, lignée et contrats de données ; d'ajouter de la sémantique avec des glossaires, classifications, tags, métriques, KPI, politiques, domaines et produits de données alignés sur DCAT/DPROD ; de capturer la mémoire à partir de conversations et d'incidents ; d'activer la recherche sémantique ; de connecter un client MCP ; et de créer des applications IA en utilisant les API, SDK, outils MCP, événements et flux de travail SDK IA. Les liens de documentation pointent vers docs.open-metadata.org, la documentation du serveur MCP, la page du connecteur OpenLineage et openmetadatastandards.org. Le dépôt est publié sous licence Apache 2.0, et le README renvoie à un guide de contribution et à la configuration de l'environnement de développement. Il mentionne également une offre d'entreprise gérée appelée Collate, mais le README n'en détaille pas les spécificités.

Conclusion éditoriale

L'approche d'OpenMetadata consiste à traiter le contexte comme un artefact de première classe, et non comme un sous-produit de l'ingestion. Le README décrit une plateforme qui collecte des métadonnées de nombreuses sources, les normalise selon des normes ouvertes et les expose via des API, un serveur MCP et une recherche sémantique. La cohésion de ces éléments en pratique dépend des détails d'implémentation, documentés dans le dépôt et la documentation liée.

Sources officielles

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
Notes de la communauté

Notes de la communauté