14 fournisseurs open source pour Gouvernance des données et MDM.
Logiciels Gouvernance des données et MDM open source que vous pouvez héberger vous-même, avec un code source vérifiable — quel que soit le siège de l'éditeur.
- Apache AtlasAuto-hébergé / open source
Le lourd poids traditionnel open source de la Fondation Apache Software pour la gouvernance et la gestion des métadonnées dans les lacs de données d'entreprise et les écosystèmes Hadoop/Spark.
États-Unis
- Apache KnoxAuto-hébergé / open source
Passerelle d'application open source servant de point d'accès central pour l'authentification, l'autorisation et la sécurité du périmètre autour des data lakes d'entreprise. Un projet de la Fondation Apache Software.
États-Unis
- Apache RangerAuto-hébergé / open source
Framework open source pour gérer et auditer les droits de sécurité et d'accès centralisés (gouvernance de l'accès aux données) sur les plateformes de données d'entreprise complexes (Hive, HBase, Kafka, Solr). Un projet de la Fondation Apache Software.
États-Unis
- CKANFournisseur non UE
La norme mondiale open source pour les portails et catalogues de données, largement utilisée par les gouvernements européens pour la gouvernance des données ouvertes (y compris data.europa.eu, data.gov.uk, govdata.de). Régie par la Fondation Open Knowledge (Royaume-Uni).
Royaume-Uni
- Data Contract CLIAuto-hébergé / open source
Outil de ligne de commande open source (licence MIT) pour créer et valider les 'contrats de données', empêchant les modifications dans les systèmes de production de casser inopinément les rapports en aval. Développé par des consultants chez INNOQ (Allemagne).
Allemagne
- DataHubFournisseur non UE
Catalogue de données d'entreprise Open Source populaire (originellement LinkedIn OSS) avec ingestion de métadonnées en temps réel et visualisation avancée de la lignée des données. Maintenu commercialement par Acryl Data Inc. (Mountain View, US).
États-Unis
- DeequFournisseur non UE
Bibliothèque Open Source d'Amazon, construite sur Apache Spark, spécifiquement conçue pour mesurer et surveiller la qualité des données à grande échelle (data lakes).
États-Unis
- Great ExpectationsFournisseur non UE
La norme industrielle open-source pour la qualité des données d'entreprise et le profilage des données ; définit et valide les tests de données en tant que code. Développé par Superconductive (Redwood City, US).
États-Unis
- MagdaAuto-hébergé / open source
Catalogue de données d'entreprise fédéré open source excellant dans la conception axée sur la confidentialité et l'indexation des ensembles de données distribués sans les déplacer. Projet de gouvernement australien (CSIRO Data61) à l'origine, maintenant maintenu par la communauté.
Australie
- MarquezAuto-hébergé / open source
Plateforme open source, centrée sur les métadonnées, pour la collecte, l'organisation et la visualisation de la lignée des données et de l'état des pipelines de données actives. L'implémentation de référence d'OpenLineage, un projet diplômé sous la Linux Foundation AI & Data.
États-Unis
- MindsDBFournisseur non UE
Plateforme open source agissant comme couche de gouvernance et de données IA, permettant l'audit centralisé des flux de données dans les modèles prédictifs. Société américaine (Berkeley, Californie).
États-Unis
- OpenMetadataFournisseur non UE
Plateforme centrale open source moderne pour la gouvernance des données unifiant la catalogage, la lignée, la qualité des données et la collaboration d'équipe via une approche API-first. Maintenue commercialement par Collate Inc. (Menlo Park, USA).
États-Unis
- OpenRefineAuto-hébergé / open source
Application de bureau puissante et exécutée localement pour nettoyer, transformer et gouverner les ensembles de données désordonnés sans transfert cloud. Parrainée fiscalement par l'organisation à but non lucratif Code for Science & Society (USA); pas de société mère.
États-Unis
- PanderaFournisseur non UE
Framework léger open-source de validation de données pour les scientifiques des données afin d'appliquer des contrôles de schéma et de qualité des données dans les pipelines Python (pandas/Polars/Spark). Développé par Union.ai (Seattle, États-Unis).
États-Unis