Knowledge Catalog (ehemals Dataplex Universal Catalog) bietet eine einheitliche, strukturierte Plattform für die Metadatenverwaltung für Ihre verteilten Datenbestände. Technische Strukturen, geschäftlicher Kontext, Datenqualitätsmesswerte und betriebliche Beziehungen werden automatisch erkannt, indexiert und organisiert.
Durch die Organisation von Metadaten in einem flexiblen, erweiterbaren Metamodell, schafft Knowledge Catalog die strukturelle Grundlage des Active Context Graph in der Agentische Daten-Cloud von Google. Mit diesem Kontextgraphen können Datenteams Assets erkennen und verwalten, während generative KI-Agents fundierte, vertrauenswürdige geschäftliche Kontexte abrufen können.
Knowledge Catalog-Metamodell
Knowledge Catalog organisiert Metadaten über eine modulare Hierarchie von Containern, Assets, Schemas und Beziehungen:
- Container und Assets: Eintragsgruppen organisieren Einträge, die einzelne Daten-Assets und ihre Schemaspalten darstellen.
- Strukturierte Anreicherung: Aspekttypen definieren Schemas für Aspekte, die Einträgen, Spalten oder Beziehungen strukturierte Metadaten zuordnen.
- Standards und Governance: Eintragstypen definieren Vorlagen, die erforderliche Aspekte für Einträge erzwingen.
- Beziehungen: Eintragslinktypen definieren Beziehungen (Eintragslinks) die verknüpfte Einträge und Geschäftsbegriffe verbinden.
In der folgenden Tabelle wird der Unterschied zwischen vom System verwalteten Ressourcen (automatisch von Google Cloud) und benutzerdefinierten Ressourcen zusammengefasst:
| Metamodellelement | Vom System verwaltet (integriert) | Benutzerdefiniert |
|---|---|---|
| Eintragsgruppen | Pro Projekt für Google Cloud Dienste vordefiniert (z. B.
@bigquery, @spanner, @pubsub). |
Von Nutzern erstellt, um benutzerdefinierte Daten-Assets und Berechtigungen zu gruppieren und zu verwalten. |
| Einträge | Automatisch aus Google Cloud Quellen gefüllt (z. B. BigQuery-Tabellen, ‑Ansichten, ‑Datasets und ‑Modelle). | Von Nutzern erstellt, um benutzerdefinierte Datenquellen, Dateien oder Drittanbieterdatenbanken darzustellen. |
| Aspekttypen | Vordefinierte Systemvorlagen (z. B. Schema,
Overview, Contacts, DataQuality,
Lineage). |
Von Nutzern erstellt, um domainspezifische Metadatenschemas zu definieren (z. B. PII-Klassifizierung oder SLA-Stufen). |
| Aspekte | Automatisch aus Quellsystemen, Abfragelogs oder automatisierten Scans gefüllt. | Von Nutzern, Pipelines oder Agents erstellt und an Einträge, Spalten oder Eintragslinks angehängt. |
| Eintragstypen | Vordefinierte Vorlagen, die Google Cloud Ressourcentypen darstellen. | Von Nutzern definiert, um obligatorische und optionale Aspekte für benutzerdefinierte Daten-Assets anzugeben. |
| Eintragslinks | Integrierte Beziehungstypen (z. B. synonym,
definition, schema-join,
related). |
Zwischen bestimmten Einträgen oder Spalten erstellte Instanzen, um systemübergreifende Verbindungen zu modellieren. |
In den folgenden Abschnitten werden die Hauptkomponenten des Knowledge Catalog-Metamodells beschrieben.
Eintragsgruppen
Eine Eintragsgruppe (EntryGroup) ist ein regionaler Container für Einträge und Eintragslinks, der als administrative und sicherheitstechnische Grenze für die Verwaltung dieser Ressourcen dient.
Mit Eintragsgruppen können Sie Folgendes konfigurieren:
- Zugriffssteuerung für Identity and Access Management: Gewähren Sie bestimmten Teams Berechtigungen zum Ansehen oder Bearbeiten für eine Eintragsgruppe, ohne die Berechtigungen für einzelne Einträge zu ändern.
- Standort- und Projektzuordnung: Gruppieren Sie Assets nach geografischer Region und Projektinhaberschaft.
Für Google Cloud Quellen erstellt
Knowledge Catalog automatisch Systemeintragsgruppen pro Projekt (z. B. @bigquery oder
@spanner). Für benutzerdefinierte Datenquellen erstellen Sie benutzerdefinierte Eintragsgruppen.
Ein Finanzteam kann beispielsweise eine benutzerdefinierte Eintragsgruppe mit dem Namen production_finance_data erstellen, um die Zugriffsberechtigungen für alle finanzbezogenen benutzerdefinierten Einträge an einem zentralen Ort zu verwalten.
Weitere Informationen finden Sie unter Eintragsgruppen.
Einträge und Schemapfade
Ein Eintrag (Entry) stellt ein einzelnes Daten-Asset dar. Ein Eintrag kann eine strukturierte Datenbanktabelle, ein Analysemodell, eine unstrukturierte Objekttabelle oder ein benutzerdefiniertes externes Dataset darstellen.
Zu den wichtigsten Komponenten eines Eintrags gehören:
- Eintrags-ID: Ein eindeutiger Ressourcenname innerhalb der übergeordneten Eintragsgruppe.
- Eintragstyp: Die Vorlage, die die Struktur des Eintrags und die erforderlichen Aspekte definiert.
- Aspekte: Strukturierte Metadatenattribute, die an den Eintrag angehängt sind.
- Schemapfade (Spalten): Bestimmte Unterabschnitte oder Felder im Daten Asset, z. B. eine Spalte in einer BigQuery-Tabelle oder ein Feld in einem JSON-Schema.
Mit Spalten können Sie Metadaten an einzelne Felder innerhalb eines Assets anhängen. Spalten werden nicht manuell definiert, sondern automatisch gefüllt, wenn Sie einen Aspekt vom Typ schema an einen Eintrag anhängen. Sie können mit Punktnotation auf verschachtelte Felder verweisen (z. B. customer.address.postal_code).
Eine BigQuery-Tabelle mit dem Namen orders_project.sales.customer_orders wird beispielsweise als Eintrag dargestellt. Wenn Sie das Feld email_address in dieser Tabelle als sensibel kennzeichnen möchten, hängen Sie einen Klassifizierungsaspekt direkt an den Spaltenpfad email_address an.
Weitere Informationen finden Sie unter Einträge.
Aspekttypen
Ein Aspekttyp (AspectType) ist eine wiederverwendbare Schemavorlage, die die Felder, Datentypen und Validierungsregeln für einen Aspekt definiert. Jeder Aspekt ist eine Instanz eines Aspekttyps.
Aspekttypen können vom System definiert (von bereitgestellt Google Cloud) oder benutzerdefiniert (von Ihrer Organisation erstellt) sein.
Wenn Sie die metadata_template für einen benutzerdefinierten Aspekttyp definieren, können Sie die folgenden unterstützten Datentypen verwenden:
| Felddatentyp | Beschreibung | Anwendungsbeispiel |
|---|---|---|
string |
Textwert (UTF-8). | E-Mail-Adresse des Inhabers, Label zur Datenklassifizierung, Abteilungsname. |
integer / number |
Numerische Werte (Ganzzahlen oder Gleitkommazahlen). | Aufbewahrungsdauer der Daten in Tagen, SLA-Zielprozentsatz, Prioritätsrang. |
boolean |
Flag „Wahr“ oder „Falsch“. | contains_pii: true, is_certified: false. |
enum |
Eine vordefinierte Liste zulässiger Stringwerte. | Umgebung: ["DEV", "STAGING", "PROD"]. |
datetime / timestamp |
Datum und Uhrzeit im ISO 8601-Format. | Letztes Zertifizierungsdatum, Frist für die Compliance-Überprüfung. |
record |
Ein verschachteltes strukturiertes Objekt mit untergeordneten Feldern. | ContactInfo { name: string, email: string, phone: string }. |
array |
Eine Liste mit wiederholten Werten eines beliebigen primitiven Typs oder Datensatztyps. | Liste der sekundären Dateninhaber: ["user1@example.com", "user2@example.com"]. |
map |
Schlüssel/Wert-String-Paare für erweiterbare Attribute. | Benutzerdefinierte Bereitstellungs-Tags: {"cost_center": "1042", "tier": "gold"}. |
Wenn Sie beispielsweise eine wiederverwendbare Vorlage für Kontaktinformationen definieren möchten, können Sie einen Aspekttyp mit dem Namen ContactInfo mit Feldern für owner_name (string), email (string) und support_channel (string) erstellen.
Weitere Informationen finden Sie unter Aspekttypen.
Aspekte
Ein Aspekt (Aspect) ist eine Gruppe von zugehörigen Metadatenfeldern, die einem Aspekttyp entsprechen. Aspekte werden an einen Eintrag, einen Eintragspfad (Spalte) oder einen Eintragslink angehängt, um diese Ressource zu beschreiben.
Im Gegensatz zu älteren Tagging-Systemen sind Aspekte in Knowledge Catalog direkt in ihren übergeordneten Einträgen oder Eintragslinks gekapselt. So können Sie atomare Lese- und Schreibvorgänge ausführen.
Aspekte werden in mehreren Funktionen verwendet:
- Technische Struktur: Der
SchemaAspekt beschreibt Tabellenspalten, Datentypen und Beschreibungen. - Geschäftlicher Kontext: Benutzerdefinierte Aspekte beschreiben Inhaberschaft, Compliance und Lebenszyklusstatus.
- Betriebliches Vertrauen: Aspekte der Datenqualität erfassen Ergebnisse automatisierter Regelscans und Validierungswerte.
- Unstrukturierte Entitätsgraphen: Der Aspekt
GraphProfileerfasst KI-extrahierte Entitäten und Beziehungsränder aus Rohdateien.
Sie können beispielsweise eine Instanz des ContactInfo Aspekttyps mit
Werten {"owner_name": "Alex", "email": "alex@example.com"} erstellen und an den
customer_orders Eintrag anhängen.
Weitere Informationen finden Sie unter Aspekte.
Eintragstypen
Ein Eintragstyp (EntryType) ist eine Governance-Vorlage zum Erstellen benutzerdefinierter Einträge. Er erzwingt Standards für die Metadatenqualität, indem er die erforderlichen Aspekttypen festlegt, die an einen Eintrag dieses Typs angehängt werden müssen.
Wenn Sie einen Eintrag eines bestimmten Eintragstyps erstellen, prüft Knowledge Catalog, ob alle Aspekttypen, die im Eintragstyp als required gekennzeichnet sind, vorhanden und gültig sind.
Sie können beispielsweise einen Eintragstyp mit dem Namen CertifiedDataProduct erstellen, der die Aspekttypen OwnerInfo und DataRetentionPolicy als erforderlich festlegt. Jeder neue Eintrag, der mit diesem Eintragstyp erstellt wird, muss diese Aspekte enthalten, bevor Sie ihn speichern können.
Weitere Informationen finden Sie unter Eintragstypen.
Eintragslinks und Eintragslinktypen
Ein Eintragslink (EntryLink) stellt eine semantische Beziehung zwischen zwei Dateneinträgen oder zwischen bestimmten Spalten in Einträgen her. Jeder Eintragslink ist eine Instanz eines Eintragslinktyps (EntryLinkType).
Eintragslinks können gerichtet oder ungerichtet sein:
- Symmetrisch (ungerichtet): Beziehungen, bei denen beide Seiten gleichberechtigt sind
(z. B.
synonym,related, oderschema-join). - Asymmetrisch (gerichtet): Beziehungen mit einer expliziten Quelle und einem expliziten Ziel (z. B.
definition, die einen Begriff aus dem Unternehmensglossar mit einer Tabellenspalte verknüpft).
Sie können Aspekte auch direkt an Eintragslinks anhängen (außer an schema-join-Links). So können Sie die Beziehung selbst beschreiben, z. B. Join-Konfidenzwerte, Transformationsregeln oder Zuordnungsnotizen aufzeichnen.
Knowledge Catalog unterstützt die folgenden integrierten Eintragslinktypen:
synonym: Verbindet gleichwertige Geschäftskonzepte oder alternative Begriffe.