Knowledge Catalog (ehemals Dataplex Universal Catalog) ist ein vollständig verwalteter Dienst, der die Ermittlung und Inventarisierung Ihrer verteilten Daten und KI-Assets automatisiert. So entsteht eine einheitliche, durchsuchbare Wissensdatenbank, die Daten in Google Cloud und anderen Umgebungen verwaltet. Dadurch wird sichergestellt, dass Ihre Analyse- und KI-Modelle auf vertrauenswürdigen, konformen Informationen basieren.
Anwendungsfälle
Datenermittlung für KI und Analysen beschleunigen: Löst das Kaltstartproblem bei Daten, indem KI-basierte Data Insights verwendet werden, um automatisch geschäftlichen Kontext zu generieren. Data Scientists, Analysten und KI-Agents können die Datenqualität mithilfe der semantischen Suche in natürlicher Sprache sofort ermitteln, nachvollziehen und überprüfen, ohne auf manuelle Unterstützung warten zu müssen.
KI-Agenten mit Daten verknüpfen und Datenprodukte verwalten: Erstellt einen einheitlichen Kontextgraphen, der physische Datasets mit Geschäftssemantik und Nutzungsbeziehungen verknüpft. So wird sichergestellt, dass nachgelagerte generative KI-Anwendungen, die über Standardschnittstellen wie das Model Context Protocol (MCP) auf Daten zugreifen, auf zertifizierten, für Unternehmen genehmigten Informationen basieren. Dadurch werden KI-Halluzinationen deutlich reduziert.
Dark Data erkennen: Rohe, unstrukturierte Dateien (z. B. PDFs in Cloud Storage) werden automatisch gesucht und gescannt. Dazu wird ein Erkennungsscan für unstrukturierte Daten oder ein eigenständiges Datenprofil für unstrukturierte Daten verwendet, um Entitäten und Beziehungen zu extrahieren. Damit wird dem Katalogeintrag, der Ihre Objekttabelle darstellt, ein
Graph Profile-Aspekt hinzugefügt und unstrukturierte Daten werden in abfragbare Assets in BigQuery für erweiterte Analysen und KI-Agenten mit Fundierung umgewandelt. Weitere Informationen finden Sie unter Unstrukturierte Daten.Compliance und semantische Schutzmaßnahmen optimieren: Automatisiert die Nachverfolgung der Datenherkunft, um abzubilden, wie sensible Informationen, einschließlich personenidentifizierbarer Informationen (PII), in Ihren Datenbeständen fließen und transformiert werden. So wird eine vertrauenswürdige Datengrundlage geschaffen, die dafür sorgt, dass sowohl herkömmliche Analyse-Workflows als auch autonome KI-Modelle innerhalb sicherer, richtlinienkonformer Grenzen ausgeführt werden.
So funktioniert Knowledge Catalog
Knowledge Catalog ist wie eine automatisierte intelligente Bibliothek für Ihr Unternehmen. Anstatt Metadaten manuell zu indexieren, werden technische Metadaten automatisch aus Ihren Speichersystemen wie BigQuery aufgenommen.
Anschließend können Sie diese Metadaten mit Geschäftskontext anreichern, z. B. mit Datenqualitätsfaktoren oder Eigentumsrechten, und Daten in logischen Gruppen organisieren. So wird sichergestellt, dass Nutzer bei der Suche im Katalog Assets finden, die auffindbar sind und auch aktiven Sicherheitsrichtlinien unterliegen.
Außerdem können Metadatenänderungen in Knowledge Catalog mithilfe von Feeds für Metadatenänderungen in Echtzeit gestreamt werden. Ein Feed für Metadatenänderungen sendet Benachrichtigungen über das Erstellen, Aktualisieren oder Löschen von Metadaten an ein von Ihnen angegebenes Pub/Sub-Thema. Pub/Sub ist ein asynchroner und skalierbarer Messaging-Dienst. Anschließend können Sie einen Abonnentenclient verwenden, um das Pub/Sub-Thema zu abonnieren und diese Benachrichtigungen zu erhalten. Sie können Metadatenänderungen programmatisch verarbeiten, Workflows auslösen oder in andere Systeme einbinden, um auf diese Benachrichtigungen zu reagieren. Sie können diese Benachrichtigungen beispielsweise verwenden, um automatisch Datenqualitätsprüfungen auszulösen, wenn sich ein Tabellenschema ändert. Weitere Informationen finden Sie unter Feeds für Metadatenänderungen.
Terminologie
Die Funktionen zur Metadatenverwaltung in Knowledge Catalog basieren auf den folgenden Konzepten:
- Eintrag
Ein Eintrag stellt ein Daten-Asset dar. Dies ähnelt Einträgen im Data Catalog.
Beispiel: Eine BigQuery-Tabelle mit dem Namen
test-project.sales_data.customer_orderswird als Eintrag dargestellt.Eine Spalte eines Eintrags stellt einen bestimmten Unterabschnitt eines Datenassets dar, z. B. eine einzelne Spalte in einer BigQuery-Tabelle oder ein Feld in einer JSON-Datei. Mit Spalten können Sie Metadaten an einzelne Felder in einem Eintrag anhängen, nicht nur an den Eintrag als Ganzes. Sie definieren Spalten nicht direkt. Sie werden erstellt, wenn Sie einem Eintrag einen Aspekt vom Typ
schemazuweisen. Spalten werden auch als Pfade bezeichnet.Beispiel: Wenn Sie das Feld
email_addressim Eintragcustomer_ordersals personenidentifizierbare Informationen beschreiben möchten, können Sie der Spalteemail_addresseinen Aspekt zuweisen.Weitere Informationen zu Einträgen finden Sie unter Einträge.
- Eintragslink
Mit einem Eintragslink wird eine Beziehung zwischen zwei Daten-Assets (Einträgen) in Knowledge Catalog hergestellt. Links können symmetrisch (nicht gerichtet) sein, z. B.
synonym,related itemsoderschema-join, oder asymmetrisch (gerichtet), z. B.definitionmit einer expliziten Quelle und einem expliziten Ziel. Links können auf einen gesamten Eintrag oder einen bestimmten Pfad verweisen, z. B. auf eine einzelne Spalte in einem Schema, mit Ausnahme des Eintragslinksschema-join.Beispiel: Ein
synonym-Eintrag verknüpft den Begriff Gewinn als Synonym für Einnahmen.Weitere Informationen zu Einstiegslinks finden Sie unter
EntryLinks.- Eintragsverknüpfungstyp
Ein Eintragslinktyp ist eine wiederverwendbare Vorlage für Eintragslinks, die die Bedeutung der Beziehung zwischen zwei Einträgen beschreibt. Jeder Eintragslink ist eine Instanz eines Eintragslinktyps. Die Richtung von Einstiegslinks wird auf der Ebene des Einstiegslink-Typs definiert.
Beispiel: Wenn Sie angeben möchten, dass die Daten in den verknüpften Einträgen anhand ihres Schemas zusammengeführt werden können, verwenden Sie den Linktyp
schema-join. Um die Bedeutung von Spalten in einer Tabelle zu erläutern, können Sie einendefinition-Eintragslinktyp verwenden, um diese Spalten mit Begriffen aus dem Unternehmensglossar zu verknüpfen.Knowledge Catalog unterstützt die folgenden Linktypen für Einträge:
synonym,related,definitionundschema-join.- Aspekt
Ein Aspekt ist eine Gruppe von zugehörigen Metadatenfeldern. Sie können einem Eintrag einen Aspekt zuweisen, um den Eintrag oder den Eintragslink als Ganzes zu beschreiben. Die meisten Metadaten werden durch Aspekte in einem Eintrag beschrieben. Das ist ähnlich wie Tags in Data Catalog. Aspekte werden jedoch in Einträgen oder Eintragslinks und nicht als eigenständige Ressourcen gespeichert.
Beispiel: Wenn Sie alle Spalten des Eintrags
customer_ordersdefinieren möchten, z. B.order_id,order_dateundemail_address, können Sie dem Eintragcustomer_ordersdas Attributschemahinzufügen. Wenn Sie angeben möchten, dass die Spalteemail_addresseine E‑Mail-Adresse enthält, können Sie der Spalteemail_addressdas Attributschemazuweisen.Weitere Informationen zu Aspekten finden Sie unter Aspekte.
Weitere Informationen zur Verwendung von Aspekten für die Datenqualität finden Sie unter Datenqualitätsregeln wiederverwenden.
- Eintragstyp
Ein Eintragstyp ist eine Vorlage zum Erstellen von Einträgen. Darin werden die wichtigsten Metadatenelemente festgelegt, die als Liste der erforderlichen Aspekte für Einträge dieses Typs aufgeführt sind. Ein Eintragstyp gibt an, welche Aspekttypen für ein bestimmtes Daten-Asset erforderlich sind.
Beispiel: Damit alle Einträge die erforderlichen Metadaten haben, können Sie einen Eintragstyp namens
StandardOperationalTableerstellen, für den das AttributOwnerInfofür jeden neuen Eintrag dieses Typs erforderlich ist.Weitere Informationen zu Eintragstypen finden Sie unter Eintragstypen.
- Aspekttyp
Ein Aspekttyp ist eine wiederverwendbare Vorlage für Aspekte. Jeder Aspekt ist eine Instanz eines Aspekttyps. Das ist ähnlich wie bei Tag-Vorlagen in Data Catalog.
Beispiel: Wenn Sie eine wiederverwendbare Vorlage für Kontaktdaten definieren möchten, können Sie einen Aspekttyp mit dem Namen
ContactInfomit Feldern fürowner_name,emailundsupport_teamdefinieren. Anschließend können SieContactInfo-Aspekte aus dieser Vorlage erstellen und sie Einträgen oder Spalten zuweisen.Weitere Informationen zu Aspekttypen finden Sie unter Aspekttypen.
- Eintragsgruppe
Eine Eintragsgruppe ist ein Container für Einträge und Eintragslinks, der als Verwaltungseinheit für diese Einträge und Eintragslinks dient. Sie können beispielsweise eine Eintragsgruppe verwenden, um die Zugriffssteuerung für Identity and Access Management, die Projektzuordnung oder den Speicherort für die Einträge und Eintragslinks in der Eintragsgruppe zu konfigurieren. Das ist ähnlich wie bei Eintragsgruppen in Data Catalog.
Beispiel: Ein Finanzteam möchte Berechtigungen für alle seine Tabellen gleichzeitig verwalten. Sie können eine Eintragsgruppe mit dem Namen
production_finance_dataerstellen und die Einträge für die Tabellecustomer_orders, die Tabellequarterly_revenueund die Tabelleemployee_salarieseinfügen.Weitere Informationen zu Eintragsgruppen finden Sie unter Eintragsgruppen.
Abbildung 1. Eintragsgruppen, Einträge und Eintragslinks
Abbildung 2. Aspekttypen und Eintragstypen
Abbildung 3. Eintragslink mit verknüpften Einträgen, Aspekten und deren Typen
Knowledge Catalog im Vergleich zu Data Catalog
Knowledge Catalog bietet integrierte Funktionen zum Verwalten Ihrer Metadaten. Der Metadatenspeicher und die API-Methoden sind in die Dataplex API eingebunden.
Zu den wichtigsten Funktionen zur Metadatenverwaltung in Knowledge Catalog gehören:
Robusteres Metamodell
- Eingabe über die Tastatur. Sie können Mindeststandards für Metadaten erzwingen, indem Sie die erforderlichen Metadateninhalte für benutzerdefinierte Einträge definieren.
- Nutzerkonfigurierbares Metamodell für benutzerdefinierte Einträge, das die benutzerdefinierte Aufnahme robuster macht und die Konsistenz und Vollständigkeit benutzerdefinierter Metadaten verbessert.
- Unterstützung für eine größere Vielfalt und Komplexität von Metadaten, einschließlich Unterstützung für Verschachtelungsstrukturen wie Listen, Maps und Arrays.
Verbesserte Skalierbarkeit, einschließlich der Möglichkeit, über einzelne atomare CRUD-Vorgänge mit allen Metadaten zu interagieren, die einem Eintrag zugeordnet sind, und mehrere Metadatenanmerkungen abzurufen, die in Such- oder Listenantworten enthalten sind.
In der folgenden Tabelle werden die Metadatenverwaltungsfunktionen von Knowledge Catalog und Data Catalog verglichen:
| Funktion | Knowledge Catalog | Data Catalog |
|---|---|---|
| Unterstützte Google Cloud Quellen | Alle Quellen, wie im Abschnitt Unterstützte Google Cloud Quellen dieses Dokuments beschrieben. | Alle Quellen, die unter Einträge und Eintragsgruppen beschrieben werden. |
| Aufnahme benutzerdefinierter Quellen | Aufnahme in benutzerdefinierte Einträge mit einer durch Eintragstypen definierten Struktur. Benutzerdefinierte Data Catalog-Einträge und -Eintragsgruppen sind in Knowledge Catalog unter dem Eintragstyp | Aufnahme in generische benutzerdefinierte Einträge. |
| Metadatenanreicherung |
Der Metadatenkontext für Einträge wird mithilfe von Unternehmensglossaren, Aspekten und Aspekttypen erfasst. Eintrag-Links werden unterstützt. Sie können Aspekte an einen Eintragslink anhängen. |
Der Metadatenkontext für Einträge wird mithilfe von Unternehmensglossaren, Tags und Tag-Vorlagen erfasst. Eintragslinks werden nicht unterstützt. |
| Eintragslinks | Eintrag-Links werden unterstützt. Mit Eintragstyp-Links wie schema-join
können Sie Aspekte an Eintragstyp-Links anhängen. |
Nicht verfügbar. |
| Feeds für Metadatenänderungen | Benachrichtigungen über Metadatenänderungen werden nahezu in Echtzeit an Pub/Sub gestreamt. | Nicht verfügbar. |
| Suchen | Die Suche wird in den folgenden Bereichen durchgeführt:
Die Suchergebnisse enthalten nur Ressourcen, die zur selben Organisation und zum selben VPC Service Controls-Perimeter gehören wie das Projekt, unter dem die Suche ausgeführt wird. Wenn Sie die Google Cloud Console verwenden, ist dies das Projekt, das in der Console ausgewählt ist. Wenn Sie nach Einträgen suchen möchten, benötigen Sie mindestens eine der folgenden IAM-Rollen für das Projekt, das für die Suche verwendet wird: Dataplex Catalog-Administrator, Dataplex Catalog-Bearbeiter oder Dataplex Catalog-Betrachter. Berechtigungen für Suchergebnisse werden unabhängig vom ausgewählten Projekt geprüft. |
Die Suche wird in den folgenden Bereichen durchgeführt:
|
| Data Lineage |
Mit Data Lineage werden Eintragsdetails für Asset-Knoten mithilfe der Dataplex API abgerufen. In der Google Cloud Konsole werden die angehängten Aspekte angezeigt. |
Bei der Datenherkunft werden Eintragsdetails für Asset-Knoten mithilfe der Data Catalog API abgerufen. |
| Unternehmensglossare |
Mit dem Unternehmensglossar können Sie eine Taxonomie für Geschäftsbegriffe erstellen und sie Daten-Assets und Spalten zuordnen. Mit der Suche können Sie Assets finden, die mit einem Begriff verknüpft sind. |
Mit dem Unternehmensglossar können Sie eine Taxonomie für Geschäftsbegriffe erstellen und sie Spalten zuordnen. Mit der Suche können Sie Assets finden, die mit einem Begriff verknüpft sind. |
In der folgenden Tabelle wird beschrieben, wie Ressourcen in Knowledge Catalog Ressourcen in Data Catalog entsprechen:
| Knowledge Catalog-Ressource | Data Catalog-Ressource | Beschreibung |
|---|---|---|
Aspekttyp (global) |
Öffentliche Tag-Vorlage | Tag-Vorlagen sind regionale Ressourcen. Sie können sie jedoch verwenden, um Tags für mehrere Regionen zu erstellen. Tag-Vorlagen entsprechen global-Aspekttypen in Knowledge Catalog. |
| Optionaler Aspekt | Öffentliches Tag | Öffentliche Tags in Data Catalog entsprechen optionalen Aspekten in Knowledge Catalog. |
| Eintragsgruppe | Eintragsgruppe | Für Google Cloud -Quellen werden systemeigene Eintragsgruppen wie @bigquery pro Projekt in Knowledge Catalog eingerichtet. |
| Erforderliche Aspekte für benutzerdefinierte Einträge | Benutzerdefinierter Eintrag | Data Catalog und Knowledge Catalog verwenden ähnliche Konzepte für benutzerdefinierte Einträge. Standardeintragseigenschaften werden in Knowledge Catalog als erforderliche Aspekte modelliert. |
| Erforderliche Aspekte für die Systemeingabe | Eintrag „System“ (Google Cloud) | Metadaten, die integrierte Entitäten wie Schema für BigQuery-Tabellen beschreiben, werden in erforderlichen Aspekten der systemdefinierten Aspekttypen erfasst. |
| Unternehmensglossare | Unternehmensglossare | Mit Glossaren können Sie eine Taxonomie von Geschäftsbegriffen erstellen, um den geschäftlichen Kontext im gesamten Unternehmen zu standardisieren. |
Weitere Informationen zu den Funktionen, die in Data Catalog verfügbar sind, aber nicht in Knowledge Catalog unterstützt werden, finden Sie in diesem Dokument im Abschnitt Funktionen zur Metadatenverwaltung, die in Knowledge Catalog nicht unterstützt werden.
Für bestehende Data Catalog-Nutzer
Wenn Sie Data Catalog bereits verwenden, beachten Sie Folgendes:
- Benutzerdefinierte Einträge, Übersichtskontext, Glossare und Eintragsgruppen, die Sie in Data Catalog erstellt haben, sind in Knowledge Catalog verfügbar.
- Als Administrator können Sie festlegen, dass die Inhalte von Data Catalog-Tag-Vorlagen und -Tags gleichzeitig in Knowledge Catalog verfügbar gemacht werden. Weitere Informationen finden Sie unter Übergang von Data Catalog zu Knowledge Catalog.
- Wenn Sie in Knowledge Catalog nach Daten-Assets suchen, werden sowohl die Metadaten, die direkt in Knowledge Catalog erstellt wurden, als auch die Metadaten berücksichtigt, die aus Data Catalog in Knowledge Catalog importiert wurden.
- Wenn Sie in Data Catalog nach Daten-Assets suchen, werden nur die Metadaten berücksichtigt, die in Data Catalog erstellt wurden.
- Eintragsgruppenbeschreibungen in Data Catalog, die länger als 1.024 Zeichen sind, werden in Knowledge Catalog auf 1.024 Zeichen gekürzt.
- Wenn Sie als Administrator Glossare und zugehörige Verknüpfungen zwischen Begriffen und Spalten, die Sie in Data Catalog erstellt haben, in Knowledge Catalog verfügbar machen möchten, lesen Sie den Abschnitt Glossare zu Knowledge Catalog migrieren.
Weitere Informationen zur Umstellung Ihrer eigenständigen Data Catalog-Inhalte und ‑Nutzung auf Knowledge Catalog finden Sie unter Von Data Catalog auf Knowledge Catalog umstellen.
Data Catalog API-Methoden Knowledge Catalog zuordnen
Wenn Sie von Data Catalog zu Knowledge Catalog migrieren, müssen Sie Ihre programmatischen Workflows aktualisieren, damit die Dataplex API verwendet wird. In diesem Abschnitt finden Sie eine Zuordnung zwischen der Data Catalog API und der Dataplex API.
Weitere Informationen zu den Dataplex API-Methoden finden Sie in der Dokumentation zur Dataplex API für REST-Methoden und zur Dataplex API für RPC-Methoden.
In den folgenden Tabellen finden Sie eine Zuordnung der Data Catalog API-Methoden zu ihren Entsprechungen in der Dataplex API.
Eintragsgruppen
Das Konzept der Eintragsgruppen ist in Knowledge Catalog und Data Catalog identisch.
| Data Catalog API-Methode | Dataplex API-Methode |
|---|---|
projects.locations.entryGroups.create (REST)CreateEntryGroup (RPC) |
projects.locations.entryGroups.create (REST)CreateEntryGroup (RPC) |
projects.locations.entryGroups.get (REST)GetEntryGroup (RPC) |
projects.locations.entryGroups.get (REST)GetEntryGroup (RPC) |
projects.locations.entryGroups.patch (REST)UpdateEntryGroup (RPC) |
projects.locations.entryGroups.patch (REST)UpdateEntryGroup (RPC) |
projects.locations.entryGroups.delete (REST)DeleteEntryGroup (RPC) |
projects.locations.entryGroups.delete (REST)DeleteEntryGroup (RPC) |
projects.locations.entryGroups.list (REST)ListEntryGroups (RPC) |
projects.locations.entryGroups.list (REST)ListEntryGroups (RPC) |
Einträge
Das Konzept von Einträgen, die Daten-Assets darstellen, ist sowohl in Knowledge Catalog als auch in Data Catalog ähnlich.
| Data Catalog API-Methode | Dataplex API-Methode |
|---|---|
projects.locations.entryGroups.entries.create (REST)CreateEntry (RPC) |
projects.locations.entryGroups.entries.create (REST)CreateEntry (RPC) |
projects.locations.entryGroups.entries.get (REST)GetEntry (RPC) |
projects.locations.entryGroups.entries.get (REST)GetEntry (RPC) |
projects.locations.entryGroups.entries.patch (REST)UpdateEntry (RPC) |
Hinweis:Sie können auch die Methoden |
projects.locations.entryGroups.entries.delete (REST)DeleteEntry (RPC) |
projects.locations.entryGroups.entries.delete (REST)DeleteEntry (RPC) |
projects.locations.entryGroups.entries.list (REST)ListEntries (RPC) |
projects.locations.entryGroups.entries.list (REST)ListEntries (RPC) |
entries.lookup (REST)LookupEntry (RPC) |
projects.locations.lookupEntry (REST)LookupEntry (RPC)
Hinweis:Wenn Sie die Methoden |
projects.locations.entryGroups.entries.modifyEntryContacts (REST)ModifyEntryContacts (RPC) |
projects.locations.entryGroups.entries.patch (REST)UpdateEntry (RPC)
Hinweis:Wenn Sie die Migration über die Data Catalog-Methode |
projects.locations.entryGroups.entries.modifyEntryOverview (REST)ModifyEntryOverview (RPC) |
projects.locations.entryGroups.entries.patch (REST)UpdateEntry (RPC)
Hinweis:Wenn Sie die Migration über die Data Catalog-Methode |
projects.locations.entryGroups.entries.tags.reconcile (REST)ReconcileTags (RPC) |
projects.locations.metadataJobs.create (REST)CreateMetadataJob (RPC),projects.locations.entryGroups.entries.patch (REST)UpdateEntry (RPC)
Hinweis:Wenn Sie von der Data Catalog-Methode |