Tentang silsilah data

Silsilah data adalah peta visual yang melacak seluruh siklus proses data Anda. Urutan data menunjukkan asal data Anda (asal), ke mana data tersebut berpindah (tujuan), dan semua perubahan atau transformasi yang terjadi di sepanjang proses.

Anda dapat melihat peta lengkap perjalanan data ini langsung di konsolGoogle Cloud untuk aset yang dibuat di produk seperti Knowledge Catalog (sebelumnya bernama Dataplex Universal Catalog), BigQuery (termasuk tabel eksternal yang dibuat untuk Iceberg REST Catalog), dan Vertex AI. Karena alur kerja sering kali mencakup beberapa region, Knowledge Catalog mendukung silsilah multi-region, yang memberikan tampilan terpadu perjalanan data Anda di seluruh ekosistem global Google Cloud . Pengguna tingkat lanjut juga dapat mengambil informasi ini menggunakan Data Lineage API.

Alasan Anda memerlukan silsilah data

Perusahaan modern terus-menerus memindahkan dan mengubah data dalam jumlah besar. Misalnya, mengubah pembelian pelanggan mentah menjadi laporan, dasbor, dan model machine learning. Kompleksitas ini menimbulkan tantangan penting bagi tim Anda:

  • Kepercayaan dan verifikasi. Pengguna data sering kali kesulitan mengonfirmasi bahwa laporan dan angka yang mereka lihat akurat dan berasal dari sumber tepercaya.

  • Pemecahan masalah. Jika error muncul dalam laporan akhir, tim data mungkin akan kesulitan dan membutuhkan waktu lama untuk melacak masalah tersebut melalui setiap langkah hingga ke akar penyebabnya.

  • Manajemen perubahan. Sebelum mengubah atau menghapus sepotong data (seperti kolom dalam tabel), tim perlu mengetahui setiap laporan atau model hilir yang bergantung padanya untuk menghindari kerusakan sistem penting.

  • Kepatuhan. Para pemimpin memerlukan visibilitas tentang cara data sensitif (seperti informasi pelanggan atau keuangan) digunakan di seluruh organisasi untuk memenuhi persyaratan peraturan.

Silsilah data memecahkan masalah ini dengan memberikan perjalanan data yang jelas, visual, dan terdokumentasi. Dengan begitu, Anda dapat memahami sumber data, melacak error, menilai dampak perubahan, dan mempertahankan kepatuhan.

Cara kerja silsilah data

Alur kerja asal data mencakup langkah-langkah berikut:

  1. Sumber data dan penyerapan: informasi silsilah dari sumber data Anda memulai seluruh proses.

    • layananGoogle Cloud : saat Data Lineage API diaktifkan, layanan yang didukung seperti BigQuery dan Dataflow akan otomatis melaporkan peristiwa silsilah setiap kali data dipindahkan atau diubah.

    • Sumber kustom: untuk sistem apa pun yang tidak didukung secara otomatis oleh integrasiGoogle Cloud , Anda dapat menggunakan Data Lineage API untuk mencatat informasi silsilah secara manual. Sebaiknya impor peristiwa yang diformat sesuai dengan standar OpenLineage.

  2. Platform silsilah: platform pusat ini menyerap, memodelkan, dan menyimpan semua data silsilah.

    • Data Lineage API: API ini berfungsi sebagai titik entri tunggal untuk semua informasi silsilah yang masuk. Model ini menggunakan model data hierarkis yang terdiri dari tiga konsep inti: proses, operasi, dan peristiwa.

    • Pemrosesan dan penyimpanan: platform memproses data yang masuk dan menyimpannya dalam database yang andal dan dioptimalkan untuk kueri.

  3. Pengalaman pengguna: Anda dapat berinteraksi dengan informasi silsilah yang disimpan dengan dua cara utama:

    • Eksplorasi visual: di konsol Google Cloud , layanan frontend mengambil dan merender data silsilah sebagai grafik atau daftar interaktif. Hal ini didukung untuk Knowledge Catalog, BigQuery, Lakehouse (untuk tabel Iceberg REST Catalog), lapisan fisik (Cloud Storage), dan Vertex AI (untuk model, set data, melalui pipeline; dan tampilan feature store, serta grup fitur). Cara ini ideal untuk mempelajari perjalanan data Anda secara visual.

    • Akses terprogram: menggunakan klien API, Anda dapat berkomunikasi langsung dengan Data Lineage API untuk mengotomatiskan pengelolaan silsilah. Dengan begitu, Anda dapat menulis informasi silsilah dari sumber kustom. Selain itu, Anda dapat membaca dan membuat kueri data silsilah yang disimpan untuk digunakan di aplikasi lain atau untuk membuat laporan kustom.

Metode apa yang harus saya gunakan untuk asal-usul data?

Untuk melakukan pencarian langsung satu tingkat, gunakan metode SearchLinks. Untuk membangun grafik silsilah lengkap atau melakukan analisis dampak mendalam (hingga 100 tingkat), gunakan metode SearchLineageStreaming.

Bergantung pada kasus penggunaan, pilih metode yang paling sesuai:

Fitur SearchLinks SearchLineageStreaming
Kedalaman 1 tingkat (tetangga langsung) Hingga 100 level
Eksekusi Sinkron Streaming real-time
Kasus penggunaan Pencarian sederhana sumber atau target langsung Membangun grafik silsilah lengkap atau melakukan analisis dampak

Mengidentifikasi arah

  • Hulu (Asal):
    • Di SearchLinks, tetapkan kolom target ke FQN aset Anda.
    • Di SearchLineageStreaming, tetapkan direction ke UPSTREAM.
  • Downstream (Tujuan):
    • Di SearchLinks, tetapkan kolom source ke FQN aset Anda.
    • Di SearchLineageStreaming, tetapkan direction ke DOWNSTREAM.

Model informasi silsilah data

Silsilah adalah catatan data yang diubah dari sumber ke target. Data Lineage API mengumpulkan informasi ini dan menyusunnya ke dalam model data hierarkis yang menggunakan konsep proses, operasi, dan peristiwa.

Konsep Deskripsi
Proses Definisi transformasi data.
Jalankan Eksekusi proses.
Acara Catatan perpindahan data selama operasi.

Apa itu proses silsilah?

Proses adalah definisi operasi transformasi data untuk sistem tertentu. Untuk silsilah BigQuery, proses adalah tugas dari jenis pekerjaan yang didukung. Semua eksekusi kueri SQL yang sama ditautkan ke satu proses, yang memungkinkan Anda melacak setiap instance tempat logika transformasi tertentu digunakan.

Misalnya, kueri SQL berikut adalah proses. Kueri ini membuat tabel dengan menghitung jumlah total perjalanan untuk setiap vendor dari dua tabel sumber.

  CREATE TABLE `dataplex-docs.data_lineage_demo.total_green_trips_22_21`
  AS
  SELECT
      vendor_id,
      COUNT(*) AS number_of_trips
  FROM
      (
          SELECT vendor_id
          FROM `dataplex-docs.data_lineage_demo.nyc_green_trips_2022`
          UNION ALL
          SELECT vendor_id
          FROM `dataplex-docs.data_lineage_demo.nyc_green_trips_2021`
      )
  GROUP BY
      vendor_id;

Format nama resource REST untuk proses adalah projects/PROJECT_NUMBER/locations/LOCATION/processes/PROCESS_ID.

Contoh: projects/123456789123/locations/us/processes/sh-0548bbf4ff3c8072a6c7372ba1acafb6

Untuk mengetahui informasi selengkapnya tentang resource process, lihat Referensi resource proses.

Apa itu proses silsilah?

Operasi adalah satu kali eksekusi proses. Proses dapat memiliki beberapa operasi.

Setiap eksekusi adalah operasi unik yang dicirikan oleh startTime, endTime, dan status akhir, seperti COMPLETED, FAILED, atau ABORTED.

Misalnya, menjalankan kueri SQL dari bagian Proses pada pukul 09.00 akan membuat jalankan tertentu. Menjalankan kueri yang sama lagi pada pukul 10.00 AM akan membuat run baru yang berbeda. Kedua proses berjalan ditautkan ke proses induk yang sama.

Format nama resource REST untuk run menunjukkan bahwa run adalah turunan dari proses: projects/PROJECT_NUMBER/locations/LOCATION/processes/PROCESS_ID/runs/RUN_ID.

Contoh: projects/123456789123/locations/us/processes/sh-0548bbf4ff3c8072a6c7372ba1acafb6/runs/83dd03a51cd2ac80f465c9e267a950b1

Untuk mengetahui informasi selengkapnya tentang resource run, lihat referensi resource Run.

Apa yang dimaksud dengan peristiwa silsilah?

Peristiwa merepresentasikan titik waktu saat transformasi data memindahkan data antara sumber dan target entitas. Peristiwa adalah catatan terperinci dari pergerakan data tertentu yang menghubungkan tabel sumber dan target untuk proses tertentu. Peristiwa juga dapat memiliki beberapa sumber dan target.

Misalnya, jika eksekusi Anda menjalankan kueri SQL yang dibahas di bagian Proses, peristiwa silsilah mencatat bahwa tabel sumber nyc_green_trips_2021 dan nyc_green_trips_2022 digunakan untuk membuat tabel target total_green_trips_22_21.

Peristiwa silsilah berisi daftar link yang menentukan sumber dan target. Peristiwa digunakan untuk membuat grafik silsilah. Meskipun konsol Google Cloud menampilkan grafik silsilah ini, konsol tidak menampilkan peristiwa individual secara langsung. Anda dapat membuat, membaca, dan menghapus, tetapi tidak memperbarui peristiwa menggunakan Data Lineage API.

Setiap link dalam peristiwa menentukan satu jalur aliran data dari entity sumber ke entity target. Entitas adalah referensi ke aset data, seperti tabel BigQuery, dan diidentifikasi berdasarkan Nama yang Sepenuhnya Memenuhi Syarat (FQN). Satu peristiwa dapat berisi beberapa link, yang umum dalam operasi seperti penggabungan tabel ketika beberapa sumber berkontribusi pada satu target.

Untuk mengetahui detail tentang cara peristiwa mendukung silsilah tingkat kolom, lihat Silsilah tingkat kolom.

Sumber data apa yang didukung untuk silsilah data?

Anda dapat mengisi informasi silsilah di Knowledge Catalog dengan cara berikut:

  • Secara otomatis dari layanan Google Cloud terintegrasi
  • Secara manual, dengan menggunakan Data Lineage API untuk sumber kustom
  • Dengan mengimpor peristiwa dari OpenLineage

BigQuery

Saat Anda mengaktifkan silsilah data di project BigQuery, Knowledge Catalog akan otomatis mencatat informasi silsilah untuk berikut ini:

Tugas penyalinan, kueri, dan pemuatan BigQuery ditampilkan sebagai proses.

Untuk melihat detail proses, di grafik silsilah, klik ikon Detail proses Detail
proses..

Setiap proses berisi job_id BigQuery dalam daftar attributes untuk tugas BigQuery terbaru.

Layanan lainnya

Silsilah data mendukung integrasi dengan layananGoogle Cloud berikut: