Langsung ke konten utama
Google Cloud Documentation
Dokumentasi
  • Mulai
  • Mulai Menggunakan Google Cloud
  • Daftar Produk
  • Cloud Customer Care
  • Produk Unggulan
  • Agent Platform
  • Pengelolaan API Apigee
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • Google Kubernetes Engine
  • Looker
  • Alat Lintas Produk
  • Pengelolaan akses dan resource
  • Pengelolaan biaya dan penggunaan
  • Infrastruktur sebagai kode
  • SDK, bahasa, framework, dan alat
  • Area Teknologi
  • AI dan ML
  • Pengembangan aplikasi
  • Hosting aplikasi
  • Compute
  • Pipeline dan analisis data
  • Database
  • Terdistribusi, hybrid, dan multicloud
  • Solusi industri
  • Migrasi
  • Jaringan
  • Kemampuan observasi dan pemantauan
  • Keamanan
  • Storage
/
Konsol
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
Masuk
  • Managed Service for Apache Spark
Mulai gratis
Ringkasan Panduan Referensi Contoh Referensi
Google Cloud Documentation
  • Dokumentasi
    • Lainnya
    • Ringkasan
    • Panduan
    • Referensi
    • Contoh
    • Referensi
  • Konsol
  • Ringkasan
  • Konsep Utama
  • Managed Service untuk Apache Spark serverless
    • Ringkasan
    • Paket serverless Managed Service untuk Apache Spark
  • Managed Service untuk Apache Spark di cluster
  • Membandingkan deployment serverless dan cluster
  • Managed Service untuk Apache Spark di GKE
  • Mulai
  • Serverless
    • Membuat workload batch serverless Spark
  • Cluster
    • Membuat cluster
    • Mengirimkan tugas Spark ke cluster
    • Tutorial Spark
      • Menggunakan Gemini untuk mengembangkan aplikasi Spark
      • Menganalisis set data publik dengan Spark
      • Analisis sentimen dengan Spark MLlib
  • GKE
    • Menjalankan tugas Spark di Kubernetes
  • Mengembangkan aplikasi
  • Serverless
    • Mengonfigurasi serverless
      • Menggunakan container kustom
      • Menggunakan GPU
      • Menggunakan Dynamic Workload Scheduler
      • Konfigurasi jaringan
      • Versi runtime Spark
        • Ringkasan
        • Versi runtime Spark 3.0
        • Versi runtime Spark 2.3
        • Versi runtime Spark 2.2
        • Versi runtime Spark 1.2
      • Akun layanan
      • Properti Spark
      • Bucket staging
    • Membuat workload dan sesi batch
      • Membuat workload batch serverless Spark
      • Membuat sesi interaktif serverless dan template sesi
      • Menggunakan klien Spark Connect serverless
      • Menggunakan JupyterLab untuk sesi notebook dan batch serverless
      • Menggunakan template serverless
        • Ringkasan
        • Cloud Spanner ke Cloud Storage
        • Cloud Storage ke BigQuery
        • Cloud Storage ke Cloud Spanner
        • Cloud Storage ke Cloud Storage
        • Cloud Storage ke JDBC
        • Hive ke BigQuery
        • Beralih ke Cloud Storage
        • JDBC ke BigQuery
        • JDBC ke Cloud Spanner
        • JDBC ke Cloud Storage
        • JDBC ke JDBC
        • Pub/Sub ke Cloud Storage
    • Membuat tabel Apache Iceberg dengan metadata di katalog runtime Lakehouse
    • Menggunakan konektor BigQuery dengan Spark
      • Ringkasan
      • Membuat kueri tabel BigQuery
    • Menjalankan kode PySpark di notebook BigQuery Studio
    • Optimalkan
      • Melakukan penskalaan otomatis resource workload
      • Menyesuaikan workload Spark secara otomatis
      • Menggunakan Lightning Engine
        • Mempercepat workload dan sesi batch dengan Lightning Engine
        • Menjalankan alat kualifikasi Eksekusi Kueri Native
      • Akselerator solusi Serverless Spark
  • Cluster
    • Pemrosesan data
      • Mengonfigurasi Spark
        • Mengelola dependensi Spark
        • Menyesuaikan lingkungan Spark
        • Mengaktifkan penulisan serentak
        • Meningkatkan performa Spark
        • Menyesuaikan Spark
        • Menggunakan Lightning Engine
      • Menjalankan tugas Spark
        • Menggunakan konsol
        • Menggunakan command line
        • Menggunakan REST API Explorer
          • Membuat cluster
          • Menjalankan tugas Spark
          • Memperbarui cluster
          • Hapus cluster
        • Menggunakan library klien
      • Menjalankan tugas Hadoop
      • Menulis dan menjalankan tugas Spark Scala
      • Menjalankan Trino
      • Menjalankan Flink
      • Menjalankan Hive
      • Run Pig
      • Menjalankan HBase
      • Jalankan Python
        • Mengonfigurasi lingkungan Python
        • Menggunakan Library Klien Cloud untuk Python
      • Menggunakan konektor data
        • Menggunakan konektor Spark BigQuery
          • Ringkasan
          • Contoh kode konektor BigQuery
        • Menggunakan konektor Cloud Storage
        • Menggunakan konektor Spark Spanner
    • Data lake dan lake house
      • Menjelajahi dan mengekstrak data
      • Mentransformasi data
      • Memuat data ke BigQuery
      • Membuat lakehouse dengan Spark dan BigQuery
      • Mengonfigurasi metastore
      • Membuat tabel Apache Iceberg dengan metadata di metastore BigLake
      • Menggunakan Iceberg
      • Menggunakan Delta
      • Menggunakan Hudi
    • Notebook dan UI data science
      • Menggunakan notebook
        • Ringkasan
        • Menjalankan notebook Jupyter di cluster
        • Menjalankan analisis genomik di notebook
        • Menggunakan ekstensi JupyterLab untuk mengembangkan workload Spark serverless
      • Menggunakan Gateway Komponen
    • Sumber dan penyimpanan data
      • Menghubungkan ke sumber data
      • Menghubungkan ke Cloud Storage
      • Menghubungkan ke BigQuery
      • Menghubungkan Hive ke BigQuery
      • Menghubungkan ke Bigtable
      • Menghubungkan ke Pub/Sub Lite
    • Administrasi dan tata kelola data
      • Manajemen fleet
      • Silsilah
        • Mengaktifkan silsilah data Spark
        • Mengaktifkan silsilah data Hive
    • Konfigurasi cluster
      • Komponen
        • Ringkasan
        • Delta Lake
        • Docker
        • Flink
        • HBase
        • WebHCat Hive
        • Hudi
        • Iceberg
        • Jupyter
        • Pig
        • Presto
        • Ranger
          • Menginstal Ranger
          • Menggunakan Ranger
            • Menggunakan Ranger dengan Kerberos
            • Menggunakan Ranger dengan caching dan downscoping
            • Mencadangkan dan memulihkan skema Ranger
        • Solr
        • Trino
        • Zeppelin
        • Zookeeper
      • Gambar cluster
        • Ringkasan
        • Layanan
        • Versi image cluster
          • Ringkasan
          • Versi image rilis 3.0.x
          • Versi image rilis 2.3.x
          • Versi image rilis 2.2.x
          • Versi image rilis 2.1.x
      • Opsi Compute
        • Jenis mesin
        • GPU
        • Platform CPU minimal
        • VM Fleksibel
        • Pekerja sekunder
        • Solid State Drive lokal
        • Boot disk
        • Hyperdisk yang terpasang
    • Membuat cluster
      • Ringkasan
      • Mengonfigurasi jaringan
        • Ringkasan
        • Menggunakan tag aman
        • Mengonfigurasi Private Service Connect
      • Pilih wilayah cluster
      • Mengaktifkan penempatan zona otomatis
      • Menjadwalkan penghapusan cluster
      • Menggunakan tindakan inisialisasi
      • Menetapkan metadata cluster
      • Menetapkan properti cluster
      • Mengaktifkan antarmuka web cluster
      • Membuat cluster dengan ketersediaan tinggi
      • Membuat cluster grup node
      • Membuat cluster parsial
      • Membuat cluster skala nol
      • Membuat cluster node tunggal
      • Membuat sole-tenant cluster
      • Membuat image kustom
    • Mengelola cluster
      • Menetapkan label untuk pemfilteran
      • Menskalakan cluster
        • Menskalakan cluster secara manual
        • Melakukan penskalaan otomatis cluster
      • Memulai dan menghentikan cluster
        • Memulai dan menghentikan cluster
        • Menjadwalkan penghentian cluster
      • Membuat ulang cluster
      • Rotasi cluster
      • Memperbarui dan menghapus cluster
      • Menggunakan SSH untuk terhubung ke cluster
      • Mengikuti praktik terbaik
        • Ringkasan
        • Memaksimalkan fleksibilitas dan efisiensi cluster dan tugas
      • Mengelola data cluster
        • Penyimpanan data Hadoop
        • Pilih jenis penyimpanan
        • Menyimpan data cluster dalam cache
        • Mengurangi beban data shuffle
        • Melihat log cluster
    • Mengelola dan mengatur tugas
      • Fungsi sebuah tugas
      • Memulai ulang tugas
      • Menggunakan template alur kerja
        • Ringkasan
        • Parameterisasi
        • Menggunakan file YAML
        • Menggunakan pemilih cluster
        • Menggunakan alur kerja inline
      • Mengorkestrasi alur kerja
        • Template GitHub
        • Solusi penjadwalan alur kerja
        • Menggunakan template alur kerja
        • Menggunakan Cloud Composer
        • Menggunakan Cloud Functions
        • Menggunakan Cloud Scheduler
  • GKE
    • Membuat node pool
    • Membuat ulang cluster virtual GKE
    • Membuat image container kustom GKE
    • Menskalakan cluster GKE
    • Menghapus virtualcluster GKE
    • Versi rilis
  • Mengelola dan mengatur
  • Serverless
    • Izin dan peran
    • Menggunakan CMEK dengan Serverless untuk Apache Spark
    • Tindakan keamanan default
    • Menggunakan Secret Manager
    • Membuat batasan kustom
  • Cluster
    • Praktik keamanan terbaik
    • Mengautentikasi pengguna
      • Melakukan Autentikasi ke Managed Service for Apache Spark
      • Mengautentikasi cluster pribadi
      • Workforce identity federation
    • Tetapkan peran
      • Izin dan peran
      • Prinsipal Managed Service for Apache Spark
      • IAM terperinci
      • Menetapkan peran untuk Kubernetes
    • Akun layanan
    • Mengamankan cluster
      • Mengamankan multi-tenancy menggunakan Kerberos
      • Mengamankan multi-tenancy menggunakan akun layanan
      • Mengenkripsi memori
      • Mengelola kunci enkripsi data
      • Mengaktifkan layanan otorisasi Ranger
      • Menggunakan penyedia kredensial Secret Manager
      • Membuat dan mengamankan cluster metastore Hive
    • Membuat batasan kustom
    • Assured Workloads
    • Kepatuhan terhadap FedRAMP
    • Menggunakan Kerberos
    • Kontrol Layanan VPC
    • Menetapkan akses Tenaga Kerja
  • Memantau dan memecahkan masalah
  • Serverless
    • Menyelidiki beban kerja dengan Gemini Cloud Assist yang didukung AI
    • Memantau workload dan sesi serverless
      • Memantau workload batch
      • Memantau sesi interaktif
      • Metrik Spark
      • Mengaktifkan silsilah data
      • Penggunaan resource profil
      • Log audit Resource Manager
    • Memecahkan masalah workload dan sesi serverless
      • Memecahkan masalah kegagalan pembuatan batch dan sesi
      • Memecahkan masalah konektivitas batch dan sesi
  • Cluster
    • Menyelidiki cluster dan tugas dengan Gemini Cloud Assist yang didukung AI
    • Memantau cluster dan tugas
      • Ringkasan
      • Metrik Managed Service for Apache Spark
      • Membuat pemberitahuan metrik
      • Penggunaan resource profil
      • Analisis log
        • Log Managed Service for Apache Spark
        • Log output tugas
        • Log audit
    • Memecahkan masalah cluster
      • Melihat data diagnostik cluster
      • Memecahkan masalah pembuatan cluster
    • Memecahkan masalah tugas
      • Memecahkan masalah tugas
      • Memecahkan masalah error memori
      • Memecahkan masalah penundaan tugas
      • Melihat histori tugas