דילוג לתוכן הראשי
Google Cloud Documentation
תיעוד
  • תחילת עבודה
  • תחילת העבודה עם Google Cloud
  • רשימת מוצרים
  • Cloud Customer Care
  • מוצרים מומלצים
  • Agent Platform
  • Apigee API Management
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • Google Kubernetes Engine
  • Looker
  • כלים למכפלה וקטורית (cross product)
  • ניהול גישה ומשאבים
  • ניהול עלויות ושימוש
  • תשתית כקוד
  • ‫SDK, שפות, frameworks וכלים
  • תחומים טכנולוגיים
  • ‫AI ו-ML
  • פיתוח אפליקציות
  • אירוח אפליקציות
  • Compute
  • ניתוח נתונים וצינורות עיבוד נתונים
  • מסדי נתונים
  • סביבות מבוזרות, היברידיות ומרובות עננים (multi-cloud)
  • פתרונות לתעשייה
  • העברה
  • קשרים מקצועיים
  • ניראות ומעקב
  • אבטחה
  • Storage
/
מסוף
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
היכנס
  • Managed Service for Apache Spark
התחלת תקופת ניסיון בחינם
סקירה כללית מדריכים חומרי עזר דגימות משאבים
Google Cloud Documentation
  • תיעוד
    • עוד
    • סקירה כללית
    • מדריכים
    • חומרי עזר
    • דגימות
    • משאבים
  • מסוף
  • סקירה כללית
  • מושגים מרכזיים
  • Managed Service for Apache Spark serverless
    • סקירה כללית
    • Managed Service for Apache Spark ברמות שירות בלי שרת (serverless)
  • ‫Managed Service for Apache Spark באשכולות
  • השוואה בין פריסות ללא שרת לבין פריסות של אשכולות
  • ‫Managed Service for Apache Spark on GKE
  • מתחילים
  • בלי שרת (serverless)
    • יצירת עומס עבודה של אצווה ב-Spark ללא שרת
  • אשכולות
    • יצירת אשכול
    • שליחת עבודת Spark לאשכול
    • מדריכים ל-Spark
      • שימוש ב-Gemini לפיתוח אפליקציות Spark
      • ניתוח מערכי נתונים ציבוריים באמצעות Spark
      • ניתוח סנטימנטים באמצעות Spark MLlib
  • GKE
    • הרצת משימת Spark ב-Kubernetes
  • פיתוח
  • בלי שרת (serverless)
    • הגדרת serverless
      • שימוש במאגרי תגים מותאמים אישית
      • שימוש ב-GPU
      • שימוש בכלי לתזמון דינמי של עומסי עבודה
      • הגדרת רשת
      • גרסאות של סביבת זמן הריצה של Spark
        • סקירה כללית
        • גרסת זמן הריצה של Spark‏ 3.0
        • גרסת זמן הריצה של Spark‏ 2.3
        • גרסת זמן הריצה של Spark‏ 2.2
        • גרסת זמן הריצה של Spark‏ 1.2
      • חשבונות שירות
      • מאפייני Spark
      • קטגוריית Staging
    • יצירת עומסי עבודה וסשנים של אצווה
      • יצירת עומס עבודה של אצווה ב-Spark ללא שרת
      • יצירת סשנים אינטראקטיביים ותבניות סשנים ללא שרת
      • שימוש בלקוח Spark Connect ללא שרת (serverless)
      • שימוש ב-JupyterLab לסשנים של מחשוב אצווה ו-notebook ללא שרת
      • שימוש בתבניות ללא שרת
        • סקירה כללית
        • ‫Cloud Spanner ל-Cloud Storage
        • מ-Cloud Storage ל-BigQuery
        • ‫Cloud Storage ל-Cloud Spanner
        • ‫Cloud Storage ל-Cloud Storage
        • ‫Cloud Storage ל-JDBC
        • ‫Hive ל-BigQuery
        • ‫Hive ל-Cloud Storage
        • ‫JDBC ל-BigQuery
        • ‫JDBC ל-Cloud Spanner
        • ‫JDBC ל-Cloud Storage
        • ‫JDBC אל JDBC
        • ‫Pub/Sub ל-Cloud Storage
    • יצירת טבלת Apache Iceberg עם מטא-נתונים בקטלוג של Lakehouse runtime
    • שימוש במחבר BigQuery עם Spark
      • סקירה כללית
      • שליחת שאילתות לטבלאות ב-BigQuery
    • הרצת קוד PySpark ב-notebooks של BigQuery Studio
    • אופטימיזציה
      • התאמה אוטומטית של משאבים לעומס עבודה
      • כוונון אוטומטי של עומסי עבודה ב-Spark
      • שימוש במנוע Lightning
        • שיפור ביצועים של עומסי עבודה וסשנים של אצווה באמצעות Lightning Engine
        • הפעלת הכלי לבדיקת כשירות להרצת שאילתות מקוריות
      • מאיצים של פתרונות Serverless Spark
  • אשכולות
    • עיבוד נתונים
      • הגדרת Spark
        • ניהול יחסי תלות ב-Spark
        • התאמה אישית של סביבת Spark
        • הפעלת כתיבה בו-זמנית
        • שיפור הביצועים של Spark
        • כוונון של Spark
        • שימוש במנוע Lightning
      • הרצת משימות Spark
        • שימוש במסוף
        • שימוש בשורת הפקודה
        • שימוש ב-REST APIs Explorer
          • יצירת אשכול
          • הרצת משימת Spark
          • עדכון אשכול
          • מחיקת אשכול
        • שימוש בספריות לקוח
      • הרצת משימות ב-Hadoop
      • כתיבה והרצה של משימות Spark Scala
      • הפעלת Trino
      • הפעלת Flink
      • הרצת Hive
      • Run Pig
      • הפעלת HBase
      • הרצת Python
        • הגדרת סביבת Python
        • שימוש בספריות לקוח של Cloud ל-Python
      • שימוש במחברי נתונים
        • שימוש במחבר Spark BigQuery
          • סקירה כללית
          • דוגמאות קוד של מחבר BigQuery
        • שימוש במחבר Cloud Storage
        • שימוש במחבר Spark Spanner
    • אגמי נתונים (data lakes) ו-lake houses
      • עיון בנתונים וחילוץ שלהם
      • טרנספורמציה של נתונים
      • טעינת נתונים ל-BigQuery
      • יצירת lakehouse באמצעות Spark ו-BigQuery
      • הגדרת מאגרי מטא-נתונים
      • יצירת טבלת Apache Iceberg עם מטא-נתונים ב-BigLake metastore
      • שימוש ב-Iceberg
      • שימוש ב-Delta
      • שימוש ב-Hudi
    • ממשקי משתמש ו-notebooks למדעי הנתונים
      • שימוש ב-Notebook
        • סקירה כללית
        • הרצת מחברת Jupyter באשכול
        • הרצת ניתוח גנומיקה ב-notebook
        • שימוש בתוסף JupyterLab לפיתוח עומסי עבודה (workloads) של Spark ללא שרת (serverless)
      • שימוש בשער הרכיבים
    • מקורות נתונים ואחסון
      • קישור למקורות נתונים
      • חיבור ל-Cloud Storage
      • התחברות ל-BigQuery
      • חיבור Hive ל-BigQuery
      • התחברות ל-Bigtable
      • קישור ל-Pub/Sub Lite
    • ניהול ומשילות מידע
      • ניהול ה-Fleet
      • שושלת
        • הפעלת מעקב אחר מקורות נתונים ב-Spark
        • הפעלת מעקב אחר מקורות נתונים ב-Hive
    • הגדרת אשכולות
      • רכיבים
        • סקירה כללית
        • Delta Lake
        • Docker
        • Flink
        • HBase
        • Hive WebHCat
        • Hudi
        • Iceberg
        • Jupyter
        • חזיר
        • פרסטו
        • שומר היערות
          • התקנת Ranger
          • שימוש ב-Ranger
            • שימוש ב-Ranger עם Kerberos
            • שימוש ב-Ranger עם שמירה במטמון והגבלת היקף
            • גיבוי ושחזור של סכימת Ranger
        • Solr
        • Trino
        • Zeppelin
        • מטפל בבעלי חיים
      • תמונות באשכול
        • סקירה כללית
        • שירותים
        • גרסאות של תמונות אשכול
          • סקירה כללית
          • גרסאות תמונות של מהדורות 3.0.x
          • גרסאות תמונות של מהדורות 2.3.x
          • גרסאות של תמונות שפורסמו ב-2.2.x
          • גרסאות תמונת ההפצה 2.1.x
      • אפשרויות מחשוב
        • סוגי מכונות
        • יחידות GPU
        • פלטפורמת מעבד מינימלית
        • מכונות וירטואליות גמישות
        • עובדים משניים
        • כונני SSD מקומיים
        • דיסקים לאתחול
        • דיסקים מסוג Hyperdisk שמצורפים
    • יצירת אשכולות
      • סקירה כללית
      • הגדרת רשת
        • סקירה כללית
        • שימוש בתגים מאובטחים
        • הגדרה של Private Service Connect
      • בחירת אזור של אשכול
      • הפעלת מיקום אוטומטי של אזורים
      • תזמון מחיקה של אשכול
      • שימוש בפעולות אתחול
      • הגדרת מטא-נתונים של אשכול
      • הגדרת מאפייני האשכול
      • הפעלת ממשקי אינטרנט של אשכולות
      • יצירת אשכול עם זמינות גבוהה
      • יצירת אשכול של קבוצת צמתים
      • יצירת אשכול חלקי
      • יצירת אשכול עם אפס צמתים
      • יצירת אשכול עם צומת יחיד
      • יצירת אשכול עם דייר יחיד
      • יצירת תמונה בהתאמה אישית
    • ניהול אשכולות
      • הגדרת תוויות לסינון
      • שינוי גודל של אשכולות
        • התאמה ידנית של העומס באשכולות
        • התאמה אוטומטית לעומס באשכולות
      • הפעלה והפסקה של אשכולות
        • הפעלה והפסקה של אשכול
        • תזמון של הפסקת האשכול
      • יצירה מחדש של אשכול
      • רוטציה של אשכולות
      • עדכון ומחיקה של אשכול
      • שימוש ב-SSH כדי להתחבר לאשכול
      • שיטות מומלצות
        • סקירה כללית
        • ממקסמים את הגמישות והיעילות של האשכולות והמשימות
      • ניהול נתוני האשכול
        • אחסון נתונים ב-Hadoop
        • בחירת סוג האחסון
        • שמירת נתונים של אשכול במטמון
        • הפחתת עומס של נתוני ערבוב
        • צפייה ביומני האשכול
    • ניהול ותזמור של עבודות
      • מחזור החיים של משימה
      • הפעלה מחדש של משימות
      • שימוש בתבניות של זרימות עבודה
        • סקירה כללית
        • הגדרת פרמטרים
        • שימוש בקובצי YAML
        • שימוש בבוררי אשכולות
        • שימוש בתהליכי עבודה מוטבעים
      • תזמור תהליכי עבודה
        • תבניות GitHub
        • פתרונות לתזמון תהליכי עבודה
        • שימוש בתבניות של זרימות עבודה
        • שימוש ב-Cloud Composer
        • שימוש ב-Cloud Functions
        • שימוש ב-Cloud Scheduler
  • GKE
    • יצירת מאגרי צמתים
    • יצירה מחדש של אשכול וירטואלי ב-GKE
    • יצירת אימג' מותאם אישית של קונטיינר ב-GKE
    • שינוי הגודל של אשכולות GKE
    • מחיקה של אשכול וירטואלי ב-GKE
    • גרסאות שפורסמו
  • ניהול ופיקוח
  • בלי שרת (serverless)
    • הרשאות ותפקידים
    • שימוש ב-CMEK עם Serverless for Apache Spark
    • אמצעי אבטחה שמוגדרים כברירת מחדל
    • שימוש ב-Secret Manager
    • יצירת אילוצים מותאמים אישית
  • אשכולות
    • שיטות מומלצות לאבטחה
    • אימות משתמשים
      • אימות ל-Managed Service for Apache Spark
      • אימות של אשכולות פרטיים
      • איחוד שירותי אימות הזהות של כוח העבודה
    • הקצאת תפקידים
      • הרשאות ותפקידים
      • משתמשים ראשיים ב-Managed Service for Apache Spark
      • הרשאות IAM פרטניות
      • הקצאת תפקידים ל-Kubernetes
    • חשבונות שירות
    • אשכולות מאובטחים
      • שימוש ב-Kerberos כדי לאבטח ריבוי דיירים
      • אבטחת ריבוי דיירים באמצעות חשבונות שירות
      • הצפנת הזיכרון
      • ניהול מפתחות להצפנת נתונים
      • הפעלת שירות ההרשאות של Ranger
      • שימוש בספק פרטי הכניסה של Secret Manager
      • יצירה של אשכול Hive metastore והגנה עליו
    • יצירת אילוצים מותאמים אישית
    • Assured Workloads
    • תאימות ל-FedRAMP
    • שימוש ב-Kerberos
    • VPC Service Controls