יכולות ניהול של אשכולות

סדרות המכונות של מעבדי GPU מקובצים, כמו A4X Max,‏ A4X, ‏ A4,‏ A3 Ultra, ‏ A3 Mega ו-A3 High (8 GPUs), מיועדות להפעלה של אשכולות בינה מלאכותית (AI) ולמידת מכונה (ML) בקנה מידה גדול, ומספקות את היכולות הבאות לניהול אשכולות:

סדרות מכונות נתמכות

יכולות ניהול האשכולות שמתוארות בדף הזה זמינות עבור סדרת מכונות GPU באשכול, שעברו אופטימיזציה לעומסי עבודה מרובי-צמתים בקנה מידה גדול.

התכונות האלה לא חלות על סדרת המכונות הכללית של GPU, שמורכבת ממשאבי מחשוב עצמאיים שמשתמשים ברשת VPC רגילה ולא תומכים במצבי הפעלה של תחזוקה או במיקום משותף צפוף.

בטבלה הבאה מפורטות סדרות המכונות שנתמכות ב-AI Hypercomputer:

קטגוריה סדרת מכונות תמיכה בניהול אשכולות
קבוצות של יחידות GPU A4X Max, ‏ A4X, ‏ A4, ‏ A3 Ultra, ‏ A3 Mega, ‏ A3 High כן
יחידות GPU כלליות A3 Edge, ‏ A2, ‏ G2, ‏ G4, ‏ N1 לא

מידע נוסף על כל סדרת מכונות זמין במאמר מידע על מאיצי GPU.

רוב היכולות של ניהול אשכולות נתמכות רק בקיבולת שמוגבלת להזמנה – תשתית שמשתמשת במודל הקצאת משאבים שמוגבל להזמנה, שתומך רק בסוגי מכונות של GPU באשכול. לגבי קיבולת שמשתמשת במודל הקצאת משאבים אחר, זמינות רק היכולות הבאות לניהול אשכולות:

מיקום משותף של תשתית GPU באשכול

כשמשתמשים ב-GPU באשכול, כמו A4X Max,‏ A4X,‏ A4,‏ A3 Ultra,‏ A3 Mega ו-A3 High (8 GPUs), אפשר לבקש מכונות מארחות ש-Compute Engine מקצה כמה שיותר קרוב זו לזו. המכונות האלה מציעות את התכונות הבאות:

הסידור הזה של המשאבים מצמצם את מספר הקפיצות ברשת ומבצע אופטימיזציה כדי להשיג את זמן האחזור הנמוך ביותר ברשת. כדי לפרוס בלוקים של מכונות שעברו אופטימיזציה לשימוש במאיצים ש-Compute Engine מקצה בצפיפות, אפשר להשתמש באפשרויות הבאות:

מיקום שמודע לטופולוגיה של האשכול

אחרי שיוצרים GPU באשכול, אפשר לקבל מידע על הטופולוגיה ברמת הצומת וברמת האשכול. המידע הזה עוזר לכם:

  • כדאי לשנות את העיצוב של האפליקציה או של עומס העבודה כדי לצמצם עוד יותר את זמן האחזור ברשת.

  • הסבר על זמן אחזור ברשת ובעיות בביצועים של מופעים שמתקשרים זה עם זה בתדירות גבוהה, ועל פתרון בעיות כאלה. הבעיות האלה יכולות לקרות אם המיקומים של המופעים רחוקים זה מזה באופן לא צפוי.

באופן ספציפי, התמיכה ביכולות טופולוגיה היא כדלקמן:

מידע נוסף זמין במאמר בנושא הצגת הטופולוגיה של מופעי מחשוב.

מצב הפעולה של האשכול

כשמשריינים קיבולת כדי ליצור מופעי מחשוב או אשכולות באמצעות GPU באשכול, סוג המכונה שאתם משריינים קובע את מצב ההפעלה של האשכול עבור המופעים. במצב הזה מצוין איך המופעים מתנהגים אחרי שגיאות במארח או דוחות שגויים של המארח. מצבי הפעולה הזמינים של מכונה הם מצב מנוהל