סדרות המכונות של מעבדי GPU מקובצים, כמו A4X Max, A4X, A4, A3 Ultra, A3 Mega ו-A3 High (8 GPUs), מיועדות להפעלה של אשכולות בינה מלאכותית (AI) ולמידת מכונה (ML) בקנה מידה גדול, ומספקות את היכולות הבאות לניהול אשכולות:
- מיקום משותף של תשתית GPU באשכול
- מיקום מודעות בהתאם לטופולוגיית האשכול
- מצב הפעולה של האשכול
- תזמון של תחזוקת אשכולות ואמצעי בקרה
- כלי מעקב ואבחון של אשכולות
סדרות מכונות נתמכות
יכולות ניהול האשכולות שמתוארות בדף הזה זמינות עבור סדרת מכונות GPU באשכול, שעברו אופטימיזציה לעומסי עבודה מרובי-צמתים בקנה מידה גדול.
התכונות האלה לא חלות על סדרת המכונות הכללית של GPU, שמורכבת ממשאבי מחשוב עצמאיים שמשתמשים ברשת VPC רגילה ולא תומכים במצבי הפעלה של תחזוקה או במיקום משותף צפוף.
בטבלה הבאה מפורטות סדרות המכונות שנתמכות ב-AI Hypercomputer:
| קטגוריה | סדרת מכונות | תמיכה בניהול אשכולות |
|---|---|---|
| קבוצות של יחידות GPU | A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High | כן |
| יחידות GPU כלליות | A3 Edge, A2, G2, G4, N1 | לא |
מידע נוסף על כל סדרת מכונות זמין במאמר מידע על מאיצי GPU.
רוב היכולות של ניהול אשכולות נתמכות רק בקיבולת שמוגבלת להזמנה – תשתית שמשתמשת במודל הקצאת משאבים שמוגבל להזמנה, שתומך רק בסוגי מכונות של GPU באשכול. לגבי קיבולת שמשתמשת במודל הקצאת משאבים אחר, זמינות רק היכולות הבאות לניהול אשכולות:
- משאבי AI לתשתיות של שירותי אירוח שרתים
- מיקום מודעות בהתאם לטופולוגיית האשכול
- ניהול אירועים של מארחים בכמה מופעים
מיקום משותף של תשתית GPU באשכול
כשמשתמשים ב-GPU באשכול, כמו A4X Max, A4X, A4, A3 Ultra, A3 Mega ו-A3 High (8 GPUs), אפשר לבקש מכונות מארחות ש-Compute Engine מקצה כמה שיותר קרוב זו לזו. המכונות האלה מציעות את התכונות הבאות:
מערכת Compute Engine מקצה את המכונות כבלוקים של משאבים.
רשת דינמית של למידת מכונה (ML) שמקשרת בין המכונות.
הסידור הזה של המשאבים מצמצם את מספר הקפיצות ברשת ומבצע אופטימיזציה כדי להשיג את זמן האחזור הנמוך ביותר ברשת. כדי לפרוס בלוקים של מכונות שעברו אופטימיזציה לשימוש במאיצים ש-Compute Engine מקצה בצפיפות, אפשר להשתמש באפשרויות הבאות:
כדי לבצע אחת או יותר מהפעולות הבאות, צריך להקצות משאבים בצפיפות זה לזה:
יצירת משאבים שמשתמשים באותו שריון מקום שמור לעתיד ב-AI Hypercomputer או באותו שריון מקום שמור לעתיד במצב יומן.
פריסה של קבוצת מופעי מכונה מנוהלים (MIG) שמשתמשת בבקשות לשינוי גודל ויוצרת את המשאבים באותה בקשה.
מציינים שהמשאבים משתמשים באותה מדיניות מיקום קומפקטית או מדיניות עומס עבודה שמציינת ערך מרחק מקסימלי. ספציפית, המשאבים צריכים להיות קרובים למרחק המקסימלי שמוגדר במדיניות.
המשאבים מוקצים בצפיפות זה לזה על בסיס זמינות, כשמבצעים אחת או יותר מהפעולות הבאות:
יצירת משאבים באותה בקשה עבור מכונות וירטואליות עם הפעלה גמישה.
מציינים שהמשאבים משתמשים באותה מדיניות מיקום קומפקטית או מדיניות עומס עבודה שלא מציינת מרחק מקסימלי.
מיקום שמודע לטופולוגיה של האשכול
אחרי שיוצרים GPU באשכול, אפשר לקבל מידע על הטופולוגיה ברמת הצומת וברמת האשכול. המידע הזה עוזר לכם:
כדאי לשנות את העיצוב של האפליקציה או של עומס העבודה כדי לצמצם עוד יותר את זמן האחזור ברשת.
הסבר על זמן אחזור ברשת ובעיות בביצועים של מופעים שמתקשרים זה עם זה בתדירות גבוהה, ועל פתרון בעיות כאלה. הבעיות האלה יכולות לקרות אם המיקומים של המופעים רחוקים זה מזה באופן לא צפוי.
באופן ספציפי, התמיכה ביכולות טופולוגיה היא כדלקמן:
המידע על הטופולוגיה מתאים במיוחד לקיבולת שמוגבלת למקום שמור, שנדרשת כדי לראות את הטופולוגיה של מקום שמור.
יכולות הטופולוגיה תומכות רק בסוגי מכונות שתומכות במדיניות למיקום קומפקטי.
במכונות וירטואליות מסוג Spot, פרטי הטופולוגיה מופיעים רק כשמכונה משתמשת במדיניות למיקום קומפקטי.
מידע נוסף זמין במאמר בנושא הצגת הטופולוגיה של מופעי מחשוב.
מצב הפעולה של האשכול
כשמשריינים קיבולת כדי ליצור מופעי מחשוב או אשכולות באמצעות GPU באשכול, סוג המכונה שאתם משריינים קובע את מצב ההפעלה של האשכול עבור המופעים. במצב הזה מצוין איך המופעים מתנהגים אחרי שגיאות במארח או דוחות שגויים של המארח. מצבי הפעולה הזמינים של מכונה הם מצב מנוהל