維護事件和政策

為確保 Google Cloud Managed Lustre 執行個體維持在最新狀態, Google Cloud會定期進行維護。維護事件可能包括更新基礎軟體或基礎架構。這些事件可能會導致暫時停機,期間對執行個體的 I/O 作業可能會停止回應。維護作業完成後,受影響的 I/O 作業就會繼續執行。停機時間通常介於 2 到 25 分鐘。

維護作業進行期間,執行個體的狀態為 UPGRADING。維護作業完成後,執行個體會恢復 ACTIVE 狀態。

您可以透過維護政策,控管這些維護事件的發生時間。您可以為每個執行個體設定維護政策,指定維護期間和應排除維護作業的時段。如果執行個體未設定維護政策,隨時都有可能執行維護作業。

您也可以重新安排維護事件,讓維護作業立即開始、在下一個可用時間範圍內開始,或在最多 28 天後於特定時間開始。

關於維護政策

您可以在每個 Managed Lustre 執行個體上設定維護政策。維護政策包含下列項目:

  • 每週維護期間:每週固定一小時,Managed Lustre 可在這段期間啟動維護事件。
  • 維護作業排除期間:在此期間,Managed Lustre 不得啟動維護事件。每個執行個體最多可定義一個排除時間範圍,最長為兩週。如果開始和結束日期未指定年份,排除期每年都會重複。

排除期優先於一般維護期間。如果排定的事件落在這段期間內,Managed Lustre 會將事件延後到下一個可用時間範圍,或完全略過事件。更新會在下一個維護週期套用。

維護作業通知

您可以訂閱即將進行的維護作業電子郵件通知,以便規劃因應任何可能的中斷情況。如要管理維護通知訂閱項目,請前往 Google Cloud 控制台的「通訊」頁面:

前往「通訊」頁面

訂閱後,系統會傳送下列通知:

  • 提前通知:在預定維護事件發生前 7 到 14 天,或在客戶重新安排維護事件後傳送。
  • 已取消:如果 Google 取消排定的維護事件,或客戶重新安排維護事件,系統就會傳送這類通知。
  • 執行中:維護事件開始時傳送。
  • 已完成:維護事件完成時傳送。

您也可以在 Google Cloud 控制台的執行個體詳細資料頁面中,查看即將進行的維護作業時間表,或使用 Cloud Logging 查看維護記錄

設定維護期間

維護期間需要一週中的某一天,以及一小時維護期間的 UTC 開始時間。

Google Cloud 控制台

如要在建立執行個體時設定維護期間,請參閱「建立執行個體」。

gcloud

如要建立包含維護期間的執行個體,請指定 --maintenance-policy-weekly-windows 旗標:

gcloud lustre instances create INSTANCE_ID \
  --per-unit-storage-throughput=PER_UNIT_STORAGE_THROUGHPUT \
  --capacity-gib=CAPACITY_GIB \
  --filesystem=FS_NAME \
  --location=LOCATION \
  --network=NETWORK_PATH \
  --maintenance-policy-weekly-windows='dayOfWeek=DAY,startTime={START_TIME}'

更改下列內容:

  • INSTANCE_ID:Managed Lustre 執行個體的 ID。
  • PER_UNIT_STORAGE_THROUGHPUT 是每 TiB 的 效能層級,單位為 MBps。有效值為 01252505001000。 如要指定 [動態層級][dynamic-tier],請將此值設為 0,並加入 --dynamic-tier-options-mode=DEFAULT_CACHE 標記。
  • CAPACITY:執行個體的容量 (以 GiB 為單位)。
  • FS_NAME:檔案系統的名稱。
  • LOCATION:Managed Lustre 執行個體的位置。
  • NETWORK_PATH:執行個體所屬虛擬私有雲網路的完整路徑,格式為 projects/PROJECT_ID/global/networks/NETWORK。請參閱「設定虛擬私有雲網路」。
  • DAY:維護期間的星期幾 (例如 TUESDAY)。
  • START_TIME:維護期間的世界標準時間開始時間,格式為字典 (例如 {hours=1,minutes=0})。

如要進一步瞭解如何建立執行個體,請參閱「建立 Managed Lustre 執行個體」。

REST API

如要為執行個體指定維護期間,請在建立執行個體時加入 maintenancePolicy 物件。

以下是 maintenancePolicy 物件的範例:

"maintenancePolicy": {
  "weeklyMaintenanceWindows": [
    {
      "dayOfWeek": "DAY",
      "startTime": {
        "hours": HOURS,
        "minutes": MINUTES
      }
    }
  ]
}

更改下列內容:

  • DAY:維護期間的星期幾 (例如 TUESDAY)。
  • HOURS:維護期間開始時間的小時 (例如 1)。
  • MINUTES:維護期間開始時間的小時分鐘 (例如 0)。

設定排除期

如要避免在特定期間 (例如節日或商務活動) 進行維護作業,可以在維護政策中定義一個維護排除時段。排除期最長可達兩週。如要建立每年重複的排除時間範圍,請勿在開始和結束日期中指定年份。

您可以在同一項政策中,同時設定每週維護期間和排除時段。

Google Cloud 控制台

如要在建立執行個體時設定排除時間範圍,請參閱「建立執行個體」一文。

gcloud

如要建立排除期間的執行個體,請指定 --maintenance-policy-exclusion-window 旗標:

gcloud lustre instances create INSTANCE_ID \
  --per-unit-storage-throughput=PER_UNIT_STORAGE_THROUGHPUT \
  --capacity-gib=CAPACITY_GIB \
  --filesystem=FILESYSTEM \
  --location=LOCATION \
  --network=NETWORK_PATH \
  --maintenance-policy-exclusion-window='startDate={START_DATE},endDate={END_DATE},time={TIME}'

更改下列內容:

  • INSTANCE_ID:Managed Lustre 執行個體的 ID。
  • PER_UNIT_STORAGE_THROUGHPUT 是每 TiB 的 效能層級,單位為 MBps。有效值為 01252505001000。 如要指定 [動態層級][dynamic-tier],請將此值設為 0,並加入 --dynamic-tier-options-mode=DEFAULT_CACHE 標記。
  • CAPACITY:執行個體的容量 (以 GiB 為單位)。
  • FS_NAME:檔案系統的名稱。
  • LOCATION:Managed Lustre 執行個體的位置。
  • NETWORK_PATH:執行個體所屬虛擬私有雲網路的完整路徑,格式為 projects/PROJECT_ID/global/networks/NETWORK。請參閱「設定虛擬私有雲網路」。
  • START_DATE:維護排除時間範圍的開始日期,格式為字典 (例如 {day=08,month=06,year=2026})。如要每年重複,請省略 year 鍵。
  • END_DATE:維護排除期間的結束日期,格式為字典 (例如 {day=08,month=06,year=2026})。如要每年重複,請省略 year 鍵。
  • TIME:排除期間的 UTC 開始和結束時間,格式為字典 (例如 {hours=1,minutes=0})。

REST API

以下是含有排除視窗的 maintenancePolicy 物件範例:

"maintenancePolicy": {
  "maintenanceExclusionWindow": [
    {
      "startDate": {
        "day": START_DAY,
        "month": START_MONTH,
        "year": START_YEAR
      },
      "endDate": {
        "day": END_DAY,