Supervisa VMs de TPU

En esta guía, se explica cómo usar Cloud Monitoring para supervisar tus VMs de TPU. Cloud Monitoring recopila automáticamente métricas y registros de tu TPU y su VM host. Estos datos se pueden usar para supervisar el estado de tu TPU y Compute Engine.

Las métricas te permiten hacer un seguimiento de una cantidad numérica a lo largo del tiempo, por ejemplo, el uso de CPU y la red, o la duración de inactividad de TensorCore. Los registros capturan eventos en un momento específico. Las entradas de registro las escriben tu propio código, los servicios deGoogle Cloud , las aplicaciones de terceros y la infraestructura deGoogle Cloud . También puedes generar métricas a partir de los datos presentes en una entrada de registro creando una métrica basada en registros. También puedes establecer políticas de alertas basadas en valores de métricas o entradas de registro.

Para supervisar las TPU, también puedes usar el Planificador de capacidad (versión preliminar). Con el Planificador de capacidad, puedes ver los datos de uso y previsión de la TPU para tu proyecto, organización o carpeta. Estos datos se actualizan cada 24 horas y puedes usarlos para analizar las tendencias de uso y planificar las necesidades de capacidad futuras. Para obtener más información, consulta la Descripción general del Planificador de capacidad.

Accede a las métricas de TPU

Compute Engine genera dos tipos de métricas de TPU: métricas del entorno de ejecución de TPU y métricas de infraestructura de la VM de TPU. Puedes obtener las métricas de dos maneras:

  • Biblioteca de supervisión de TPU: Obtén métricas del entorno de ejecución de la TPU desde el SDK de LibTPU con la biblioteca de supervisión de TPU. Esto permite que tus aplicaciones obtengan telemetría en tiempo real desde el entorno invitado. Para obtener más información, consulta la biblioteca de supervisión de TPU.

  • Recopilador de telemetría de IA: Obtén métricas de tiempo de ejecución y de infraestructura de VM a través del recopilador de telemetría de IA. El recopilador de telemetría de IA se ejecuta dentro de la VM de TPU y te permite acceder a las métricas a través de Cloud Monitoring o de tu propia canalización de supervisión basada en Prometheus. Para obtener más información, consulta AI Telemetry Collector.

Métricas de TPU

Las métricas deGoogle Cloud para Cloud TPU se generan automáticamente en las VMs de Compute Engine y el entorno de ejecución de Cloud TPU. Las métricas de la siguiente tabla se generan a partir de las VMs de Compute Engine.

Las cadenas de “tipo de métrica” de esta tabla deben tener el prefijo compute.googleapis.com/. Este prefijo se omitió en las entradas de la tabla. Cuando consultes una etiqueta, usa el prefijo metric.labels. Por ejemplo, metric.labels.LABEL="VALUE".

Tipo de métrica Etapa de lanzamiento(niveles de jerarquía de recursos)
Nombre visible
Clase, tipo, unidad
Recursos supervisados
Descripción
Etiquetas
instance/tpu/accelerator/duty_cycle BETA(proyecto)
Ciclo de trabajo del acelerador
GAUGEDOUBLE%
gce_instance
Porcentaje de tiempo durante el período de muestra en el que el acelerador se procesaba de forma activa. Los valores se encuentran en el rango de [0,100].
accelerator_id: Es el ID del dispositivo del acelerador.
instance/tpu/accelerator/memory_bandwidth_utilization BETA(proyecto)
Uso del ancho de banda de la memoria del acelerador
GAUGEDOUBLE%
gce_instance
Porcentaje actual de memoria y ancho de banda del acelerador en uso. Se calcula dividiendo el ancho de banda de memoria usado durante un período de muestra por el ancho de banda máximo admitido durante el mismo período.
accelerator_id: Es el ID del dispositivo del acelerador.
instance/tpu/accelerator/memory_total BETA(proyecto)
Memoria total del acelerador
GAUGEINT64By
gce_instance
Memoria total del acelerador asignada actualmente en bytes.
accelerator_id: Es el ID del dispositivo del acelerador.
instance/tpu/accelerator/memory_used BETA(proyecto)
Memoria del acelerador utilizada
GAUGEINT64By
gce_instance
Memoria total del acelerador que se usa actualmente en bytes.
accelerator_id: Es el ID del dispositivo del acelerador.
instance/tpu/accelerator/tensorcore_utilization BETA(proyecto)
Uso de Tensor Core del acelerador
GAUGEDOUBLE%
gce_instance
Porcentaje actual del TensorCore que se usa. Se calcula dividiendo las operaciones de TensorCore que se realizaron durante un período de muestra por la cantidad admitida de operaciones de TensorCore durante el mismo período de muestra.
accelerator_id: Es el ID del dispositivo del acelerador.
instance/tpu/active_chips BETA(proyecto)
Recuento de chips de TPU activos
GAUGEINT641
gce_instance
Es el recuento actual de chips que se utilizan de forma activa (es decir, que no están inactivos).
accelerator_type: Tipo y generación del acelerador.
reservation_id: Es el ID de la reserva de la máquina física.
provisioning_model: Es el modelo de aprovisionamiento asociado.
protection_tier: Es el modelo de protección asociado.
block_id: Es el ID del bloque dentro del clúster que aloja la VM.
subblock_id: Es el ID del subbloque que aloja la VM.
is_exr: (BOOL) Indica si el chip forma parte de una reserva extendida.
instance/tpu/chip_state BETA(proyecto)
Recuento de estados de chips de TPU
GAUGEINT641
gce_instance
Es el recuento de chips TPU en varios estados, como en buen estado, en mal estado y desconocido.
state: Es el estado del chip.
accelerator_type: Tipo y generación del acelerador.
block_id: Es el ID del bloque dentro del clúster que aloja la VM.
subblock_id: Es el ID del subbloque que aloja la VM.
reservation_id: Es el ID de la reserva de la máquina física.
is_exr: (BOOL) Indica si el chip forma parte de una reserva extendida.
instance/tpu/infra_health BETA(proyecto)
Estado de la instancia de TPU
GAUGEINT641
gce_instance
Indica el estado general de una instancia de TPU. Las etiquetas de métricas ayudan a identificar el estado de salud específico y los motivos de los problemas en las instancias de TPU degradadas o en mal estado, y se enfocan principalmente en el hardware y el estado del sistema de la TPU. Es posible que los cambios en el estado de salud tarden varios minutos en reflejarse en esta métrica. Se hace un muestreo cada 60 segundos. Luego del muestreo, los datos no son visibles durante un máximo de 420 segundos.
health_status: Es el estado general de la instancia de TPU. Valores posibles: HEALTHY (funciona según lo esperado), UNHEALTHY (se detectó un problema crítico), DEGRADED (problema que afecta el rendimiento), UNKNOWN (no se puede determinar el estado).
unhealthy_category: Explicación del estado de VM en mal estado. Esta etiqueta solo se completa cuando el valor de la métrica es Unhealthy.
machine_type: Es el tipo de máquina de la instancia (p.ej., ct6e-standard-4t-tpu).
machine_id: Es el ID de la máquina física que aloja la VM.
block_id: Es el ID del bloque dentro del clúster que aloja la VM.
cluster_id: Es el ID del clúster que aloja la VM.
reservation_id: Es el ID de la reserva de la máquina física.
subblock_id: Es el ID del subbloque que aloja la VM.
instance/tpu/runtime/uptime BETA(proyecto)
Tiempo de actividad del entorno de ejecución
GAUGEINT64s
gce_instance
Tiempo de actividad del entorno de ejecución de AA desde la inicialización de la biblioteca del entorno de ejecución (libtpu.so) por parte del trabajo de AA. Durante este período, la biblioteca de tiempo de ejecución bloquea los dispositivos TPU para que el trabajo de AA no los use.
ml_framework_name: Nombre del framework de AA.
ml_framework_version: Es la versión del framework de AA.
instance/tpu/scheduled_chips BETA(project)
Recuento de chips de TPU programados
GAUGEINT641
gce_instance
Es el recuento actual de chips asignados a una VM que está en buen estado y NO está INHABILITADA para mantenimiento.
accelerator_type: Tipo y generación del acelerador.
reservation_id: Es el ID de la reserva de la máquina física.
provisioning_model: Es el modelo de aprovisionamiento asociado.
protection_tier: Es el modelo de protección asociado.
block_id: Es el ID del bloque dentro del clúster que aloja la VM.
subblock_id: Es el ID del subbloque que aloja la VM.
is_exr: (BOOL) Indica si el chip forma parte de una reserva extendida.
instance/tpu/utilized_chips BETA(proyecto)
Chips de TPU utilizados
GAUGEDOUBLE1
gce_instance
La capacidad agregada utilizada actual, expresada como una cantidad efectiva de chips activos. Equivale a la suma del uso fraccionario (de 0.0 a 1.0) de todos los chips activos.
accelerator_type: Tipo y generación del acelerador.
reservation_id: Es el ID de la reserva de la máquina física.
provisioning_model: Es el modelo de aprovisionamiento asociado.
protection_tier: Es el modelo de protección asociado.
block_id: Es el ID del bloque dentro del clúster que aloja la VM.
subblock_id: Es el ID del subbloque que aloja la VM.
is_exr: (BOOL) Indica si el chip forma parte de una reserva extendida.
quota/tpus_per_tpu_family/exceeded ALFA(project)
Error por exceso de cuota de recuento de TPU por familia de TPU
DELTAINT641
compute.googleapis.com/Location
Cantidad de intentos para superar el límite en la métrica de cuota compute.googleapis.com/tpus_per_tpu_family. Luego del muestreo, los datos no son visibles durante un máximo de 150 segundos.
limit_name: Es el nombre del límite.