Monitorar o goodput com a biblioteca de medição de goodput de ML

A biblioteca de medição de goodput de ML (ml-goodput-measurement) é um pacote Python que ajuda a medir a eficiência das cargas de trabalho de treinamento de ML executadas em VMs do Cloud TPU. A biblioteca fornece métricas que medem o goodput da carga de trabalho, que é a proporção do tempo de uso da TPU gasto para fazer um progresso de treinamento produtivo e preservado. Por outro lado, o badput é a proporção do tempo total gasto em atividades não produtivas, como sobrecarga de inicialização, interrupções de E/S e recuperação de interrupções.

É possível visualizar as métricas de goodput em tempo real com os painéis do Cloud Monitoring e TensorBoard, permitindo identificar gargalos, otimizar a utilização de recursos e, por fim, reduzir os custos de treinamento.

Para mais informações, consulte o repositório do GitHub de medição de goodput de ML.

Métricas de goodput

A biblioteca de medição de goodput de ML fornece as seguintes métricas, que também estão disponíveis para visualização no Cloud Monitoring e no TensorBoard. As métricas nesta tabela precisam ser prefixadas com compute.googleapis.com/workload/. Por exemplo, o nome completo da métrica goodput_time é compute.googleapis.com/workload/goodput_time.