Solicitar VMs de início flexível de TPU
As VMs de início flexível de TPU, com tecnologia do Dynamic Workload Scheduler, oferecem uma maneira flexível e econômica de acessar recursos de TPU para cargas de trabalho de IA. Com elas, é possível provisionar dinamicamente TPUs por até sete dias, sem reservas de longo prazo ou um gerenciamento complexo de cotas. Com as VMs de início flexível de TPU, você envia uma solicitação de provisionamento de TPU que persiste até que a capacidade fique disponível. Quando disponíveis, as VMs de TPU são executadas pelo período especificado na solicitação.
Essas VMs são adequadas para experimentos rápidos, testes em pequena escala, provisionamento dinâmico de TPUs para cargas de trabalho de inferência, ajuste de modelos e execuções de carga de trabalho que levam menos de sete dias. Para mais informações sobre outras opções de consumo de TPU, consulte Opções de consumo do Cloud TPU.
Você pode excluir seus recursos de TPU a qualquer momento para interromper o faturamento. Para mais informações sobre os preços das TPUs, consulte Preços do Cloud TPU.
Limitações
As VMs de início flexível de TPU têm as seguintes limitações:
- É possível solicitar essas VMs por até sete dias.
- É possível solicitar as seguintes versões e zonas do Cloud TPU:
- Para usar as VMs de início flexível de TPU, você precisa usar a API de recursos em fila.
Antes de começar
Antes de solicitar as VMs de início flexível de TPU, faça o seguinte:
- Instale a CLI do Google Cloud.
- Crie um projeto do Google Cloud .
- Ative a API Cloud TPU.
Para mais informações, consulte Configurar o ambiente do Cloud TPU.
Verifique também se você tem cota preemptiva suficiente para usar as VMs de início flexível de TPU. Se você precisar de mais núcleos de TPU do que a quantidade concedida pela cota padrão, solicite uma alocação de cota maior. Para mais informações sobre os padrões e como solicitar mais cota, consulte Cotas do Cloud TPU.
Solicitar VMs de início flexível de TPU
As VMs de início flexível de TPU usam a API de recursos em fila para solicitar
recursos de TPU de maneira enfileirada. Quando o recurso solicitado fica disponível,
ele é atribuído ao projeto do Google Cloud para uso imediato e exclusivo.
Após a execução solicitada, as VMs de TPU são excluídas e o recurso
em fila passa para o estado SUSPENDED. Para mais informações sobre recursos
em fila, consulte Gerenciar recursos em fila.