Ir para o conteúdo

Como faço para otimizar tarefas de inferência em lote no Amazon Bedrock?

2 minuto de leitura
0

Minhas tarefas de inferência em lote do Amazon Bedrock estão lentas ou falham.

Resolução

Os tempos de execução das tarefas em lote dependem da capacidade disponível, das tarefas simultâneas na fila e da alocação de recursos específica do modelo. Use os seguintes métodos de resolução para otimizar suas tarefas de inferência em lote no Amazon Bedrock.

Forneça prompts de entrada simples e completos

Para reduzir o tempo de processamento da tarefa e melhorar a qualidade dos resultados, crie prompts claros e concisos que não incluam contexto desnecessário.

Não exceda as cotas de serviço

Se você executar várias tarefas de inferência em lote em paralelo, certifique-se de que elas não excedam as cotas de serviço que variam de acordo com o modelo e a região da AWS.

Para mais informações sobre projetos de grande escala, consulte Automatizar a inferência em lote do Amazon Bedrock: construindo um pipeline dimensionável e eficiente.

Programe a execução das tarefas fora do horário de pico

Use o Amazon EventBridge para programar tarefas de inferência em lote fora do horário de pico, quando a disponibilidade de recursos pode ser maior.

Use inferência entre regiões

Use perfis de inferência entre regiões nas solicitações da API CreateModelInvocationJob para distribuir workloads entre regiões.

AWS OFICIALAtualizada há um ano