Quero solucionar problemas com a alta latência dos agentes para Amazon Bedrock e otimizar o desempenho deles.
Breve descrição
Os agentes para Amazon Bedrock usam recursos de raciocínio para recuperar informações de bases de conhecimento que podem resultar em alta latência. Os seguintes fatores afetam os tempos de resposta dos agentes para Amazon Bedrock:
- Tamanho do modelo
- Estrutura e complexidade de prompts
- Número de tokens de entrada e saída
- Conectividade de rede e infraestrutura regional da AWS
Resolução
Solucionar problemas de latência do agente
Atualizar o tamanho do modelo
Se você usa modelos básicos grandes e experimenta maior latência, use modelos mais leves para casos de uso sensíveis à latência. A latência de invocação aumenta com a contagem combinada de tokens de entrada e saída. Para reduzir o tamanho dos tokens de saída, é possível fornecer instruções ao seu agente para fornecer respostas claras e curtas às consultas dos usuários.
Observação: o Amazon Bedrock publica automaticamente a métrica de latência de invocação em Bedrock no Amazon CloudWatch. Para mais informações, consulte Monitorando o desempenho do Amazon Bedrock.
Revisar as estratégias de orquestração
Conforme o número de invocações do modelo aumenta, a latência também aumenta. Certifique-se de definir com eficiência as instruções do seu agente, suas funções e parâmetros. Se você receber respostas lentas e seus casos de uso não exigirem recursos de orquestração, desative a orquestração para reduzir a latência. Recursos como pré-processamento, orquestração e pós-processamento podem aumentar o tempo de processamento.
Para desativar os modelos de orquestração, conclua as seguintes etapas:
- Abra o console Amazon Bedrock na região da AWS onde seu agente está implantado.
- No painel de navegação, expanda as Ferramentas do builder e escolha Agentes.
- Selecione o agente e escolha Editar no Agent Builder.
- Na seção Detalhes da estratégia de orquestração, escolha Editar.
- Escolha a guia Pré-processamento e desative a opção Ativar modelo de pré-processamento.
- Escolha a guia Pós-processamento e desative a opção Ativar modelo de pós-processamento.
- Escolha Salvar e sair.
Se você usar a orquestração personalizada, configure a orquestração para otimizar o desempenho. Forneça instruções claras. Se você incluir instruções redundantes ou ambíguas, poderá aumentar a carga cognitiva do modelo e afetar o tempo de resposta.
Verificar a configuração de rede do Amazon Bedrock
Se você usa o AWS Lambda com uma nuvem privada virtual (VPC) e experimenta interações lentas de rede com o Amazon Bedrock, o tráfego pode ser direcionado pela Internet pública. Para resolver esse problema, use o AWS PrivateLink para configurar o acesso privado ao Amazon Bedrock.
Ativar o CRIS
Em caso de latência durante períodos de alta demanda regional, você poderá atingir um gargalo regional. Para resolver esse problema, aumente o throughput com a inferência entre regiões (CRIS) para distribuir workloads de inferência em várias regiões.
Otimizar o desempenho do agente
Ative as respostas de streaming
Se suas saídas tiverem um alto número de tokens, os usuários deverão aguardar a resposta completa. Para verificar se você tem um alto número de tokens, use a métrica OutputTokenCount no CloudWatch. Para ativar respostas de streaming, use a API InvokeModelWithResponseStream para que o conteúdo chegue à medida que é gerado.
Configure sua base de conhecimento
Se você não limitar o número de blocos de documentos retornados, o tempo de geração de resposta aumentará. Para resolver esse problema, use o parâmetro numberOfResults para limitar o número de blocos de documentos recuperados da sua base de conhecimento.
Informações relacionadas
Monitorar a invocação do modelo usando o CloudWatch Logs e o Amazon S3