Ir para o conteúdo

Como solucionar problemas de latência e otimizar o desempenho dos agentes para Amazon Bedrock?

4 minuto de leitura
0

Quero solucionar problemas com a alta latência dos agentes para Amazon Bedrock e otimizar o desempenho deles.

Breve descrição

Os agentes para Amazon Bedrock usam recursos de raciocínio para recuperar informações de bases de conhecimento que podem resultar em alta latência. Os seguintes fatores afetam os tempos de resposta dos agentes para Amazon Bedrock:

  • Tamanho do modelo
  • Estrutura e complexidade de prompts
  • Número de tokens de entrada e saída
  • Conectividade de rede e infraestrutura regional da AWS

Resolução

Solucionar problemas de latência do agente

Atualizar o tamanho do modelo

Se você usa modelos básicos grandes e experimenta maior latência, use modelos mais leves para casos de uso sensíveis à latência. A latência de invocação aumenta com a contagem combinada de tokens de entrada e saída. Para reduzir o tamanho dos tokens de saída, é possível fornecer instruções ao seu agente para fornecer respostas claras e curtas às consultas dos usuários.

Observação: o Amazon Bedrock publica automaticamente a métrica de latência de invocação em Bedrock no Amazon CloudWatch. Para mais informações, consulte Monitorando o desempenho do Amazon Bedrock.

Revisar as estratégias de orquestração

Conforme o número de invocações do modelo aumenta, a latência também aumenta. Certifique-se de definir com eficiência as instruções do seu agente, suas funções e parâmetros. Se você receber respostas lentas e seus casos de uso não exigirem recursos de orquestração, desative a orquestração para reduzir a latência. Recursos como pré-processamento, orquestração e pós-processamento podem aumentar o tempo de processamento.

Para desativar os modelos de orquestração, conclua as seguintes etapas:

  1. Abra o console Amazon Bedrock na região da AWS onde seu agente está implantado.
  2. No painel de navegação, expanda as Ferramentas do builder e escolha Agentes.
  3. Selecione o agente e escolha Editar no Agent Builder.
  4. Na seção Detalhes da estratégia de orquestração, escolha Editar.
  5. Escolha a guia Pré-processamento e desative a opção Ativar modelo de pré-processamento.
  6. Escolha a guia Pós-processamento e desative a opção Ativar modelo de pós-processamento.
  7. Escolha Salvar e sair.

Se você usar a orquestração personalizada, configure a orquestração para otimizar o desempenho. Forneça instruções claras. Se você incluir instruções redundantes ou ambíguas, poderá aumentar a carga cognitiva do modelo e afetar o tempo de resposta.

Verificar a configuração de rede do Amazon Bedrock

Se você usa o AWS Lambda com uma nuvem privada virtual (VPC) e experimenta interações lentas de rede com o Amazon Bedrock, o tráfego pode ser direcionado pela Internet pública. Para resolver esse problema, use o AWS PrivateLink para configurar o acesso privado ao Amazon Bedrock.

Ativar o CRIS

Em caso de latência durante períodos de alta demanda regional, você poderá atingir um gargalo regional. Para resolver esse problema, aumente o throughput com a inferência entre regiões (CRIS) para distribuir workloads de inferência em várias regiões.

Otimizar o desempenho do agente

Ative as respostas de streaming

Se suas saídas tiverem um alto número de tokens, os usuários deverão aguardar a resposta completa. Para verificar se você tem um alto número de tokens, use a métrica OutputTokenCount no CloudWatch. Para ativar respostas de streaming, use a API InvokeModelWithResponseStream para que o conteúdo chegue à medida que é gerado.

Configure sua base de conhecimento

Se você não limitar o número de blocos de documentos retornados, o tempo de geração de resposta aumentará. Para resolver esse problema, use o parâmetro numberOfResults para limitar o número de blocos de documentos recuperados da sua base de conhecimento.

Informações relacionadas

Monitorar a invocação do modelo usando o CloudWatch Logs e o Amazon S3