
Um dos Agents responde com um comando antigo. A tela mostra uma frase plausível, enquanto a correção pode estar em três lugares distintos: na chamada enviada ao modelo, nos trechos recuperados da documentação ou no histórico preservado para aquela sessão.
AI Gateway registra a chamada feita ao modelo, Vectorize devolve os trechos próximos da pergunta e Agents conserva o estado necessário à próxima interação. Essas saídas permitem voltar da resposta ao documento e à sessão. Adote o conjunto completo somente se o produto usar os três resultados.
Direto ao ponto
O gateway mostra a chamada sem julgar a resposta. A busca vetorial encontra trechos sem conhecer sozinha a permissão do cliente, e o runtime mantém apenas o estado definido pela aplicação. Por isso, fonte, autorização, avaliação e passagem para o atendente continuam no produto que combina os serviços.
Minha recomendação é partir de uma pergunta conhecida e guardar informações suficientes para reconstruir o percurso. Você deve conseguir abrir a chamada, localizar os trechos recuperados e identificar o estado usado pela sessão. Se uma dessas partes não participa do produto, retire-a da composição.
Reconstrua a resposta que saiu errada
Comece pelo identificador exibido junto da execução. Ele deve acompanhar a pergunta desde o backend, passar pela busca e aparecer no registro da chamada ao modelo. Sem esse vínculo, o suporte vê telas separadas e tenta adivinhar se a falha começou na recuperação ou na geração.
Abra primeiro o conteúdo enviado ao modelo. Confira instruções, provedor, modelo e quantidade de tokens. O AI Gateway centraliza chamadas de modelos da Cloudflare e de provedores externos, além de oferecer logs, cache, limites e tentativas adicionais.
Esses registros mostram o que trafegou pelo gateway. Eles não informam se a versão do manual era a correta nem se o cliente tinha permissão para acessá-la. Uma resposta barata e rápida ainda pode usar uma fonte inadequada.
Volte do trecho recuperado ao documento original
O Vectorize guarda embeddings e retorna itens próximos ao vetor consultado. Em RAG (Retrieval-Augmented Generation), o índice costuma preservar um identificador que leva ao documento ou ao trecho de origem. Esse vínculo permite abrir o material usado pela resposta.
Ao encontrar o comando antigo, abra o documento indicado pelo resultado e confira a data da versão indexada. Se a restrição ficou num fragmento e o exemplo em outro, refaça a divisão. Repita a pergunta com duas sessões para descobrir se um filtro ausente misturou documentos de clientes diferentes.
Faça a consulta com duas sessões que possuam permissões diferentes. Os resultados precisam respeitar o acesso antes de chegar ao modelo. Depois altere um documento, reconstrua o vetor e confirme que a busca retorna a versão nova. O teste cobre autorização e atualização, dois problemas que uma demonstração com pergunta única costuma esconder.
A base original deve continuar disponível fora do índice. Se o Vectorize for substituído, você precisará gerar embeddings novamente a partir desses documentos e reconstruir metadados, filtros e relação com cada cliente. Exportar apenas os vetores não preserva necessariamente o material necessário para explicar uma resposta.
Limite o estado mantido pelos Agents
O Agents SDK usa Durable Objects para oferecer estado, sessões, WebSockets e agendamento. O estado guarda o identificador de uma sessão ou acompanha uma tarefa longa conforme a configuração escolhida. Não armazene toda mensagem de forma permanente só porque existe espaço para isso.
Defina qual informação a próxima interação recupera, por quanto tempo e com qual chave de separação. Ao abrir duas sessões, a pergunta do primeiro cliente não pode aparecer na segunda. Ao revogar acesso a um documento, uma tarefa agendada depois da revogação deve respeitar a permissão atual.
Defina uma forma de remoção do histórico compatível com a política da aplicação. Se o agente transforma uma troca de mensagens em resumo, registre a origem e a data usadas. Um resumo antigo pode continuar influenciando respostas mesmo depois que as mensagens foram retiradas da interface.
Trate cache e tentativas como comportamento do produto
O cache do gateway pode reduzir chamadas repetidas, mas uma resposta ligada a permissão ou conteúdo recente não deve reaparecer para a sessão errada. A chave usada no cache precisa distinguir os elementos que alteram a resposta. Uma pergunta igual não representa necessariamente a mesma consulta quando cliente, versão do documento ou acesso mudam.
Defina quando o gateway fará uma nova tentativa. Se o modelo não respondeu, repetir a chamada pode ser adequado. Se a primeira execução produziu uma ação externa e a resposta se perdeu, uma repetição pode criar outro efeito. Separe geração de texto de ações com cobrança, envio ou alteração de cadastro.
O AI Gateway registra latência, custo e falhas. A aplicação interpreta esses números. Compare o registro do gateway com o evento externo para saber se a ação ocorreu antes de executar novamente.
Use cada serviço somente onde ele esclarece a aplicação
Uma busca interna sem histórico duradouro usa Vectorize e um gateway sem Agents. Um chatbot sem base documental pode manter estado e logs sem índice vetorial. Uma chamada isolada ao modelo passa apenas pelo gateway quando não existe recuperação nem sessão.
Ao retirar um serviço desnecessário, você reduz os lugares consultados durante uma falha. Para uma futura troca, preserve os documentos que reconstruirão o índice, o formato escolhido para o histórico e a interface usada nas chamadas ao modelo.
O artigo da Promovaweb sobre serviços da Cloudflare sem prender a stack detalha essa forma de testar substituições. O percurso entre Pages, Workers, R2 e Hyperdrive mostra como identificar uma chamada entre serviços. Para projetos criados com IA, infraestrutura para Vibe Coding explica por que banco, arquivos e filas precisam sair do computador usado no protótipo.
No Vibe Coding, cada integração criada com IA continua sujeita a especificação, revisão e teste. O Plano IA Makers da Promovaweb desenvolve essa prática. Quando busca, histórico e chamadas ao modelo já se misturam numa aplicação existente, o Diagnóstico de Produto e Arquitetura da Dev Side Studio organiza a jornada e documenta a função de cada integração.
Volte à resposta errada com uma pergunta conhecida. Abra o trecho recuperado, a chamada correspondente e o estado daquela sessão. A reconstrução do percurso e a repetição com outro cliente mostram se os serviços explicam o sistema ou apenas ampliam o painel.






