Notebook aberto em uma mesa de trabalho com tela de tecnologia, referência visual para a comparação de custo e latência entre modelos de IA

Como comparar custo, latência e velocidade de modelos?

Por luizeof|

Você pode olhar para o preço de um modelo, ignorar a latência e calcular um gasto baixo para cada token. Depois, a primeira resposta demora tanto que o trabalho perde ritmo. Também pode escolher o modelo que responde primeiro e pagar mais quando a quantidade de texto cresce. A comparação entre GPT-5.6 Luna (max) e GPT-5.6 Terra (high) mostra essa troca com números publicados, não com uma promessa geral de superioridade.

Luna aparece com US$ 0,17 por 1 milhão de tokens e 165,6 tokens por segundo. Terra aparece com US$ 1,74 e 118,5 tokens por segundo. No tempo até o primeiro token, a latência muda a ordem: Terra aparece com 3,56 segundos e Luna max com 137,60 segundos. O custo por resultado precisa juntar preço, volume e tempo útil.

Direto ao ponto

Luna max parece mais atraente quando a tarefa consome muitos tokens e a velocidade de saída pesa no tempo total. Terra parece mais adequado quando você precisa começar a ler a resposta rapidamente. O preço por token abre a análise, mas a cobrança de entrada, saída e cache e o tempo até o primeiro token mostram quanto essa escolha realmente serve ao trabalho.

Latência muda o custo do trabalho

O tempo até o primeiro token mede a espera até a resposta começar. Na comparação consultada, Terra chega a 3,56 segundos, enquanto Luna max leva 137,60 segundos. A diferença muda o tempo útil de uma tarefa curta, principalmente quando você precisa ler o início para formular a próxima instrução.

Uma tarefa com várias respostas pode consumir poucos tokens por chamada e ainda perder bastante tempo na espera inicial. Outra tarefa pode gerar um documento longo, aceitar uma espera maior e se beneficiar da velocidade de Luna depois do início. O mesmo preço unitário serve a trabalhos com ritmos muito diferentes.

Por isso, eu registraria o tempo até a primeira resposta junto do custo e da quantidade de tokens. Essa medida mostra se o valor menor por token chega como economia real ou apenas troca dinheiro por espera. A metodologia da Artificial Analysis separa esses componentes ao descrever cobrança e custo por tarefa.

O preço por token só abre a medição

Luna max custa US$ 0,17 por 1 milhão de tokens na página consultada. Terra custa US$ 1,74 pela mesma unidade. A diferença é relevante para uma integração que gera muitas respostas, mas o preço unitário não informa quantos tokens cada tarefa vai consumir nem quanto tempo você vai esperar pela resposta inicial.

Uma aplicação pode enviar uma pergunta curta e receber poucas linhas. Outra pode incluir arquivos, instruções extensas e histórico antes de solicitar uma análise. A mesma tabela de preços serve aos dois casos, mas o gasto por chamada fica diferente. O volume de entrada já muda o valor antes de o modelo começar a escrever.

Eu não usaria o US$ 0,17 como promessa de economia automática. O número é um ponto de partida para comparar o fornecedor. A economia aparece quando o modelo mantém qualidade suficiente para a tarefa, consome um volume adequado e entrega num intervalo que o trabalho suporta.

Entrada, saída e cache mudam o gasto

A metodologia da Artificial Analysis informa que entrada, saída e cache participam da cobrança. A comparação combinada usa a proporção de 7:2:1 para cache hit, entrada e saída. Essa fórmula explica por que o preço mostrado no quadro não representa uma chamada isolada com qualquer formato de prompt.

Tokens de entrada incluem o que você envia ao modelo e podem crescer com arquivos, histórico e instruções repetidas. Tokens de saída correspondem ao texto gerado, incluindo uma explicação curta ou um documento extenso. O cache reduz o custo de parte do material reaproveitado, quando a integração e o serviço mantêm essa condição.

O histórico extenso entra na medição do gasto, porque cada chamada recebe mais material. Um agente que gera respostas longas pode consumir mais tokens de saída. Uma aplicação que repete instruções pode ter parte do conteúdo aproveitada no cache. A leitura precisa acompanhar essas superfícies, não somente o preço que aparece no catálogo.

Velocidade de saída aparece depois da largada

Luna max aparece com 165,6 tokens por segundo e Terra com 118,5 tokens por segundo. Essa medida mostra a velocidade durante a geração. Ela não substitui o tempo até o primeiro token, porque a resposta pode começar tarde e depois ser produzida num ritmo maior.

Para uma resposta longa, a velocidade de Luna pode reduzir o intervalo entre o primeiro trecho e o final do documento. Em perguntas curtas, a espera até o primeiro token ocupa uma parte maior da experiência. Terra entrega o início em 3,56 segundos na comparação, e isso pode ser mais importante que a velocidade posterior.

Quando você acompanha o tempo total, separe pelo menos esses dois momentos. O primeiro mostra quando a resposta se torna utilizável para orientar a próxima ação. O segundo mostra quanto tempo a geração leva depois do início. Misturar os dois produz uma leitura imprecisa do trabalho.

O custo por tarefa depende do volume

A metodologia informa que o custo por tarefa considera a quantidade de tokens consumida pelos modelos no conjunto de avaliações. Essa métrica é diferente do preço por token. Um modelo pode ter um preço unitário mais baixo e produzir uma resposta que consome mais tokens. Outro pode custar mais por unidade e resolver a mesma solicitação com menos texto.

O tamanho da resposta não é o único ponto. A tarefa pode exigir reasoning, leitura de imagem, comparação de arquivos ou uma explicação detalhada. O modelo precisa receber o material, processar a solicitação e gerar a saída. O uso real revela a relação entre esses volumes.

O índice publicado pela Artificial Analysis reúne nove avaliações e mostra Luna com 52 e Terra com 50. Eu trataria essa pontuação como consulta ao conjunto avaliado. Para escolher um modelo para o seu projeto, compare o prompt e os arquivos enviados, o tempo de espera até a resposta e a qualidade do que você consegue aproveitar dentro do custo total.

Uma medição que cabe no trabalho

Você não precisa começar com uma planilha complexa. Separe uma tarefa que representa o uso real e registre o horário do envio, o momento do primeiro token, o momento do último token, os tokens de entrada e os tokens de saída. Repita o mesmo prompt nos dois modelos e preserve o arquivo usado na comparação.

Depois, compare a resposta com o trabalho que ela deveria atender. Ela precisa trazer a informação usada na próxima ação, evitar uma nova instrução e produzir um arquivo que passe pela sua conferência. O preço menor só importa quando a saída atende ao trabalho sem criar novas correções que consomem tempo.

Uma medição curta representa chat e suporte. Uma resposta longa ou uma tarefa técnica com arquivos exige uma medição que acompanhe o trabalho inteiro. A comparação fica mais útil quando cada teste representa o fluxo que você realmente pretende manter.

O modelo participa de um sistema maior

A escolha de Luna max ou Terra não fica isolada no campo do fornecedor. Ela entra numa aplicação que vai do prompt ao histórico, passa por cache e armazenamento e ainda cruza fila e revisão. O artigo sobre memória, skills e ferramentas no Hermes Agent mostra como o modelo participa de uma operação maior. A resposta precisa chegar ao lugar certo e preservar informações que o próximo trabalho vai usar.

Num agente de atendimento, o volume de mensagens e o tamanho do histórico alteram o gasto. O artigo sobre custo previsível em agentes de WhatsApp trata essa relação como parte da operação. O modelo escolhido precisa caber no fluxo de mensagens, no tempo aceito e na forma de acompanhar o consumo.

Esse raciocínio também serve para uma rotina de Vibe Coding. O prompt, os arquivos do projeto e a revisão da resposta formam o trabalho inteiro. O modelo participa da geração, mas a utilidade aparece quando você consegue conferir e aplicar o resultado.

Eu começaria medindo uma tarefa curta, observando o tempo até a resposta inicial, e uma tarefa longa. Na longa, compararia volume, tempo total e velocidade de saída. Num documento extenso, o preço menor e a geração rápida de Luna entram diretamente na medição. Num chat com perguntas sucessivas, o início rápido de Terra ocupa o primeiro lugar. Esses números mostram qual modelo serve ao trabalho.

Se a sua rotina envolve desenvolvimento, agentes e SaaS, o Plano IA Makers reúne esse tipo de trabalho em uma trilha própria. Antes de trocar o modelo da integração, confirme os preços na fonte e compare a tarefa que você realmente executa. A fotografia consultada em 15 de agosto de 2026 serve para esta análise, não para prometer o mesmo valor no futuro.

Compare os Planos

Escolha o plano adequado ao seu objetivo e consulte tudo o que está incluído.

O Plano Martech cobre automação e atendimento. O Plano IA Makers acrescenta desenvolvimento com IA, enquanto o Plano Founders trata de gestão de negócios. Todos são anuais.

Plano Martech

Para conectar automação, marketing e atendimento com infraestrutura própria.

R$ 897

R$ 597/ano

  • Grade de automação, atendimento, marketing e análise de indicadores
  • Instalador Exclusivo Promovaweb
  • n8n, Evolution API, Chatwoot e Mautic
  • Trilha DevOps incluída
  • Encontros ao vivo (terça e quinta)
  • Comunidade e acompanhamento
Conhecer o plano

Plano Founders

Plano anual para fazer um projeto de tecnologia avançar, com 90 dias de mentoria intensiva. R$ 1.997 à vista ou até 10x de R$ 219 no cartão.

R$ 1.997/ano

  • 12 meses de acesso ao Founders
  • 90 dias de mentoria intensiva (segunda a sexta)
  • War Rooms às segundas, quartas e sextas
  • Encontro semanal em grupo após a fase intensiva
  • Formação Vibe Coding incluída no plano anual
  • Consultoria individual de até duas horas (bônus)
Conhecer o plano