Definição
Avaliação de IA, também chamada de eval, é um procedimento que mede ou examina as saídas de um modelo por meio de regras e casos definidos. O propósito é transformar uma impressão subjetiva sobre a qualidade das respostas em uma comparação repetível.
Partes de um eval
Um eval declara a tarefa, o conjunto de casos com resultados esperados e as regras que examinam cada resposta. A comparação separa o acerto factual, a aderência ao formato pedido e o comportamento diante de casos difíceis.
[
{
"entrada": "lead trabalha em startup com 12 funcionários",
"esperado": "qualificar para o plano básico"
},
{
"entrada": "lead informa empresa com 200 funcionários",
"esperado": "qualificar para o plano de empresas"
}
]Demonstração não substitui avaliação
Uma demonstração que funciona em um exemplo favorável não representa o comportamento geral. O resultado depende dos casos escolhidos e da cobertura dos cenários que a aplicação enfrenta. Avaliar com um conjunto representativo é mais confiável do que confiar em uma amostra única.
Ler o resultado do eval
No exemplo dos leads, cada caso compara a entrada com o resultado esperado. A falha provável aparece quando uma entrada cai perto da divisão entre duas faixas, como uma empresa no limite do plano, e o modelo escolhe a faixa errada. O resultado do eval mostra onde a resposta divergiu do esperado, e é essa lista de divergências que orienta o ajuste do prompt ou das regras. A verificação também confere a cobertura: se os casos só passam em entradas favoráveis, o eval não representa o uso real.
Veja como o modelo de IA se encaixa nesse fluxoDúvidas frequentes
Perguntas frequentes sobre Avaliação de IA (eval)
- O que um eval avalia?
- Ele compara saídas do modelo com regras e resultados esperados, cobrindo acerto factual, aderência ao formato e comportamento em casos difíceis.
- Uma boa demonstração substitui um eval?
- Não. Uma demonstração mostra um caso favorável. O eval usa um conjunto representativo para aproximar o comportamento real da aplicação.
- Como os casos de um eval são escolhidos?
- Os casos refletem os cenários que a aplicação enfrenta, incluindo entradas comuns, variações e situações nas quais a resposta tende a falhar.
Para continuar
Recursos relacionados
Repositório
OpenAI: Evals
Biblioteca de avaliação de modelos com casos prontos para adaptar.
Abrir recursoArtigo
Anthropic: Building effective evals
Orienta a construção de avaliações que refletem o uso real do modelo.
Abrir recursoDocumentação
Google Cloud: Evaluation for generative AI
Documenta tipos de avaliação e métricas para modelos generativos.
Abrir recursoAplicação na formação
Vibe Coding: Do Zero ao MVP
Na Formação Vibe Coding, o eval mostra se as respostas do modelo atendem à tarefa antes de a funcionalidade chegar ao usuário.
Conhecer a formaçãoFontes consultadas
Referências deste verbete
Este verbete ajudou você?
Obrigado pela resposta. Ela fica salva apenas neste navegador.