Ir para o conteúdo
Tigy AI
Tigy AIAgentes de vozCrie conversas por telefone e webIntegraçõesLigue o agente aos seus sistemasConfiança e confiabilidadeTeste, acompanhe e refine
Explore a plataformaAgentes de suporteAtenda e encaminhe solicitaçõesQualificação de leadsEntenda o interesse de cada contatoComo funcionaDa criação à operaçãoPreçosEncontre o plano para começarDocumentaçãoAprenda a configurar seu agente
Áreas de atuação
TelecomunicaçõesServiços financeirosSaúdeTecnologiaVarejo e e-commerceMídia e entretenimentoTurismo e hospitalidade
Casos de uso
Atendimento ao clienteQualificação de leadsRecepcionista com IA
Perfis de negócio
EmpresasStartups
DocumentaçãoBlogPreços
Produtos
Agentes de vozIntegraçõesConfiança e confiabilidade
Soluções
TelecomunicaçõesServiços financeirosSaúdeTecnologiaVarejo e e-commerceMídia e entretenimentoTurismo e hospitalidadeAtendimento ao clienteQualificação de leadsRecepcionista com IAEmpresasStartups
PreçosDocumentaçãoBlog
ENTRAR
Blog/Aprendizados

Matriz de avaliação de agentes de voz: cenários e critérios

Organize cenários, evidências e critérios de aprovação para comparar mudanças no agente.

Autoria
Equipe Tigy AI
Publicado
24 de mai. de 2026
Atualizado
4 de out. de 2026
Explore os agentes de vozCrie um agente
Véus suaves de luz nas bordas sobre um fundo abstrato texturizado.
Matriz de avaliação

Neste artigo

  • Escreva cenários com uma condição clara
  • Defina o que comprova a aprovação
  • Guarde a evidência da revisão
  • Compare mudanças sem esconder exceções
  • Registre sua evidência
  • Defina a gravidade antes da execução
  • Use a matriz como parte da manutenção
  • Calibre avaliadores antes de interpretar diferenças pequenas
  • Transforme situações reais em casos avaliáveis
  • Separe pontuação, bloqueios e oportunidades de melhoria
  • Compare versões com condições que você consegue explicar
Neste artigo
  • Escreva cenários com uma condição clara
  • Defina o que comprova a aprovação
  • Guarde a evidência da revisão
  • Compare mudanças sem esconder exceções
  • Registre sua evidência
  • Defina a gravidade antes da execução
  • Use a matriz como parte da manutenção
  • Calibre avaliadores antes de interpretar diferenças pequenas
  • Transforme situações reais em casos avaliáveis
  • Separe pontuação, bloqueios e oportunidades de melhoria
  • Compare versões com condições que você consegue explicar

Uma matriz de avaliação de agentes de voz registra cenários, contexto, resultado esperado e evidência observada. Use critérios separados para conteúdo, ação e experiência, e mantenha falhas críticas visíveis na comparação. No Tigy AI, testes e registros de execução apoiam essa revisão; a planilha é um processo da equipe, não uma promessa de avaliação automática.

Para levar com vocêAvalie a mesma tarefa nas mesmas condições e mantenha falhas importantes visíveis, mesmo quando a média melhora.

Escreva cenários com uma condição clara

Uma matriz de avaliação de agentes de voz organiza cenário, contexto, ação permitida, resultado esperado e evidência observada. Crie linhas distintas para consultas válidas, dados ausentes, correções, indisponibilidade e encaminhamento. Esses casos avaliam decisões diferentes; apenas variar a frase da pergunta não cobre todas as condições da tarefa.

Inclua situações que exigem encaminhamento. Recusar uma ação fora do escopo pode ser o comportamento correto, mesmo quando a conversa não termina em uma ação automática.

Defina o que comprova a aprovação

Para uma consulta, confira o parâmetro e a informação retornada. Para criação de registro, verifique o destino. Para uma dúvida documental, compare a resposta com a fonte aprovada.

Registre clareza e ritmo separadamente do resultado. Uma voz agradável não compensa uma ação feita com o identificador errado.

Guarde a evidência da revisão

Anote versão do agente, canal, data e identificador da execução. Use transcrição, gravação e ações quando disponíveis. Uma ausência de registro deve ser investigada conforme o estado e o canal da conversa.

Marque cada cenário como aprovado, reprovado ou inconclusivo e escreva o motivo. Inconclusivo significa que falta evidência, não que o agente acertou.

Compare mudanças sem esconder exceções

Repita os cenários após uma alteração de prompt, documento ou ferramenta. Confira se a correção resolveu o caso original e se os outros continuam funcionando.

Essa matriz é um processo de revisão da equipe, não uma promessa de avaliação automática do Tigy. Defina os critérios conforme sua tarefa e use os resultados para decidir o próximo ajuste.

Registre sua evidência

Use a matriz de cenários para registrar o observado e a referência de execução. Compare o resultado da conversa com a ação no sistema externo. O arquivo contém critérios sintéticos e campos destinados ao preenchimento, sem resultados pré-calculados.

Material para usar com sua equipe

  • Matriz de testesCSV · Português

Defina a gravidade antes da execução

Use critérios que expliquem a decisão: aprovado, ajuste necessário e bloqueio. Um detalhe de estilo pode pedir ajuste; consultar o registro errado ou confirmar uma alteração não realizada deve bloquear a publicação até investigação. A média não deve esconder uma falha crítica.

Para evitar revisão inconsistente, descreva exemplos de cada classificação. Duas pessoas podem avaliar uma amostra e discutir divergências antes de revisar o restante. Se não concordam sobre o resultado esperado, refine a regra; o problema talvez esteja no processo definido, não no modelo.

Ao corrigir uma falha, repita também os casos próximos. Uma mudança para confirmar números pode afetar perguntas sem números. Uma regra mais rígida de escopo pode recusar pedidos válidos. A matriz serve como memória dessas relações e ajuda a decidir quais cenários repetir.

Use a matriz como parte da manutenção

Inclua uma nova linha quando um erro real revelar uma condição ausente. Retire dados pessoais e preserve a estrutura da situação: correção de data, duas unidades parecidas, resposta vazia ou pergunta ambígua. Isso permite reproduzir o problema sem depender do cliente original.

Mantenha separadas as verificações de texto, voz e canal telefônico. Texto verifica decisões e ferramentas, voz acrescenta reconhecimento e turnos, telefonia acrescenta roteamento e condições do provedor. A aprovação de uma coluna não comprova as outras.

Antes de ampliar o piloto, confira quais cenários passaram, quais continuam pendentes e quem assumiu as exceções. Não descreva essa planilha como avaliação automatizada nativa: é um método de equipe que pode usar os registros do Tigy como evidência.

Calibre avaliadores antes de interpretar diferenças pequenas

Antes de pontuar uma versão inteira, peça que duas pessoas avaliem as mesmas três conversas sem consultar a nota uma da outra. Compare as justificativas, sobretudo nos critérios que geraram discordância. Talvez uma pessoa esteja avaliando simpatia enquanto outra observa se houve uma ação confirmada. Ajuste a definição do critério e repita o exercício. Quando a escala fica mais consistente, diferenças pequenas entre versões passam a ser mais interpretáveis. Preserve as justificativas como exemplos de referência para quem entrar depois na revisão.

Transforme situações reais em casos avaliáveis

Uma matriz útil começa pela variedade de situações, e não pela lista de qualidades desejadas. Para um agente de recepção, “responder corretamente” pode significar informar o horário de uma unidade, reconhecer que a pergunta trata de outra unidade ou explicar que o calendário de feriados ainda não foi confirmado. Essas situações exigem comportamentos diferentes. Se todas entrarem na mesma linha chamada perguntas frequentes, a avaliação esconderá precisamente as exceções que precisam de atenção.

Escolha uma tarefa e escreva um caso completo: contexto disponível, fala inicial, informações que o agente pode consultar e resultado esperado. Um exemplo fictício é uma pessoa perguntando se pode retirar um documento na sexta-feira. A fonte informa o horário comum, mas não menciona o feriado daquela data. A resposta esperada deve separar o horário habitual da confirmação especial, explicar a limitação e indicar o canal responsável. Não basta exigir uma resposta curta, porque uma resposta curta que inventa a abertura também parece eficiente.

Crie variações da mesma intenção. A pessoa pode dizer “sexta vocês funcionam?”, começar com uma referência ao atendimento anterior ou corrigir a unidade depois da primeira resposta. Essas variações avaliam entendimento e atualização do contexto sem mudar o objetivo de negócio. Acrescente um caso em que a pessoa não sabe a unidade, outro em que interrompe a explicação e um terceiro em que pede uma informação fora do escopo. O conjunto deve permitir distinguir compreensão, consulta e respeito aos limites.

Registre critérios que um segundo avaliador consiga aplicar. “Foi simpático” é amplo; “reconheceu a correção sem responsabilizar a pessoa e respondeu sobre a unidade correta” é observável. Para ações externas, a matriz precisa conter uma evidência independente, como o registro de teste criado no sistema autorizado. A fala do agente é uma evidência de comunicação, mas não comprova sozinha que a tarefa terminou. Essa separação evita premiar uma promessa convincente como se fosse uma execução real.

Separe pontuação, bloqueios e oportunidades de melhoria

Uma nota média pode ajudar a acompanhar evolução, mas não deve apagar falhas que impedem publicação. Imagine vinte casos com respostas claras e uma consulta que revela dados de outra pessoa. A média de clareza pode continuar alta, enquanto o problema de acesso permanece inaceitável. Por isso, mantenha critérios eliminatórios separados das dimensões graduais. A matriz pode avaliar clareza, quantidade de repetições e qualidade do encerramento, ao mesmo tempo que bloqueia uma versão por divulgação indevida ou confirmação falsa de uma ação.

Use uma escala pequena com descrições. Em clareza, zero pode significar que a pessoa não recebe um próximo passo compreensível; um, que recebe a orientação depois de uma explicação confusa; dois, que entende o próximo passo com precisão. A escala não precisa produzir uma aparência científica. Precisa reduzir divergências entre avaliadores. Acrescente um exemplo de cada nível e revise os exemplos quando surgirem situações novas. Se a escala muda, preserve a data da mudança para não comparar números que representam regras diferentes.

Defina também quem observa cada dimensão. Alguém da operação reconhece se a orientação é executável; alguém responsável pela integração verifica o efeito externo; uma pessoa que conhece o público avalia vocabulário e dificuldade de compreensão. Uma mesma conversa pode receber avaliações distintas porque cada participante inspeciona uma parte. A revisão conjunta deve resolver conflitos com evidências: transcrição, retorno da ferramenta, registro externo e política vigente. Uma discordância não se resolve simplesmente pela posição hierárquica do avaliador.

Agrupe os resultados por intenção e por gravidade. Se todas as falhas aparecem em consultas com identificadores ditados, a prioridade pode ser confirmar os dados de entrada. Se o problema ocorre em perguntas ausentes da base, a prioridade pode ser o tratamento de incerteza. A média geral esconde essas diferenças. Registre ainda casos não avaliáveis: uma falha do ambiente de teste não deve virar aprovação nem reprovação da conversa sem investigação. A classificação correta mantém a matriz útil para decisões, em vez de transformar todo acontecimento em um número.

Compare versões com condições que você consegue explicar

Uma comparação justa começa com um conjunto fixo de casos e uma ficha de configuração. Registre a versão das instruções, as fontes disponíveis, as ferramentas anexadas e as condições relevantes da chamada. Se uma versão consulta um documento atualizado e outra consulta o documento antigo, o resultado não mede apenas a mudança no prompt. A matriz deve revelar esse contraste, e não atribuí-lo automaticamente à qualidade do modelo ou à redação.

Execute o mesmo caso mais de uma vez quando o comportamento variar. Não escolha apenas a melhor conversa para apresentar a versão nova. Preserve tentativas que deram errado e anote a causa provável sem tratá-la como certeza. Em voz, mantenha exemplos com pausas, correções e pronúncias semelhantes às do público. Comparar uma fala lenta no teste antigo com uma fala acelerada no teste novo mistura a dificuldade de entrada com a mudança que você quer avaliar.

Confira se o ajuste não prejudicou outra tarefa que já funcionava. Uma instrução para encerrar mais rápido pode interromper um pedido com dois assuntos. Pedir confirmação pode evitar cadastro errado, mas também repetir perguntas desnecessárias. Mostre ganhos e perdas juntos. A equipe pode aceitar uma chamada um pouco mais longa para evitar um erro importante; registre o motivo dessa escolha.

Antes de publicar, escreva uma conclusão curta: o que melhorou, o que continua instável e quais erros ainda impedem o uso. Diga também qual grupo usará a nova versão primeiro. No Tigy, registre as instruções e a versão testadas. A matriz é uma planilha mantida pela equipe; a plataforma não atribui automaticamente todos esses critérios. Use exemplos fictícios para repetir a avaliação sem expor clientes.

Na documentação do Tigy

  • Testar o agente
  • Execuções de agentes e uso

Uma boa conversa muda o próximo passo.

Crie um agente

Continue a conversa

Manchas suaves de cor sobre fundo escuro.

Como comparar versões de um agente de voz com testes manuais

Luz difusa e sombras suaves em composição abstrata.
Telefonia SIP

Telefonia SIP no Tigy: roteamento de chamadas para agentes de voz

Campos de cor com movimento orgânico.
WER e precisão dos dados

WER em agentes de voz: transcrição versus acerto dos dados

Faixas de luz e sombra com textura granulada.
Piloto de agentes de voz

Como implantar um piloto de agentes de voz com IA na empresa

Contornos suaves sobre campos de luz e sombra.
Checklist de testes de voz

Checklist de testes para agentes de voz antes da publicação

Faixas orgânicas de luz com textura suave.

Relatório de uso e ciclo de créditos no Tigy: como comparar

Luz difusa e sombras suaves em composição abstrata.
Texto e voz

Como testar um agente de voz por texto e áudio

Formas orgânicas entre luz e sombras profundas.
Custo por tarefa concluída

Quanto custa um agente de voz? Calcule o custo por tarefa

Tigy AI

PLATAFORMA

  • Agentes de voz
  • Integrações
  • Confiança e confiabilidade
  • Demonstrações
  • Como funciona
  • Preços

Soluções

  • Telecomunicações
  • Serviços financeiros
  • Saúde
  • Tecnologia
  • Varejo e e-commerce
  • Mídia e entretenimento
  • Turismo e hospitalidade

Casos de uso

  • Atendimento ao cliente
  • Qualificação de leads
  • Recepcionista com IA

Perfis de negócio

  • Empresas
  • Startups

Legal

  • Central legal
  • Termos de uso
  • Privacidade
  • Cookies

Recursos

  • Blog
  • Documentação
  • Documentação para IA
  • Fale conosco

Redes sociais

  • LinkedIn
  • Instagram