Matriz de avaliação de agentes de voz: cenários e critérios
Organize cenários, evidências e critérios de aprovação para comparar mudanças no agente.
- Autoria
- Equipe Tigy AI
- Publicado
- Atualizado
Uma matriz de avaliação de agentes de voz registra cenários, contexto, resultado esperado e evidência observada. Use critérios separados para conteúdo, ação e experiência, e mantenha falhas críticas visíveis na comparação. No Tigy AI, testes e registros de execução apoiam essa revisão; a planilha é um processo da equipe, não uma promessa de avaliação automática.
Escreva cenários com uma condição clara
Uma matriz de avaliação de agentes de voz organiza cenário, contexto, ação permitida, resultado esperado e evidência observada. Crie linhas distintas para consultas válidas, dados ausentes, correções, indisponibilidade e encaminhamento. Esses casos avaliam decisões diferentes; apenas variar a frase da pergunta não cobre todas as condições da tarefa.
Inclua situações que exigem encaminhamento. Recusar uma ação fora do escopo pode ser o comportamento correto, mesmo quando a conversa não termina em uma ação automática.
Defina o que comprova a aprovação
Para uma consulta, confira o parâmetro e a informação retornada. Para criação de registro, verifique o destino. Para uma dúvida documental, compare a resposta com a fonte aprovada.
Registre clareza e ritmo separadamente do resultado. Uma voz agradável não compensa uma ação feita com o identificador errado.
Guarde a evidência da revisão
Anote versão do agente, canal, data e identificador da execução. Use transcrição, gravação e ações quando disponíveis. Uma ausência de registro deve ser investigada conforme o estado e o canal da conversa.
Marque cada cenário como aprovado, reprovado ou inconclusivo e escreva o motivo. Inconclusivo significa que falta evidência, não que o agente acertou.
Compare mudanças sem esconder exceções
Repita os cenários após uma alteração de prompt, documento ou ferramenta. Confira se a correção resolveu o caso original e se os outros continuam funcionando.
Essa matriz é um processo de revisão da equipe, não uma promessa de avaliação automática do Tigy. Defina os critérios conforme sua tarefa e use os resultados para decidir o próximo ajuste.
Registre sua evidência
Use a matriz de cenários para registrar o observado e a referência de execução. Compare o resultado da conversa com a ação no sistema externo. O arquivo contém critérios sintéticos e campos destinados ao preenchimento, sem resultados pré-calculados.
Material para usar com sua equipe
Defina a gravidade antes da execução
Use critérios que expliquem a decisão: aprovado, ajuste necessário e bloqueio. Um detalhe de estilo pode pedir ajuste; consultar o registro errado ou confirmar uma alteração não realizada deve bloquear a publicação até investigação. A média não deve esconder uma falha crítica.
Para evitar revisão inconsistente, descreva exemplos de cada classificação. Duas pessoas podem avaliar uma amostra e discutir divergências antes de revisar o restante. Se não concordam sobre o resultado esperado, refine a regra; o problema talvez esteja no processo definido, não no modelo.
Ao corrigir uma falha, repita também os casos próximos. Uma mudança para confirmar números pode afetar perguntas sem números. Uma regra mais rígida de escopo pode recusar pedidos válidos. A matriz serve como memória dessas relações e ajuda a decidir quais cenários repetir.
Use a matriz como parte da manutenção
Inclua uma nova linha quando um erro real revelar uma condição ausente. Retire dados pessoais e preserve a estrutura da situação: correção de data, duas unidades parecidas, resposta vazia ou pergunta ambígua. Isso permite reproduzir o problema sem depender do cliente original.
Mantenha separadas as verificações de texto, voz e canal telefônico. Texto verifica decisões e ferramentas, voz acrescenta reconhecimento e turnos, telefonia acrescenta roteamento e condições do provedor. A aprovação de uma coluna não comprova as outras.
Antes de ampliar o piloto, confira quais cenários passaram, quais continuam pendentes e quem assumiu as exceções. Não descreva essa planilha como avaliação automatizada nativa: é um método de equipe que pode usar os registros do Tigy como evidência.
Calibre avaliadores antes de interpretar diferenças pequenas
Antes de pontuar uma versão inteira, peça que duas pessoas avaliem as mesmas três conversas sem consultar a nota uma da outra. Compare as justificativas, sobretudo nos critérios que geraram discordância. Talvez uma pessoa esteja avaliando simpatia enquanto outra observa se houve uma ação confirmada. Ajuste a definição do critério e repita o exercício. Quando a escala fica mais consistente, diferenças pequenas entre versões passam a ser mais interpretáveis. Preserve as justificativas como exemplos de referência para quem entrar depois na revisão.
Transforme situações reais em casos avaliáveis
Uma matriz útil começa pela variedade de situações, e não pela lista de qualidades desejadas. Para um agente de recepção, “responder corretamente” pode significar informar o horário de uma unidade, reconhecer que a pergunta trata de outra unidade ou explicar que o calendário de feriados ainda não foi confirmado. Essas situações exigem comportamentos diferentes. Se todas entrarem na mesma linha chamada perguntas frequentes, a avaliação esconderá precisamente as exceções que precisam de atenção.
Escolha uma tarefa e escreva um caso completo: contexto disponível, fala inicial, informações que o agente pode consultar e resultado esperado. Um exemplo fictício é uma pessoa perguntando se pode retirar um documento na sexta-feira. A fonte informa o horário comum, mas não menciona o feriado daquela data. A resposta esperada deve separar o horário habitual da confirmação especial, explicar a limitação e indicar o canal responsável. Não basta exigir uma resposta curta, porque uma resposta curta que inventa a abertura também parece eficiente.
Crie variações da mesma intenção. A pessoa pode dizer “sexta vocês funcionam?”, começar com uma referência ao atendimento anterior ou corrigir a unidade depois da primeira resposta. Essas variações avaliam entendimento e atualização do contexto sem mudar o objetivo de negócio. Acrescente um caso em que a pessoa não sabe a unidade, outro em que interrompe a explicação e um terceiro em que pede uma informação fora do escopo. O conjunto deve permitir distinguir compreensão, consulta e respeito aos limites.
Registre critérios que um segundo avaliador consiga aplicar. “Foi simpático” é amplo; “reconheceu a correção sem responsabilizar a pessoa e respondeu sobre a unidade correta” é observável. Para ações externas, a matriz precisa conter uma evidência independente, como o registro de teste criado no sistema autorizado. A fala do agente é uma evidência de comunicação, mas não comprova sozinha que a tarefa terminou. Essa separação evita premiar uma promessa convincente como se fosse uma execução real.
Separe pontuação, bloqueios e oportunidades de melhoria
Uma nota média pode ajudar a acompanhar evolução, mas não deve apagar falhas que impedem publicação. Imagine vinte casos com respostas claras e uma consulta que revela dados de outra pessoa. A média de clareza pode continuar alta, enquanto o problema de acesso permanece inaceitável. Por isso, mantenha critérios eliminatórios separados das dimensões graduais. A matriz pode avaliar clareza, quantidade de repetições e qualidade do encerramento, ao mesmo tempo que bloqueia uma versão por divulgação indevida ou confirmação falsa de uma ação.
Use uma escala pequena com descrições. Em clareza, zero pode significar que a pessoa não recebe um próximo passo compreensível; um, que recebe a orientação depois de uma explicação confusa; dois, que entende o próximo passo com precisão. A escala não precisa produzir uma aparência científica. Precisa reduzir divergências entre avaliadores. Acrescente um exemplo de cada nível e revise os exemplos quando surgirem situações novas. Se a escala muda, preserve a data da mudança para não comparar números que representam regras diferentes.
Defina também quem observa cada dimensão. Alguém da operação reconhece se a orientação é executável; alguém responsável pela integração verifica o efeito externo; uma pessoa que conhece o público avalia vocabulário e dificuldade de compreensão. Uma mesma conversa pode receber avaliações distintas porque cada participante inspeciona uma parte. A revisão conjunta deve resolver conflitos com evidências: transcrição, retorno da ferramenta, registro externo e política vigente. Uma discordância não se resolve simplesmente pela posição hierárquica do avaliador.
Agrupe os resultados por intenção e por gravidade. Se todas as falhas aparecem em consultas com identificadores ditados, a prioridade pode ser confirmar os dados de entrada. Se o problema ocorre em perguntas ausentes da base, a prioridade pode ser o tratamento de incerteza. A média geral esconde essas diferenças. Registre ainda casos não avaliáveis: uma falha do ambiente de teste não deve virar aprovação nem reprovação da conversa sem investigação. A classificação correta mantém a matriz útil para decisões, em vez de transformar todo acontecimento em um número.
Compare versões com condições que você consegue explicar
Uma comparação justa começa com um conjunto fixo de casos e uma ficha de configuração. Registre a versão das instruções, as fontes disponíveis, as ferramentas anexadas e as condições relevantes da chamada. Se uma versão consulta um documento atualizado e outra consulta o documento antigo, o resultado não mede apenas a mudança no prompt. A matriz deve revelar esse contraste, e não atribuí-lo automaticamente à qualidade do modelo ou à redação.
Execute o mesmo caso mais de uma vez quando o comportamento variar. Não escolha apenas a melhor conversa para apresentar a versão nova. Preserve tentativas que deram errado e anote a causa provável sem tratá-la como certeza. Em voz, mantenha exemplos com pausas, correções e pronúncias semelhantes às do público. Comparar uma fala lenta no teste antigo com uma fala acelerada no teste novo mistura a dificuldade de entrada com a mudança que você quer avaliar.
Confira se o ajuste não prejudicou outra tarefa que já funcionava. Uma instrução para encerrar mais rápido pode interromper um pedido com dois assuntos. Pedir confirmação pode evitar cadastro errado, mas também repetir perguntas desnecessárias. Mostre ganhos e perdas juntos. A equipe pode aceitar uma chamada um pouco mais longa para evitar um erro importante; registre o motivo dessa escolha.
Antes de publicar, escreva uma conclusão curta: o que melhorou, o que continua instável e quais erros ainda impedem o uso. Diga também qual grupo usará a nova versão primeiro. No Tigy, registre as instruções e a versão testadas. A matriz é uma planilha mantida pela equipe; a plataforma não atribui automaticamente todos esses critérios. Use exemplos fictícios para repetir a avaliação sem expor clientes.
