WER em agentes de voz: transcrição versus acerto dos dados
Compare transcrição e tarefa com uma referência humana, sem confundir as duas medidas.
- Autoria
- Equipe Tigy AI
- Publicado
- Atualizado
WER significa Word Error Rate, ou taxa de erro de palavras: substituições, exclusões e inserções na transcrição divididas pelo total de palavras de uma referência revisada. Em agentes de voz, combine essa medida com o acerto de campos como código, nome e data. Um único dígito errado pode impedir a consulta mesmo com WER baixo. No Tigy AI, o procedimento deste guia é uma avaliação manual ou externa, sem pressupor um painel WER nativo.
Crie uma referência revisada
Escolha gravações de teste autorizadas ou falas sintéticas lidas por sua equipe. Duas pessoas podem revisar a transcrição de referência e resolver divergências. Defina antes como tratar pontuação, números por extenso e palavras de apoio para manter comparações consistentes.
Calcule a taxa de erro
WER é a soma de substituições, exclusões e inserções dividida pelo número de palavras da referência. Conte esses erros por alinhamento das sequências. Em uma referência com dez palavras, uma substituição e uma exclusão produzem 2/10, ou 20%, como exemplo didático; não é uma medição do Tigy.
Confira os campos da tarefa
Avalie separadamente nome, código de pedido, data e telefone quando forem necessários. Uma palavra errada no endereço pode ser mais importante que várias palavras de apoio. Registre o valor esperado, o ouvido e se a confirmação na conversa corrigiu o problema.
Teste a correção pelo prompt
Peça que o agente confirme códigos em blocos e faça uma pergunta de cada vez. Quando um nome não estiver claro, peça repetição antes da consulta. Vocabulário de transcrição e instruções de conversa servem a funções diferentes; confira as opções documentadas de sua configuração.
Use a medida como diagnóstico
Compare amostras semelhantes e registre condições de áudio. Este procedimento é uma avaliação manual, sem pressupor painel WER nativo. Analise também ação correta, repetição e abandono para evitar melhorar uma métrica de texto enquanto piora a experiência.
Repita o pedido em condições diferentes
Use o identificador sintético DEMO-71 e um nome de produto fictício. Prepare uma referência escrita e confirme o conteúdo efetivamente falado antes de avaliar a transcrição. Teste uma condição por rodada: ambiente silencioso, ruído de fundo, pausa entre dígitos e correção do número. Não simule sotaques por caricatura; use participantes voluntários falando naturalmente, com autorização para o teste.
Mantenha agente, versão, canal e frase comparáveis. Registre microfone, condição e horário. Um teste por texto revisa instruções, mas não mede reconhecimento de áudio. Repita cada condição para observar variação; uma chamada não estabelece uma taxa geral de acerto.
Compare primeiro os resultados sem mudar o dicionário de termos. Se investigar nomes específicos, altere apenas essa configuração e repita o mesmo áudio. Quando utilizado pelo serviço que transforma fala em texto, o dicionário ajuda a reconhecer palavras; ele não muda a pronúncia da voz do agente.
Material para usar com sua equipe
Separe erro de transcrição e erro da tarefa
Exemplo hipotético: a referência humana tem dez palavras; a transcrição apresenta uma substituição, uma exclusão e nenhuma inserção. WER = (1 + 1 + 0) / 10 = 20%. É uma demonstração do cálculo, não do desempenho do Tigy. Documente como números, pontuação e abreviações foram normalizados.
Mesmo com WER baixo, trocar um dígito do pedido pode impedir a tarefa. Registre o identificador confirmado, o valor enviado à ferramenta e o resultado no destino. Uma correção aceita na fala precisa chegar aos parâmetros da consulta.
| Condição | Verificação |
|---|---|
| Silêncio | Transcrição e campo corretos |
| Ruído | Dado confirmado antes de consultar |
| Pausa entre dígitos | Número completo |
| Correção DEMO-17 para DEMO-71 | Consulta usa DEMO-71 |
| Repetição após ajuste | Versão e condição registradas |
Como calcular WER e interpretar o resultado?
Alinhe a transcrição com uma referência humana revisada, usando a mesma regra para números, pontuação e abreviações. Conte substituições, exclusões e inserções. Em um exemplo didático com 20 palavras, duas substituições e uma inserção produzem WER = (2 + 0 + 1) / 20 = 15%. Isso ilustra o cálculo, não o desempenho do Tigy AI.
O denominador é o número de palavras da referência, não o da transcrição. WER pode superar 100% se houver muitas inserções. Leia o percentual junto dos erros concretos e dos campos críticos: a média não informa sozinha se o pedido correto foi consultado ou se a confirmação na conversa reparou o identificador.
Prepare uma referência que represente o áudio
A avaliação de transcrição compara o texto reconhecido com uma referência revisada. Se a referência contém erro ou interpreta o que a pessoa deveria ter dito, a medida deixa de representar reconhecimento do áudio. Preserve o conteúdo efetivamente falado conforme a regra de anotação escolhida.
Defina antes como tratar pontuação, números, abreviações e palavras interrompidas. A escrita “vinte e um” e a escrita “21” podem representar a mesma informação, mas uma comparação sem normalização pode contá-las de forma diferente. Não mude a regra depois para favorecer uma configuração.
Faça revisão dos trechos ambíguos. Se ninguém consegue ouvir com segurança uma palavra, registre essa condição e decida o tratamento consistente da amostra. Uma referência aparentemente precisa, mas baseada em suposição, cria conclusões enganosas.
Mantenha as mesmas referências nas comparações. Registre quais áudios e configurações foram usados. O objetivo é detectar uma diferença no reconhecimento, não misturar alteração de dados, regra de escrita e configuração em uma única variação de resultado.
Leia o resultado junto dos tipos de erro
WER usa substituições, exclusões e inserções após alinhamento entre referência e reconhecimento. O percentual resume o conjunto, mas os tipos de erro ajudam a entender o que investigar. Comparar apenas quantas palavras há em cada texto não fornece esse diagnóstico.
Uma exclusão pode remover uma palavra importante; uma inserção pode acrescentar conteúdo que não foi dito. Uma substituição pode trocar um termo por outro. Em cada caso, examine o trecho de áudio e a relação com a tarefa antes de decidir a mudança.
Não escolha um limite universal de aprovação sem considerar o atendimento. Nomes de serviços, códigos e números têm efeitos diferentes de palavras de apoio. Duas amostras com o mesmo WER podem produzir resultados operacionais bastante distintos.
Use o percentual como sinal de qualidade de transcrição e complemente com inspeção de casos. Não converta automaticamente a medida em taxa de resolução, segurança ou satisfação. Essas conclusões exigem evidência das etapas seguintes da conversa.
Acompanhe o campo até a operação que o utiliza
Para um campo crítico, registre o valor esperado, o reconhecido, o confirmado e o enviado à ferramenta. Essas quatro etapas mostram se um erro inicial foi corrigido ou se uma interpretação posterior introduziu um valor incorreto.
Em um exemplo fictício, a pessoa dita uma referência com cinco dígitos. A transcrição troca o último, mas a confirmação permite corrigir. A qualidade inicial do reconhecimento continua sendo uma informação útil; o resultado final também precisa registrar que a consulta usou a referência correta.
Também pode acontecer de a transcrição estar correta e o agente escolher outro número citado na conversa. Nesse caso, trocar o serviço de reconhecimento de fala talvez não resolva. Confira qual número foi confirmado, qual foi usado na consulta e como as instruções explicam essa escolha.
Avalie consequências. Um nome pronunciado de maneira estranha e uma consulta ao registro errado não são equivalentes. Defina critérios por campo e ação, com atenção aos dados que alteram autorização, pessoa, unidade ou data da tarefa.
Escolha amostras que representem o atendimento
Um conjunto só com fala limpa e frases preparadas pode não representar chamadas reais. Inclua condições de áudio, formas de dizer números e termos frequentes do público. Registre diferenças para conseguir analisar em que cenário o desempenho muda.
Separe idiomas e canais quando eles alteram a experiência. Uma configuração que funciona bem em um teste de voz no editor pelo navegador não estabelece o mesmo resultado por telefone. Evite comparar amostras de dificuldade distinta como se só o transcritor tivesse mudado.
Inclua negação e correção. “Não é quinze, é cinquenta” exige preservar o valor atual e o sentido da frase. O teste deve observar tanto o reconhecimento quanto o uso posterior, porque a conversa pode ouvir as palavras e ainda agir sobre o número anterior.
Mantenha uma amostra de desenvolvimento e casos reservados para verificar generalização quando o processo permitir. Ajustar para uma lista conhecida de exemplos pode melhorar aquela lista sem demonstrar benefício nos pedidos que a equipe ainda não revisou.
Altere a etapa responsável e confira efeitos colaterais
Quando o erro está no reconhecimento, examine áudio e opções disponíveis do transcritor. Quando aparece depois, revise interpretação, confirmação e parâmetros. Essa separação evita trocar componentes sem relação com a falha observada.
Mude uma hipótese por vez quando for viável. Repita os casos que motivaram a alteração e um conjunto que já funcionava. Registre a configuração efetiva e compare com a mesma regra de avaliação. Uma melhora sem reprodução não sustenta uma conclusão forte.
Inclua esforço da pessoa e duração até um próximo passo útil. Confirmar todos os termos pode melhorar alguns campos e tornar o atendimento cansativo. Escolha confirmações proporcionais à importância do dado e verifique se elas permitem correção real.
Não esconda regressões na média. Uma mudança pode melhorar frases gerais e piorar códigos relevantes ao atendimento. O grupo crítico precisa permanecer visível para que a equipe decida com base no impacto, além do percentual agregado.
Apresente o que a avaliação prova e o que falta verificar
Um relatório útil informa amostra, período, configuração, regra de normalização e resultados. Inclua exemplos representativos de falhas e recuperação. Sem essas condições, um percentual pode parecer comparável a outro mesmo quando mede áudio e tarefas diferentes.
Mostre WER, campos críticos e resultado da tarefa como dimensões distintas. A primeira descreve reconhecimento; a segunda acompanha dados importantes; a terceira confirma a conclusão no processo. A relação entre elas ajuda a escolher a próxima investigação.
Indique limitações de cobertura. Se não foram testadas chamadas longas ou determinado idioma, não estenda a conclusão a esses casos. Defina quais verificações faltam antes de ampliar o uso.
No Tigy, trate esse procedimento como avaliação manual ou externa ligada ao material e às integrações disponíveis. Não anuncie uma medição nativa que o produto não documenta. O valor do diagnóstico vem de evidências confiáveis e decisões verificáveis, mesmo quando a análise é feita fora da plataforma.
