O cliente fala, o Duá anota
“Oi, me vê um x-tudo e uma coca de dois litros, entrega aqui na rua de cima.” Num áudio, o cliente diz em dez segundos o que levaria um minuto para digitar. Para a cozinha, era o pior tipo de pedido: alguém precisava parar, ouvir e escrever.
Agora o Duá ouve o áudio, entende o pedido e segue a conversa: confirma os itens, pergunta o que faltou e manda o link para pagar. Você vê a conversa no app, com o texto de cada áudio ao lado.
O áudio não sai da Venduá
Transcrever áudio costuma significar mandá-lo para uma empresa de fora, que cobra por minuto e guarda uma cópia sob as regras dela. Aqui, o áudio vai do WhatsApp da loja para os servidores da Venduá e de lá para lugar nenhum.
O serviço que transcreve não guarda o áudio nem registra o que foi dito. O texto vai direto para o Duá responder o seu cliente.
Menos de um segundo por áudio
Um áudio de 15 segundos vira texto em menos de um segundo, contando o tempo de abrir o arquivo do WhatsApp. Medimos com frases em português do Brasil gravadas por pessoas de verdade:
- 2,4 vezes mais rápido que a versão pronta do mesmo modelo de voz, num servidor de 4 núcleos. Quando vários áudios chegam juntos, eles são ouvidos em grupo, e a conta sobe para 4,8 vezes.
- Áudios longos sem perder o fio. Áudio de mais de 30 segundos é dividido nas pausas da fala. Em áudios de 2 minutos, os erros caíram de 5,4% para 3,0% das palavras, e um áudio de 3 minutos fica pronto 1,6 vez mais rápido.
- Silêncio não conta. O silêncio do começo e do fim é cortado antes de ouvir: 11% menos áudio para processar, e os erros caíram de 5,1% para 4,7% das palavras.
Ele conhece o seu cardápio
Toda loja vende coisas com nome próprio: o bolo da casa, o lanche com o nome do bairro, a marmita que só você faz. Um reconhecimento de voz genérico nunca ouviu esses nomes e tenta adivinhar.
O Duá ouve com o seu cardápio na mão. Os nomes dos seus produtos ganham preferência quando o som bate com eles. Num teste com 150 frases cheias de nomes próprios, os nomes certos subiram de 75,7% para 81,3%, sem nenhum nome inventado e sem ficar mais lento.
Na dúvida, ele confirma
Áudio com barulho de moto, liquidificador ou criança no fundo às vezes não dá para entender direito. Em vez de chutar, o Duá mede a própria certeza palavra por palavra. Quando fica inseguro, repete o que entendeu e pede para o cliente confirmar.
Os áudios que ele separa para confirmar são justamente os difíceis: neles, o texto erra três vezes mais palavras do que nos outros. Melhor uma pergunta a mais do que um pedido errado saindo da cozinha.
Como a gente fez
O ponto de partida é o Parakeet TDT 0.6B v3, um modelo de reconhecimento de voz aberto da NVIDIA, publicado sob a licença CC-BY-4.0. Ele entende português e 24 outras línguas, já escreve com pontuação e maiúsculas, e não costuma inventar frases no silêncio, um defeito comum em modelos parecidos.
Em volta dele, a Venduá construiu o motor que faz o modelo rodar rápido em servidor comum:
- Uma compressão nova do modelo. A versão compactada que existia era mais lenta que a original e errava mais. Refizemos a compactação: a parte mais pesada ficou 3,5 vezes mais rápida e muito mais fiel ao modelo original.
- Um decodificador que só refaz o que mudou. O texto sai palavra por palavra, e a cada passo o nosso decodificador recalcula só o necessário. Ele chega ao mesmo texto que o decodificador original, letra por letra, fazendo bem menos conta.
- Áudio do WhatsApp aberto direto, sem chamar outro programa: três vezes mais rápido para abrir cada arquivo.
E continua: estamos testando uma versão do modelo treinada com conversas em português do Brasil. Em fala espontânea ela erra 39% menos palavras. Ela entra quando passar no teste mais importante: os áudios de verdade das nossas lojas.