O Duá entende os áudios do seu cliente, e quem ouve é a Venduá

No WhatsApp, muita gente não digita: aperta o microfone e fala. O Duá, o vendedor com IA no WhatsApp da loja, entende esses áudios e responde como se o cliente tivesse escrito. E quem ouve é a própria Venduá, num motor de reconhecimento de voz que a gente construiu para isso.

O cliente fala, o Duá anota

“Oi, me vê um x-tudo e uma coca de dois litros, entrega aqui na rua de cima.” Num áudio, o cliente diz em dez segundos o que levaria um minuto para digitar. Para a cozinha, era o pior tipo de pedido: alguém precisava parar, ouvir e escrever.

Agora o Duá ouve o áudio, entende o pedido e segue a conversa: confirma os itens, pergunta o que faltou e manda o link para pagar. Você vê a conversa no app, com o texto de cada áudio ao lado.

O áudio não sai da Venduá

Transcrever áudio costuma significar mandá-lo para uma empresa de fora, que cobra por minuto e guarda uma cópia sob as regras dela. Aqui, o áudio vai do WhatsApp da loja para os servidores da Venduá e de lá para lugar nenhum.

O serviço que transcreve não guarda o áudio nem registra o que foi dito. O texto vai direto para o Duá responder o seu cliente.

Menos de um segundo por áudio

Um áudio de 15 segundos vira texto em menos de um segundo, contando o tempo de abrir o arquivo do WhatsApp. Medimos com frases em português do Brasil gravadas por pessoas de verdade:

  • 2,4 vezes mais rápido que a versão pronta do mesmo modelo de voz, num servidor de 4 núcleos. Quando vários áudios chegam juntos, eles são ouvidos em grupo, e a conta sobe para 4,8 vezes.
  • Áudios longos sem perder o fio. Áudio de mais de 30 segundos é dividido nas pausas da fala. Em áudios de 2 minutos, os erros caíram de 5,4% para 3,0% das palavras, e um áudio de 3 minutos fica pronto 1,6 vez mais rápido.
  • Silêncio não conta. O silêncio do começo e do fim é cortado antes de ouvir: 11% menos áudio para processar, e os erros caíram de 5,1% para 4,7% das palavras.

Ele conhece o seu cardápio

Toda loja vende coisas com nome próprio: o bolo da casa, o lanche com o nome do bairro, a marmita que só você faz. Um reconhecimento de voz genérico nunca ouviu esses nomes e tenta adivinhar.

O Duá ouve com o seu cardápio na mão. Os nomes dos seus produtos ganham preferência quando o som bate com eles. Num teste com 150 frases cheias de nomes próprios, os nomes certos subiram de 75,7% para 81,3%, sem nenhum nome inventado e sem ficar mais lento.

Na dúvida, ele confirma

Áudio com barulho de moto, liquidificador ou criança no fundo às vezes não dá para entender direito. Em vez de chutar, o Duá mede a própria certeza palavra por palavra. Quando fica inseguro, repete o que entendeu e pede para o cliente confirmar.

Os áudios que ele separa para confirmar são justamente os difíceis: neles, o texto erra três vezes mais palavras do que nos outros. Melhor uma pergunta a mais do que um pedido errado saindo da cozinha.

Como a gente fez

O ponto de partida é o Parakeet TDT 0.6B v3, um modelo de reconhecimento de voz aberto da NVIDIA, publicado sob a licença CC-BY-4.0. Ele entende português e 24 outras línguas, já escreve com pontuação e maiúsculas, e não costuma inventar frases no silêncio, um defeito comum em modelos parecidos.

Em volta dele, a Venduá construiu o motor que faz o modelo rodar rápido em servidor comum:

  • Uma compressão nova do modelo. A versão compactada que existia era mais lenta que a original e errava mais. Refizemos a compactação: a parte mais pesada ficou 3,5 vezes mais rápida e muito mais fiel ao modelo original.
  • Um decodificador que só refaz o que mudou. O texto sai palavra por palavra, e a cada passo o nosso decodificador recalcula só o necessário. Ele chega ao mesmo texto que o decodificador original, letra por letra, fazendo bem menos conta.
  • Áudio do WhatsApp aberto direto, sem chamar outro programa: três vezes mais rápido para abrir cada arquivo.

E continua: estamos testando uma versão do modelo treinada com conversas em português do Brasil. Em fala espontânea ela erra 39% menos palavras. Ela entra quando passar no teste mais importante: os áudios de verdade das nossas lojas.