Como transcrever áudio do WhatsApp em texto automaticamente com um agente de IA
Um agente de IA rodando em VPS pode receber o áudio do WhatsApp via API oficial, transcrever com Whisper ou modelo de linguagem equivalente e devolver o texto — ou até responder sozinho. O fluxo técnico completo elimina a cópia manual para sites de transcrição e roda 24/7 sem intervenção humana.
TL;DR: Conecte a API do WhatsApp a um VPS com modelo de transcrição (Whisper, Groq ou similar), receba o áudio via webhook, processe e devolva o texto — tudo automatizado por um agente de IA que orquestra cada etapa.
Por que automatizar a transcrição de áudio do WhatsApp?
Áudios de WhatsApp consomem tempo: você precisa ouvir, pausar, anotar. Em ambientes de atendimento, vendas ou suporte, cada áudio representa latência na resposta e gargalo no fluxo de trabalho.
A transcrição manual — copiar o áudio, abrir um site de terceiros, fazer upload — funciona em escala zero. Para mais de cinco áudios por dia, vira overhead operacional.
Automatizar significa: o áudio chega, o agente de IA transcreve em segundos e já devolve o texto ou uma resposta estruturada. Zero clique humano.
Como funciona a transcrição automática de áudio do WhatsApp com IA?
O fluxo técnico envolve cinco componentes: a API do WhatsApp, um servidor com poder de processamento, o modelo de transcrição, a orquestração (agente de IA) e a entrega da saída.
1. API do WhatsApp recebe o áudio
Quando alguém envia um áudio, a API do WhatsApp dispara um webhook POST para o seu servidor. O payload JSON contém o ID da mídia, tipo de arquivo e metadados do remetente.
Você usa esse ID para baixar o arquivo de áudio (formato OGG Opus, normalmente) via endpoint da API oficial.
2. VPS processa o arquivo
O servidor precisa CPU suficiente para rodar o modelo de transcrição. Whisper (OpenAI) em versão self-hosted exige de 2 a 4 vCPUs e 4 GB de RAM para o modelo base; versões maiores (medium, large) pedem 8 GB ou mais.
Alternativa: usar API externa como Groq Whisper (latência ~300 ms, custo ~US$ 0,05/hora de áudio) ou Deepgram. Trade-off: latência menor, custo por requisição, dependência de terceiro.
Um VPS Pro com 4 vCPUs e 8 GB em US-East entrega latência abaixo de 100 ms para a API do WhatsApp e roda Whisper base localmente sem engasgar.
3. Modelo de transcrição converte áudio em texto
Whisper é o padrão de mercado: modelo open-source da OpenAI, suporta 99 idiomas, pontua e identifica até quebras de frase. Roda em CPU (mais lento) ou GPU (transcrição de 1 min de áudio em ~2 segundos com RTX 4000).
Para volume alto (mais de 100 transcrições/dia), considere um Servidor para IA com GPU ou use API paga — custo previsível versus custo fixo de infraestrutura.
4. Agente de IA orquestra o fluxo
O agente recebe o webhook, baixa o áudio, chama o modelo de transcrição, trata o texto (corrige pontuação, remove ruído) e decide: devolver só a transcrição ou processar a intenção e responder sozinho.
Ferramentas de orquestração:
- n8n — workflow visual, conecta WhatsApp API + Whisper + LLM em poucos blocos. Self-hosted, sem taxa por execução.
- Flowise — similar, foco em RAG e agentes conversacionais. Instale com um clique via painel de aplicativos Rollin Host.
- Hermes Agent — camada gerenciada que junta Evolution API (WhatsApp não-oficial) ou API oficial, transcrição e resposta automática. Pronto para produção, hospedado em VPS dedicado.
5. Entrega do texto
O agente envia a transcrição de volta ao WhatsApp via API, como mensagem de texto. Opcionalmente, salva no CRM (Chatwoot, Supabase, planilha) para auditoria ou análise posterior.
Latência ponta a ponta: 2 a 5 segundos entre o envio do áudio e a chegada do texto, dependendo da duração do áudio e da infraestrutura.
Transcrição manual versus automática: trade-offs reais
| Critério | Manual (site de transcrição) | Automática (agente IA em VPS) |
|---|---|---|
| Tempo por áudio | 30–60 s (download + upload + espera) | 2–5 s (automático) |
| Custo incremental | Gratuito ou ~R$ 0,20/min (SaaS pago) | Custo fixo VPS + modelo (ou API paga) |
| Privacidade | Áudio sai do seu controle | Self-hosted: áudio nunca sai do VPS |
| Escalabilidade | Quebra com >10 áudios/dia | Processa centenas sem intervenção |
| Precisão | Depende do serviço (70–95%) | Whisper large: ~95% pt-BR |
| Integração com CRM | Zero (copia e cola manual) | Nativa via webhook |
Para atendimento com volume baixo (<5 áudios/dia), a transcrição manual via site gratuito ainda funciona. Acima disso, o custo de oportunidade (tempo da equipe) supera o custo de infraestrutura.
Hermes Agent: orquestração pronta para produção
O Hermes Agent é a camada gerenciada que conecta WhatsApp API (oficial ou via uazapi), transcrição e resposta automática em uma stack pronta. Você sobe em um VPS, configura o webhook e o agente cuida do resto.
Componentes incluídos:
- Integração WhatsApp API oficial ou não-oficial (Evolution API via uazapi)
- Transcrição via Whisper self-hosted ou API externa (você escolhe)
- LLM para interpretação e resposta contextual (GPT-4o mini, Llama 3 ou similar)
- Persistência em banco (histórico de conversas e transcrições)
- Interface de gerenciamento (logs, métricas, ajuste de prompts)
A Rollin Host oferece o Agente de IA no WhatsApp (R$ 299/mês) como solução gerenciada: até 3.000 mensagens processadas por IA por mês, GPT-4o mini, 1 usuário, suporte 24/7. Para quem prefere controle total, o Hermes Agent roda em qualquer VPS Pro com 4 GB de RAM ou mais.
Quanto custa rodar transcrição automática em infraestrutura própria?
O custo depende de três variáveis: volume de áudios, escolha do modelo (self-hosted vs. API) e especificação do servidor.
Cenário 1: baixo volume (até 500 áudios/mês), API externa
- VPS Lite 10 (2 vCPUs, 4 GB, Frankfurt): R$ 69,90/mês
- Groq Whisper API: ~US$ 0,05/hora de áudio → ~US$ 4/mês para 80 horas
- Total: ~R$ 90/mês
Cenário 2: médio volume (2.000 áudios/mês), Whisper self-hosted
- VPS Pro 20 (4 vCPUs, 8 GB, US-East): R$ 159,90/mês
- Whisper base rodando em CPU: 0 custo incremental por transcrição
- Total: R$ 159,90/mês fixo
Cenário 3: alto volume (10.000+ áudios/mês), GPU
- Servidor Cloud Hawk (8 vCPUs dedicados, 16 GB): R$ 519,90/mês
- Whisper large em GPU (via Servidor GPU ou add-on): transcrição 5× mais rápida
- Total: ~R$ 700/mês, escalável sem custo por requisição
Compare com SaaS de transcrição (Deepgram, AssemblyAI): custo de US$ 0,006 a US$ 0,015 por minuto. Para 10.000 áudios de 1 min, você paga US$ 60–150/mês (~R$ 300–750) sem controle da infraestrutura.
Self-hosting em VPS vence em privacidade, custo fixo e ausência de lock-in.
Passo a passo: montar o stack de transcrição em VPS
Este exemplo usa n8n + Whisper via Groq API + API oficial do WhatsApp. Substitua Groq por Whisper self-hosted se preferir zero dependência externa.
1. Provisione o VPS
Escolha VPS Pro 10 (2 vCPUs, 4 GB, US-East) ou superior. Instale n8n via Docker:
docker run -d --restart unless-stopped \
-p 5678:5678 \
-v ~/.n8n:/home/node/.n8n \
--name n8n \
n8nio/n8n
Acesse via http://SEU_IP:5678. Configure SSL reverso com Traefik ou Nginx se quiser HTTPS (obrigatório para webhooks Meta).
2. Configure o webhook do WhatsApp
No painel da API oficial do WhatsApp (Business Platform da Meta), registre a URL de webhook:
https://seu-dominio.com/webhook/whatsapp
n8n responde no endpoint configurado. Valide o token de verificação conforme documentação Meta.
3. Crie o workflow no n8n
Nós do workflow:
- Webhook — recebe POST da API WhatsApp
- Switch — filtra tipo de mensagem (
audio) - HTTP Request — baixa o arquivo de áudio (URL vem no payload)
- Groq API (ou Whisper local via HTTP Request) — envia o áudio, recebe texto
- HTTP Request — envia mensagem de texto de volta via API WhatsApp
Exemplo de chamada Groq Whisper:
curl -X POST https://api.groq.com/openai/v1/audio/transcriptions \
-H "Authorization: Bearer SUA_CHAVE" \
-F file=@audio.ogg \
-F model=whisper-large-v3
Resposta JSON contém "text": "...". Extraia e envie via WhatsApp.
4. (Opcional) Adicione LLM para resposta automática
Insira um nó OpenAI / Ollama / GPT-4o após a transcrição. Prompt exemplo:
Você recebeu a transcrição de um áudio: "{transcricao}".
Resuma em uma frase e responda de forma educada.
O agente devolve uma resposta estruturada, não apenas o texto bruto.
5. Teste e monitore
Envie um áudio de teste. Verifique latência no log do n8n e ajuste timeout se necessário. Para produção, configure reinicialização automática do container e alertas via webhook (Slack, Discord).
Principais aprendizados
- Automação elimina gargalo operacional: transcrição manual consome 30–60 s por áudio; agente de IA reduz para 2–5 s.
- Self-hosting em VPS oferece custo fixo e privacidade: áudio nunca sai do servidor, sem cobrança incremental por requisição.
- Whisper é o modelo de referência: 95% de precisão em pt-BR, open-source, roda em CPU ou GPU.
- Orquestração com n8n ou Flowise é visual e rápida: conecte WhatsApp API, transcrição e LLM em menos de 1 hora.
- Hermes Agent entrega stack completo gerenciado: para quem prefere pular a configuração técnica e rodar direto.
A escolha entre API paga (Groq, Deepgram) e modelo self-hosted depende de volume e controle desejado. Abaixo de 1.000 áudios/mês, API externa vence em simplicidade. Acima, Whisper local em VPS Pro ou Servidor Cloud trava o custo e aumenta a autonomia.
Perguntas frequentes
Como transcrever áudio do WhatsApp automaticamente sem copiar para site?
Configure um agente de IA rodando em VPS que recebe o áudio via API do WhatsApp, transcreve com Whisper ou modelo equivalente e devolve o texto — tudo via webhook, sem intervenção manual.
Qual o melhor modelo de IA para transcrever áudio do WhatsApp em português?
Whisper large v3 da OpenAI atinge ~95% de precisão em pt-BR, suporta pontuação automática e roda self-hosted em VPS ou via API (Groq, OpenAI). É o padrão de mercado em 2026.
Quanto custa rodar transcrição automática de áudio em VPS próprio?
Para até 500 áudios/mês, um VPS Lite 10 (R$ 69,90) + API Groq (~US$ 4) sai por ~R$ 90/mês. Para 2.000+ áudios com Whisper self-hosted, VPS Pro 20 (R$ 159,90) oferece custo fixo sem cobrança por requisição.
Preciso de GPU para transcrever áudio com Whisper?
Não. Whisper base roda em CPU (4 vCPUs, 8 GB RAM) com latência aceitável para até 100 áudios/dia. GPU acelera 5× e é recomendada para volume acima de 1.000 áudios/dia ou modelo large.
A transcrição automática funciona com API não-oficial do WhatsApp?
Sim. A API do WhatsApp da Rollin Host (R$ 39,90, via uazapi) envia webhooks idênticos aos da API oficial. O fluxo de transcrição é o mesmo, mudando apenas o endpoint de conexão.
Qual a latência real de transcrição automática de áudio do WhatsApp?
Com Whisper via API externa (Groq), a latência fica entre 2 e 4 segundos para áudios de até 1 minuto. Self-hosted em VPS Pro com CPU: 5 a 10 segundos. Com GPU: 2 a 3 segundos, independentemente da duração.
Quer rodar transcrição automática de áudio do WhatsApp em infraestrutura própria? A Rollin Host oferece VPS Pro otimizado para agentes de IA, Agente de IA no WhatsApp gerenciado e suporte 24/7 em português. Provisione seu servidor em ~5 minutos e suba o stack completo hoje mesmo — sem fidelidade, com 30 dias de garantia.
Entre em contato via WhatsApp e receba orientação técnica para dimensionar a infraestrutura ideal para o seu volume de transcrições.