Migração 100% grátis na contratação semestral · nossa equipe migra tudo de qualquer provedor · novos clientes Migrar agora
Agente de IA no WhatsApp na API Oficial da Meta · somos Tech Provider aprovado · orçamento sob consulta Pedir orçamento
VPS com OpenClaw pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
VPS com Hermes Agent pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
Hospedagem com 30 dias de garantia · Não gostou? Devolvemos 100%, sem perguntas. Ver hospedagem
#whatsapp#ia#transcricao-de-audio

Como transcrever áudio do WhatsApp em texto automaticamente com um agente de IA

por Equipe Rollin Host · · 10 min de leitura

Como transcrever áudio do WhatsApp em texto automaticamente com um agente de IA

Um agente de IA rodando em VPS pode receber o áudio do WhatsApp via API oficial, transcrever com Whisper ou modelo de linguagem equivalente e devolver o texto — ou até responder sozinho. O fluxo técnico completo elimina a cópia manual para sites de transcrição e roda 24/7 sem intervenção humana.

TL;DR: Conecte a API do WhatsApp a um VPS com modelo de transcrição (Whisper, Groq ou similar), receba o áudio via webhook, processe e devolva o texto — tudo automatizado por um agente de IA que orquestra cada etapa.

Por que automatizar a transcrição de áudio do WhatsApp?

Áudios de WhatsApp consomem tempo: você precisa ouvir, pausar, anotar. Em ambientes de atendimento, vendas ou suporte, cada áudio representa latência na resposta e gargalo no fluxo de trabalho.

A transcrição manual — copiar o áudio, abrir um site de terceiros, fazer upload — funciona em escala zero. Para mais de cinco áudios por dia, vira overhead operacional.

Automatizar significa: o áudio chega, o agente de IA transcreve em segundos e já devolve o texto ou uma resposta estruturada. Zero clique humano.

Como funciona a transcrição automática de áudio do WhatsApp com IA?

O fluxo técnico envolve cinco componentes: a API do WhatsApp, um servidor com poder de processamento, o modelo de transcrição, a orquestração (agente de IA) e a entrega da saída.

1. API do WhatsApp recebe o áudio

Quando alguém envia um áudio, a API do WhatsApp dispara um webhook POST para o seu servidor. O payload JSON contém o ID da mídia, tipo de arquivo e metadados do remetente.

Você usa esse ID para baixar o arquivo de áudio (formato OGG Opus, normalmente) via endpoint da API oficial.

2. VPS processa o arquivo

O servidor precisa CPU suficiente para rodar o modelo de transcrição. Whisper (OpenAI) em versão self-hosted exige de 2 a 4 vCPUs e 4 GB de RAM para o modelo base; versões maiores (medium, large) pedem 8 GB ou mais.

Alternativa: usar API externa como Groq Whisper (latência ~300 ms, custo ~US$ 0,05/hora de áudio) ou Deepgram. Trade-off: latência menor, custo por requisição, dependência de terceiro.

Um VPS Pro com 4 vCPUs e 8 GB em US-East entrega latência abaixo de 100 ms para a API do WhatsApp e roda Whisper base localmente sem engasgar.

3. Modelo de transcrição converte áudio em texto

Whisper é o padrão de mercado: modelo open-source da OpenAI, suporta 99 idiomas, pontua e identifica até quebras de frase. Roda em CPU (mais lento) ou GPU (transcrição de 1 min de áudio em ~2 segundos com RTX 4000).

Para volume alto (mais de 100 transcrições/dia), considere um Servidor para IA com GPU ou use API paga — custo previsível versus custo fixo de infraestrutura.

4. Agente de IA orquestra o fluxo

O agente recebe o webhook, baixa o áudio, chama o modelo de transcrição, trata o texto (corrige pontuação, remove ruído) e decide: devolver só a transcrição ou processar a intenção e responder sozinho.

Ferramentas de orquestração:

  • n8n — workflow visual, conecta WhatsApp API + Whisper + LLM em poucos blocos. Self-hosted, sem taxa por execução.
  • Flowise — similar, foco em RAG e agentes conversacionais. Instale com um clique via painel de aplicativos Rollin Host.
  • Hermes Agent — camada gerenciada que junta Evolution API (WhatsApp não-oficial) ou API oficial, transcrição e resposta automática. Pronto para produção, hospedado em VPS dedicado.

5. Entrega do texto

O agente envia a transcrição de volta ao WhatsApp via API, como mensagem de texto. Opcionalmente, salva no CRM (Chatwoot, Supabase, planilha) para auditoria ou análise posterior.

Latência ponta a ponta: 2 a 5 segundos entre o envio do áudio e a chegada do texto, dependendo da duração do áudio e da infraestrutura.

Transcrição manual versus automática: trade-offs reais

Critério Manual (site de transcrição) Automática (agente IA em VPS)
Tempo por áudio 30–60 s (download + upload + espera) 2–5 s (automático)
Custo incremental Gratuito ou ~R$ 0,20/min (SaaS pago) Custo fixo VPS + modelo (ou API paga)
Privacidade Áudio sai do seu controle Self-hosted: áudio nunca sai do VPS
Escalabilidade Quebra com >10 áudios/dia Processa centenas sem intervenção
Precisão Depende do serviço (70–95%) Whisper large: ~95% pt-BR
Integração com CRM Zero (copia e cola manual) Nativa via webhook

Para atendimento com volume baixo (<5 áudios/dia), a transcrição manual via site gratuito ainda funciona. Acima disso, o custo de oportunidade (tempo da equipe) supera o custo de infraestrutura.

Hermes Agent: orquestração pronta para produção

O Hermes Agent é a camada gerenciada que conecta WhatsApp API (oficial ou via uazapi), transcrição e resposta automática em uma stack pronta. Você sobe em um VPS, configura o webhook e o agente cuida do resto.

Componentes incluídos:

  • Integração WhatsApp API oficial ou não-oficial (Evolution API via uazapi)
  • Transcrição via Whisper self-hosted ou API externa (você escolhe)
  • LLM para interpretação e resposta contextual (GPT-4o mini, Llama 3 ou similar)
  • Persistência em banco (histórico de conversas e transcrições)
  • Interface de gerenciamento (logs, métricas, ajuste de prompts)

A Rollin Host oferece o Agente de IA no WhatsApp (R$ 299/mês) como solução gerenciada: até 3.000 mensagens processadas por IA por mês, GPT-4o mini, 1 usuário, suporte 24/7. Para quem prefere controle total, o Hermes Agent roda em qualquer VPS Pro com 4 GB de RAM ou mais.

Quanto custa rodar transcrição automática em infraestrutura própria?

O custo depende de três variáveis: volume de áudios, escolha do modelo (self-hosted vs. API) e especificação do servidor.

Cenário 1: baixo volume (até 500 áudios/mês), API externa

  • VPS Lite 10 (2 vCPUs, 4 GB, Frankfurt): R$ 69,90/mês
  • Groq Whisper API: ~US$ 0,05/hora de áudio → ~US$ 4/mês para 80 horas
  • Total: ~R$ 90/mês

Cenário 2: médio volume (2.000 áudios/mês), Whisper self-hosted

  • VPS Pro 20 (4 vCPUs, 8 GB, US-East): R$ 159,90/mês
  • Whisper base rodando em CPU: 0 custo incremental por transcrição
  • Total: R$ 159,90/mês fixo

Cenário 3: alto volume (10.000+ áudios/mês), GPU

  • Servidor Cloud Hawk (8 vCPUs dedicados, 16 GB): R$ 519,90/mês
  • Whisper large em GPU (via Servidor GPU ou add-on): transcrição 5× mais rápida
  • Total: ~R$ 700/mês, escalável sem custo por requisição

Compare com SaaS de transcrição (Deepgram, AssemblyAI): custo de US$ 0,006 a US$ 0,015 por minuto. Para 10.000 áudios de 1 min, você paga US$ 60–150/mês (~R$ 300–750) sem controle da infraestrutura.

Self-hosting em VPS vence em privacidade, custo fixo e ausência de lock-in.

Passo a passo: montar o stack de transcrição em VPS

Este exemplo usa n8n + Whisper via Groq API + API oficial do WhatsApp. Substitua Groq por Whisper self-hosted se preferir zero dependência externa.

1. Provisione o VPS

Escolha VPS Pro 10 (2 vCPUs, 4 GB, US-East) ou superior. Instale n8n via Docker:

docker run -d --restart unless-stopped \
  -p 5678:5678 \
  -v ~/.n8n:/home/node/.n8n \
  --name n8n \
  n8nio/n8n

Acesse via http://SEU_IP:5678. Configure SSL reverso com Traefik ou Nginx se quiser HTTPS (obrigatório para webhooks Meta).

2. Configure o webhook do WhatsApp

No painel da API oficial do WhatsApp (Business Platform da Meta), registre a URL de webhook:

https://seu-dominio.com/webhook/whatsapp

n8n responde no endpoint configurado. Valide o token de verificação conforme documentação Meta.

3. Crie o workflow no n8n

Nós do workflow:

  1. Webhook — recebe POST da API WhatsApp
  2. Switch — filtra tipo de mensagem (audio)
  3. HTTP Request — baixa o arquivo de áudio (URL vem no payload)
  4. Groq API (ou Whisper local via HTTP Request) — envia o áudio, recebe texto
  5. HTTP Request — envia mensagem de texto de volta via API WhatsApp

Exemplo de chamada Groq Whisper:

curl -X POST https://api.groq.com/openai/v1/audio/transcriptions \
  -H "Authorization: Bearer SUA_CHAVE" \
  -F file=@audio.ogg \
  -F model=whisper-large-v3

Resposta JSON contém "text": "...". Extraia e envie via WhatsApp.

4. (Opcional) Adicione LLM para resposta automática

Insira um nó OpenAI / Ollama / GPT-4o após a transcrição. Prompt exemplo:

Você recebeu a transcrição de um áudio: "{transcricao}".
Resuma em uma frase e responda de forma educada.

O agente devolve uma resposta estruturada, não apenas o texto bruto.

5. Teste e monitore

Envie um áudio de teste. Verifique latência no log do n8n e ajuste timeout se necessário. Para produção, configure reinicialização automática do container e alertas via webhook (Slack, Discord).

Principais aprendizados

  • Automação elimina gargalo operacional: transcrição manual consome 30–60 s por áudio; agente de IA reduz para 2–5 s.
  • Self-hosting em VPS oferece custo fixo e privacidade: áudio nunca sai do servidor, sem cobrança incremental por requisição.
  • Whisper é o modelo de referência: 95% de precisão em pt-BR, open-source, roda em CPU ou GPU.
  • Orquestração com n8n ou Flowise é visual e rápida: conecte WhatsApp API, transcrição e LLM em menos de 1 hora.
  • Hermes Agent entrega stack completo gerenciado: para quem prefere pular a configuração técnica e rodar direto.

A escolha entre API paga (Groq, Deepgram) e modelo self-hosted depende de volume e controle desejado. Abaixo de 1.000 áudios/mês, API externa vence em simplicidade. Acima, Whisper local em VPS Pro ou Servidor Cloud trava o custo e aumenta a autonomia.

Perguntas frequentes

Como transcrever áudio do WhatsApp automaticamente sem copiar para site?

Configure um agente de IA rodando em VPS que recebe o áudio via API do WhatsApp, transcreve com Whisper ou modelo equivalente e devolve o texto — tudo via webhook, sem intervenção manual.

Qual o melhor modelo de IA para transcrever áudio do WhatsApp em português?

Whisper large v3 da OpenAI atinge ~95% de precisão em pt-BR, suporta pontuação automática e roda self-hosted em VPS ou via API (Groq, OpenAI). É o padrão de mercado em 2026.

Quanto custa rodar transcrição automática de áudio em VPS próprio?

Para até 500 áudios/mês, um VPS Lite 10 (R$ 69,90) + API Groq (~US$ 4) sai por ~R$ 90/mês. Para 2.000+ áudios com Whisper self-hosted, VPS Pro 20 (R$ 159,90) oferece custo fixo sem cobrança por requisição.

Preciso de GPU para transcrever áudio com Whisper?

Não. Whisper base roda em CPU (4 vCPUs, 8 GB RAM) com latência aceitável para até 100 áudios/dia. GPU acelera 5× e é recomendada para volume acima de 1.000 áudios/dia ou modelo large.

A transcrição automática funciona com API não-oficial do WhatsApp?

Sim. A API do WhatsApp da Rollin Host (R$ 39,90, via uazapi) envia webhooks idênticos aos da API oficial. O fluxo de transcrição é o mesmo, mudando apenas o endpoint de conexão.

Qual a latência real de transcrição automática de áudio do WhatsApp?

Com Whisper via API externa (Groq), a latência fica entre 2 e 4 segundos para áudios de até 1 minuto. Self-hosted em VPS Pro com CPU: 5 a 10 segundos. Com GPU: 2 a 3 segundos, independentemente da duração.


Quer rodar transcrição automática de áudio do WhatsApp em infraestrutura própria? A Rollin Host oferece VPS Pro otimizado para agentes de IA, Agente de IA no WhatsApp gerenciado e suporte 24/7 em português. Provisione seu servidor em ~5 minutos e suba o stack completo hoje mesmo — sem fidelidade, com 30 dias de garantia.

Entre em contato via WhatsApp e receba orientação técnica para dimensionar a infraestrutura ideal para o seu volume de transcrições.