Transcrever vídeo longo em texto: o que fazer quando a ferramenta gratuita atinge o limite
Ferramentas gratuitas de transcrição como Otter.ai, Rev e Descript impõem limites de 25 MB a 100 MB por arquivo ou 2 horas mensais no total. Para vídeos longos — webinars de 3 horas, aulas gravadas, entrevistas extensas — essas barreiras travam o fluxo de trabalho e forçam upgrade para planos pagos que custam US$ 20-30/mês por usuário.
A alternativa técnica é rodar Whisper localmente em um VPS. O modelo de transcrição open-source da OpenAI processa arquivos de qualquer tamanho, sem cotas mensais, com custo fixo de infraestrutura a partir de R$ 69,90/mês.
TL;DR: Whisper auto-hospedado em VPS elimina limites de tamanho e tempo, oferece controle total sobre dados sensíveis e reduz custo recorrente para quem transcreve volume alto. A troca é gerenciar o servidor.
Por que ferramentas gratuitas limitam vídeos longos?
Transcrição via IA consome CPU e memória no backend do provedor. Um vídeo de 1 hora em resolução média (500 MB) exige 15-30 minutos de processamento em GPU e ~4 GB de RAM temporária para extração de áudio, segmentação e inferência do modelo.
Planos gratuitos subsidiam esse custo com três barreiras:
- Tamanho máximo de 25-100 MB por upload, forçando corte manual de arquivos longos.
- Cota mensal de 2-5 horas totais, esgotável em 1-2 webinars.
- Fila de processamento lenta, com espera de 20-40 minutos em horários de pico.
Para uso ocasional (1-2 vídeos curtos/mês), o modelo freemium funciona. Para fluxos recorrentes — documentação de treinamentos, legendagem de cursos, transcrição de atendimentos — o gargalo aparece na primeira semana.
Quanto custa escalar em SaaS vs. infraestrutura própria?
A tabela abaixo compara custo mensal para 10 horas de transcrição/mês (cenário comum de equipe pequena ou produtor de conteúdo):
| Modelo | Custo mensal (R$) | Limite | Controle de dados |
|---|---|---|---|
| Otter.ai Pro | ~140 (US$ 25) | 10h/mês | Dados na nuvem do fornecedor |
| Rev | ~750 (US$ 1,50/min) | Pay-as-you-go | Dados na nuvem do fornecedor |
| Whisper em VPS Lite 10 | 69,90 | Ilimitado | Self-hosted, acesso root |
| Whisper em VPS Lite 20 | 119,90 | Ilimitado + paralelização | Self-hosted, acesso root |
VPS processa volumes maiores pelo mesmo preço fixo. Um cliente da Rollin Host que transcreve gravações de consultorias (15-20h/mês) reduziu gasto de US$ 50/mês (SaaS) para VPS de R$ 119,90 com sobra de capacidade para outros workloads.
O custo de SaaS escala linearmente com o volume; infraestrutura própria escala em degraus (upgrade de plano só quando CPU satura).
Como rodar Whisper em VPS para vídeos longos
Whisper roda em CPU pura (modelo base ou small) ou com GPU (modelo large para alta precisão). Para começar, CPU já entrega 90%+ de acurácia em português com tempo de processamento aceitável (1 hora de áudio → 10-15 min de transcrição no small).
Passo 1: Provisionar VPS com recursos adequados
Requisitos mínimos para Whisper small (recomendado para produção em português):
- 2 vCPU e 4 GB RAM — suficiente para arquivos até 2 horas.
- 20 GB NVMe para sistema + modelo + fila temporária.
- Ubuntu 22.04 LTS com Python 3.10+.
Um VPS Lite 10 (2 vCPU, 4 GB RAM, Frankfurt) a R$ 69,90/mês atende o caso base. Para paralelizar múltiplos arquivos ou usar o modelo medium, o VPS Lite 20 (4 vCPU, 8 GB RAM) a R$ 119,90 evita gargalos.
Passo 2: Instalar Whisper e dependências
# Atualizar sistema
sudo apt update && sudo apt upgrade -y
# Instalar Python e pip
sudo apt install python3-pip python3-venv ffmpeg -y
# Criar ambiente isolado
python3 -m venv whisper-env
source whisper-env/bin/activate
# Instalar Whisper
pip install -U openai-whisper
O pacote ffmpeg é obrigatório — Whisper usa-o para converter formatos de vídeo (MP4, AVI, MOV) em áudio WAV antes da transcrição.
Passo 3: Transcrever o primeiro vídeo
whisper video-longo.mp4 --model small --language pt --output_format txt
Parâmetros importantes:
--model small: equilíbrio entre velocidade e acurácia (alternativas:base,medium,large).--language pt: força português, evitando detecção automática em trechos mudos.--output_format:txt,srt(legenda),vtt,json(com timestamps).
Arquivo de 1 hora processa em 8-12 minutos no VPS Lite 10, gerando .txt no mesmo diretório.
Passo 4: Automatizar com fila de processamento
Para múltiplos uploads (ex: pasta Dropbox sincronizada), use inotify + script bash que detecta novos .mp4 e enfileira transcrições:
#!/bin/bash
WATCH_DIR="/root/videos"
OUTPUT_DIR="/root/transcricoes"
inotifywait -m "$WATCH_DIR" -e create -e moved_to |
while read path action file; do
if [[ "$file" =~ \.mp4$ ]]; then
whisper "$WATCH_DIR/$file" --model small --language pt --output_dir "$OUTPUT_DIR" --output_format txt
fi
done
Integre com webhook para notificar conclusão via API do WhatsApp ou Slack.
Quando vale a pena usar GPU para transcrição?
Modelo large (melhor acurácia, recomendado para áudio com ruído ou sotaques) exige GPU com 8+ GB VRAM. O ganho de qualidade é marginal (~2-3% WER) mas o tempo cai para 1/4: 1 hora de áudio → 3 minutos de transcrição.
Cenários que justificam GPU:
- Volume alto (50+ horas/mês): ROI aparece em 2-3 meses vs. SaaS.
- Áudio difícil: call centers, entrevistas em ambientes ruidosos, múltiplos falantes sobrepostos.
- Latência crítica: transcrição ao vivo ou quasi-real-time (ex: legendagem de transmissão com delay de 30s).
Um servidor GPU com NVIDIA T4 ou superior processa lotes de 10 vídeos simultâneos. Para workloads mistos (transcrição + fine-tuning de modelos), considere servidor para IA com GPU compartilhada.
Privacidade e conformidade: dados sensíveis não saem do VPS
SaaS de transcrição processa uploads em servidores nos EUA ou Europa, sujeitos a ToS que autorizam análise para melhoria de modelo. Para advogados, médicos, RH e consultorias — casos com LGPD estrita — isso é risco jurídico.
Whisper self-hosted mantém 100% dos dados no VPS. O áudio nunca transita pela internet além do upload inicial via SFTP/rsync, e a transcrição roda offline.
Checklist de conformidade:
- VPS em Frankfurt (GDPR-compliant) para dados de clientes europeus.
- Criptografia em repouso:
/root/transcricoesem partição LUKS. - Backup automatizado para Storage Cloud com retenção de 30 dias.
- Acesso via chave SSH, sem senha root.
Auditores aceitam esse setup como equivalente a processamento on-premise.
O que fazer quando não quer gerenciar servidor
Rodar Whisper em VPS exige conforto com terminal Linux, gestão de dependências Python e monitoramento de uso de CPU/RAM. Para equipes sem DevOps, três alternativas:
Contratar setup gerenciado: a Rollin Host configura Whisper + interface web + automação de fila como serviço custom. Orçamento via WhatsApp.
Usar n8n pré-configurado: VPS para n8n já traz ambiente pronto; adicione workflow que recebe webhook com URL do vídeo → baixa → transcreve → retorna texto via API.
API gerenciada com cota alta: Deepgram ou AssemblyAI cobram US$ 0,01-0,02/min (R$ ~600 para 10h/mês), mais barato que Otter mas ainda SaaS. Considere se controle de dados não é crítico.
Principais aprendizados
- Ferramentas gratuitas limitam transcrição a 25-100 MB ou 2 horas/mês, inviável para vídeos longos recorrentes.
- Whisper em VPS remove limites de tamanho e tempo com custo fixo a partir de R$ 69,90/mês, 50-70% mais barato que SaaS em volume.
- Modelo
smallem CPU já entrega 90%+ de acurácia em português; GPU só compensa para volume alto (50+ horas/mês) ou latência crítica. - Self-hosting garante conformidade com LGPD para dados sensíveis (advogados, saúde, RH) sem depender de ToS de terceiros.
- Automação via script + webhook integra transcrição no fluxo de trabalho; n8n simplifica orquestração sem código.
Perguntas frequentes
Qual o limite de tamanho de vídeo que Whisper consegue processar?
Whisper não impõe limite de tamanho — o gargalo é a RAM disponível no VPS. Um arquivo de 3 horas (1,5 GB) consome ~6 GB de RAM durante processamento com modelo small. VPS Lite 20 (8 GB RAM) processa arquivos até 4 horas; acima disso, use VPS Lite 30 (16 GB) ou divida o vídeo em partes com ffmpeg.
Whisper em CPU é muito lento comparado a SaaS?
Modelo small em VPS Lite 10 (2 vCPU) transcreve 1 hora de áudio em 10-12 minutos, 2-3x mais lento que SaaS com GPU. Para uso batch (processar overnight), a diferença é irrelevante. Se precisa resultado em <5 min, considere VPS com GPU ou modelo base (mais rápido, -5% acurácia).
É possível acessar Whisper via interface web em vez de terminal?
Sim. Projetos como whisper-webui ou faster-whisper-server adicionam interface de upload + fila visual. Instale via Docker no mesmo VPS; acesse por IP:porta ou domínio próprio com SSL reverso via Nginx. Setup leva ~20 min seguindo a doc oficial.
Whisper funciona bem com áudio em português do Brasil?
Sim, Whisper foi treinado com 680 mil horas multilíngues incluindo ~20 mil horas de português (BR e PT). Acurácia em português brasileiro com modelo small fica em 88-92% WER (Word Error Rate), equivalente a serviços pagos como Google Speech-to-Text. Sotaques regionais e gírias podem cair para 85%; nesses casos, use modelo medium ou large.
Quanto custa adicionar GPU ao VPS para transcrição mais rápida?
Servidores Cloud com GPU dedicada começam em R$ 999,90/mês (plano Eagle). Para workload misto (transcrição + outros modelos de IA), um servidor para LLMs com VRAM compartilhada otimiza custo. Se só transcrição justificar GPU, mantenha CPU e processe em lote noturno — ROI de GPU só aparece acima de 100 horas/mês.
Consigo integrar Whisper com ferramentas como Notion ou Google Docs?
Sim. Após gerar o .txt, use API do Notion (via curl ou n8n) para criar página com a transcrição, ou rclone para upload direto no Google Drive. Webhook notifica quando arquivo está pronto. Para fluxos complexos (ex: transcrever → resumir com LLM → postar no Slack), VPS para n8n orquestra tudo sem código.
Precisa de VPS configurado para transcrição de vídeos longos sem limite? A Rollin Host provisiona ambientes com Whisper pré-instalado, automação de fila e backup em ~1 hora. Escolha o plano na página de VPS ou fale com o suporte via WhatsApp para setup gerenciado.