Migração 100% grátis na contratação semestral · nossa equipe migra tudo de qualquer provedor · novos clientes Migrar agora
Agente de IA no WhatsApp na API Oficial da Meta · somos Tech Provider aprovado · orçamento sob consulta Pedir orçamento
VPS com OpenClaw pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
VPS com Hermes Agent pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
Hospedagem com 30 dias de garantia · Não gostou? Devolvemos 100%, sem perguntas. Ver hospedagem
#transcricao-de-video#whisper#vps

Transcrever vídeo longo em texto: o que fazer quando a ferramenta gratuita atinge o limite

por Equipe Rollin Host · · 8 min de leitura

Transcrever vídeo longo em texto: o que fazer quando a ferramenta gratuita atinge o limite

Ferramentas gratuitas de transcrição como Otter.ai, Rev e Descript impõem limites de 25 MB a 100 MB por arquivo ou 2 horas mensais no total. Para vídeos longos — webinars de 3 horas, aulas gravadas, entrevistas extensas — essas barreiras travam o fluxo de trabalho e forçam upgrade para planos pagos que custam US$ 20-30/mês por usuário.

A alternativa técnica é rodar Whisper localmente em um VPS. O modelo de transcrição open-source da OpenAI processa arquivos de qualquer tamanho, sem cotas mensais, com custo fixo de infraestrutura a partir de R$ 69,90/mês.

TL;DR: Whisper auto-hospedado em VPS elimina limites de tamanho e tempo, oferece controle total sobre dados sensíveis e reduz custo recorrente para quem transcreve volume alto. A troca é gerenciar o servidor.

Por que ferramentas gratuitas limitam vídeos longos?

Transcrição via IA consome CPU e memória no backend do provedor. Um vídeo de 1 hora em resolução média (500 MB) exige 15-30 minutos de processamento em GPU e ~4 GB de RAM temporária para extração de áudio, segmentação e inferência do modelo.

Planos gratuitos subsidiam esse custo com três barreiras:

  • Tamanho máximo de 25-100 MB por upload, forçando corte manual de arquivos longos.
  • Cota mensal de 2-5 horas totais, esgotável em 1-2 webinars.
  • Fila de processamento lenta, com espera de 20-40 minutos em horários de pico.

Para uso ocasional (1-2 vídeos curtos/mês), o modelo freemium funciona. Para fluxos recorrentes — documentação de treinamentos, legendagem de cursos, transcrição de atendimentos — o gargalo aparece na primeira semana.

Quanto custa escalar em SaaS vs. infraestrutura própria?

A tabela abaixo compara custo mensal para 10 horas de transcrição/mês (cenário comum de equipe pequena ou produtor de conteúdo):

Modelo Custo mensal (R$) Limite Controle de dados
Otter.ai Pro ~140 (US$ 25) 10h/mês Dados na nuvem do fornecedor
Rev ~750 (US$ 1,50/min) Pay-as-you-go Dados na nuvem do fornecedor
Whisper em VPS Lite 10 69,90 Ilimitado Self-hosted, acesso root
Whisper em VPS Lite 20 119,90 Ilimitado + paralelização Self-hosted, acesso root

VPS processa volumes maiores pelo mesmo preço fixo. Um cliente da Rollin Host que transcreve gravações de consultorias (15-20h/mês) reduziu gasto de US$ 50/mês (SaaS) para VPS de R$ 119,90 com sobra de capacidade para outros workloads.

O custo de SaaS escala linearmente com o volume; infraestrutura própria escala em degraus (upgrade de plano só quando CPU satura).

Como rodar Whisper em VPS para vídeos longos

Whisper roda em CPU pura (modelo base ou small) ou com GPU (modelo large para alta precisão). Para começar, CPU já entrega 90%+ de acurácia em português com tempo de processamento aceitável (1 hora de áudio → 10-15 min de transcrição no small).

Passo 1: Provisionar VPS com recursos adequados

Requisitos mínimos para Whisper small (recomendado para produção em português):

  • 2 vCPU e 4 GB RAM — suficiente para arquivos até 2 horas.
  • 20 GB NVMe para sistema + modelo + fila temporária.
  • Ubuntu 22.04 LTS com Python 3.10+.

Um VPS Lite 10 (2 vCPU, 4 GB RAM, Frankfurt) a R$ 69,90/mês atende o caso base. Para paralelizar múltiplos arquivos ou usar o modelo medium, o VPS Lite 20 (4 vCPU, 8 GB RAM) a R$ 119,90 evita gargalos.

Passo 2: Instalar Whisper e dependências

# Atualizar sistema
sudo apt update && sudo apt upgrade -y

# Instalar Python e pip
sudo apt install python3-pip python3-venv ffmpeg -y

# Criar ambiente isolado
python3 -m venv whisper-env
source whisper-env/bin/activate

# Instalar Whisper
pip install -U openai-whisper

O pacote ffmpeg é obrigatório — Whisper usa-o para converter formatos de vídeo (MP4, AVI, MOV) em áudio WAV antes da transcrição.

Passo 3: Transcrever o primeiro vídeo

whisper video-longo.mp4 --model small --language pt --output_format txt

Parâmetros importantes:

  • --model small: equilíbrio entre velocidade e acurácia (alternativas: base, medium, large).
  • --language pt: força português, evitando detecção automática em trechos mudos.
  • --output_format: txt, srt (legenda), vtt, json (com timestamps).

Arquivo de 1 hora processa em 8-12 minutos no VPS Lite 10, gerando .txt no mesmo diretório.

Passo 4: Automatizar com fila de processamento

Para múltiplos uploads (ex: pasta Dropbox sincronizada), use inotify + script bash que detecta novos .mp4 e enfileira transcrições:

#!/bin/bash
WATCH_DIR="/root/videos"
OUTPUT_DIR="/root/transcricoes"

inotifywait -m "$WATCH_DIR" -e create -e moved_to |
  while read path action file; do
    if [[ "$file" =~ \.mp4$ ]]; then
      whisper "$WATCH_DIR/$file" --model small --language pt --output_dir "$OUTPUT_DIR" --output_format txt
    fi
  done

Integre com webhook para notificar conclusão via API do WhatsApp ou Slack.

Quando vale a pena usar GPU para transcrição?

Modelo large (melhor acurácia, recomendado para áudio com ruído ou sotaques) exige GPU com 8+ GB VRAM. O ganho de qualidade é marginal (~2-3% WER) mas o tempo cai para 1/4: 1 hora de áudio → 3 minutos de transcrição.

Cenários que justificam GPU:

  • Volume alto (50+ horas/mês): ROI aparece em 2-3 meses vs. SaaS.
  • Áudio difícil: call centers, entrevistas em ambientes ruidosos, múltiplos falantes sobrepostos.
  • Latência crítica: transcrição ao vivo ou quasi-real-time (ex: legendagem de transmissão com delay de 30s).

Um servidor GPU com NVIDIA T4 ou superior processa lotes de 10 vídeos simultâneos. Para workloads mistos (transcrição + fine-tuning de modelos), considere servidor para IA com GPU compartilhada.

Privacidade e conformidade: dados sensíveis não saem do VPS

SaaS de transcrição processa uploads em servidores nos EUA ou Europa, sujeitos a ToS que autorizam análise para melhoria de modelo. Para advogados, médicos, RH e consultorias — casos com LGPD estrita — isso é risco jurídico.

Whisper self-hosted mantém 100% dos dados no VPS. O áudio nunca transita pela internet além do upload inicial via SFTP/rsync, e a transcrição roda offline.

Checklist de conformidade:

  • VPS em Frankfurt (GDPR-compliant) para dados de clientes europeus.
  • Criptografia em repouso: /root/transcricoes em partição LUKS.
  • Backup automatizado para Storage Cloud com retenção de 30 dias.
  • Acesso via chave SSH, sem senha root.

Auditores aceitam esse setup como equivalente a processamento on-premise.

O que fazer quando não quer gerenciar servidor

Rodar Whisper em VPS exige conforto com terminal Linux, gestão de dependências Python e monitoramento de uso de CPU/RAM. Para equipes sem DevOps, três alternativas:

  1. Contratar setup gerenciado: a Rollin Host configura Whisper + interface web + automação de fila como serviço custom. Orçamento via WhatsApp.

  2. Usar n8n pré-configurado: VPS para n8n já traz ambiente pronto; adicione workflow que recebe webhook com URL do vídeo → baixa → transcreve → retorna texto via API.

  3. API gerenciada com cota alta: Deepgram ou AssemblyAI cobram US$ 0,01-0,02/min (R$ ~600 para 10h/mês), mais barato que Otter mas ainda SaaS. Considere se controle de dados não é crítico.

Principais aprendizados

  • Ferramentas gratuitas limitam transcrição a 25-100 MB ou 2 horas/mês, inviável para vídeos longos recorrentes.
  • Whisper em VPS remove limites de tamanho e tempo com custo fixo a partir de R$ 69,90/mês, 50-70% mais barato que SaaS em volume.
  • Modelo small em CPU já entrega 90%+ de acurácia em português; GPU só compensa para volume alto (50+ horas/mês) ou latência crítica.
  • Self-hosting garante conformidade com LGPD para dados sensíveis (advogados, saúde, RH) sem depender de ToS de terceiros.
  • Automação via script + webhook integra transcrição no fluxo de trabalho; n8n simplifica orquestração sem código.

Perguntas frequentes

Qual o limite de tamanho de vídeo que Whisper consegue processar?

Whisper não impõe limite de tamanho — o gargalo é a RAM disponível no VPS. Um arquivo de 3 horas (1,5 GB) consome ~6 GB de RAM durante processamento com modelo small. VPS Lite 20 (8 GB RAM) processa arquivos até 4 horas; acima disso, use VPS Lite 30 (16 GB) ou divida o vídeo em partes com ffmpeg.

Whisper em CPU é muito lento comparado a SaaS?

Modelo small em VPS Lite 10 (2 vCPU) transcreve 1 hora de áudio em 10-12 minutos, 2-3x mais lento que SaaS com GPU. Para uso batch (processar overnight), a diferença é irrelevante. Se precisa resultado em <5 min, considere VPS com GPU ou modelo base (mais rápido, -5% acurácia).

É possível acessar Whisper via interface web em vez de terminal?

Sim. Projetos como whisper-webui ou faster-whisper-server adicionam interface de upload + fila visual. Instale via Docker no mesmo VPS; acesse por IP:porta ou domínio próprio com SSL reverso via Nginx. Setup leva ~20 min seguindo a doc oficial.

Whisper funciona bem com áudio em português do Brasil?

Sim, Whisper foi treinado com 680 mil horas multilíngues incluindo ~20 mil horas de português (BR e PT). Acurácia em português brasileiro com modelo small fica em 88-92% WER (Word Error Rate), equivalente a serviços pagos como Google Speech-to-Text. Sotaques regionais e gírias podem cair para 85%; nesses casos, use modelo medium ou large.

Quanto custa adicionar GPU ao VPS para transcrição mais rápida?

Servidores Cloud com GPU dedicada começam em R$ 999,90/mês (plano Eagle). Para workload misto (transcrição + outros modelos de IA), um servidor para LLMs com VRAM compartilhada otimiza custo. Se só transcrição justificar GPU, mantenha CPU e processe em lote noturno — ROI de GPU só aparece acima de 100 horas/mês.

Consigo integrar Whisper com ferramentas como Notion ou Google Docs?

Sim. Após gerar o .txt, use API do Notion (via curl ou n8n) para criar página com a transcrição, ou rclone para upload direto no Google Drive. Webhook notifica quando arquivo está pronto. Para fluxos complexos (ex: transcrever → resumir com LLM → postar no Slack), VPS para n8n orquestra tudo sem código.


Precisa de VPS configurado para transcrição de vídeos longos sem limite? A Rollin Host provisiona ambientes com Whisper pré-instalado, automação de fila e backup em ~1 hora. Escolha o plano na página de VPS ou fale com o suporte via WhatsApp para setup gerenciado.