Migração 100% grátis na contratação semestral · nossa equipe migra tudo de qualquer provedor · novos clientes Migrar agora
Agente de IA no WhatsApp na API Oficial da Meta · somos Tech Provider aprovado · orçamento sob consulta Pedir orçamento
VPS com OpenClaw pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
VPS com Hermes Agent pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
Hospedagem com 30 dias de garantia · Não gostou? Devolvemos 100%, sem perguntas. Ver hospedagem
#transcricao#automacao#ia

Transcrever vídeo em texto grátis: ferramentas, limites e quando automatizar com IA

por Equipe Rollin Host · · 7 min de leitura

Transcrever vídeo em texto grátis: ferramentas, limites e quando automatizar com IA

Ferramentas gratuitas de transcrição como YouTube Auto-Caption, Otter.ai e Google Docs suportam até 30–60 minutos por sessão e exigem upload manual. Para volumes acima de 5 horas/mês ou integração com pipeline de conteúdo, a automação com Whisper self-hosted ou agentes de IA elimina teto de uso e reduz custo por hora transcrita.

TL;DR: Grátis funciona para testes e volumes baixos; acima de 10 vídeos/mês, self-hosting de Whisper ou API local sai mais barato e escala sem limite de cota.

Por que transcrever vídeo em texto?

Vídeos corporativos, webinars, tutoriais e podcasts geram conhecimento retido em áudio. Transcrição converte esse conteúdo em texto indexável, editável e traduzível.

A demanda cresce com equipes remotas produzindo gravações diárias. Atas de reunião, legendas para acessibilidade e insumos para blog dependem de texto limpo.

Ferramentas gratuitas atendem necessidades pontuais. Mas processar 20+ horas/mês com limite de 30 min/upload vira gargalo operacional.

Ferramentas gratuitas de transcrição: o que oferecem e onde travam

YouTube Auto-Caption

O YouTube gera legendas automáticas para vídeos públicos ou não listados. Precisão varia com ruído de fundo e sotaque; inglês e português brasileiro têm suporte maduro.

Limites:

  • Exige upload do vídeo inteiro na plataforma
  • Processamento pode levar minutos a horas (fila variável)
  • Edição só no YouTube Studio; exportar .srt exige passos manuais
  • Privacidade: vídeo fica no Google Cloud

Quando usar: casos isolados, conteúdo já destinado ao YouTube, sem SLA de tempo.

Google Docs — digitação por voz

O Google Docs aceita entrada de áudio ao vivo via microfone. Reproduzir o áudio do vídeo enquanto o Docs captura simula transcrição.

Limites:

  • Sessão de até ~10 minutos contínuos antes de pausar reconhecimento
  • Pontuação automática irregular
  • Requer reprodução em tempo real (1 hora de vídeo = 1 hora de trabalho)
  • Ruído ambiente do local interfere na captura

Quando usar: vídeos curtos, sem orçamento para API, ambiente silencioso.

Otter.ai (plano gratuito)

Otter oferece 600 minutos/mês no plano Free, com transcrição em tempo real e interface colaborativa. Suporta upload de áudio/vídeo.

Limites:

  • Teto de 40 minutos por arquivo
  • 600 min/mês compartilhados entre todas as gravações
  • Exportação ilimitada, mas sincronização de alto-falantes limitada
  • Inglês nativo; português via planos pagos

Quando usar: reuniões em inglês, volume previsível <10h/mês, equipe pequena.

Comparativo: ferramentas gratuitas

Ferramenta Limite/arquivo Limite/mês Idiomas PT-BR Exportação
YouTube Auto Ilimitado Ilimitado Sim .srt
Google Docs voz ~10 min Ilimitado Sim Copiar
Otter.ai Free 40 min 600 min Não (pago) TXT, SRT

Nenhuma oferece API, processamento batch ou integração com pipelines de automação. Toda transcrição exige intervenção manual.

Quando a transcrição gratuita vira gargalo

Volume ultrapassa o teto mensal

Empresa com 4 webinars de 90 min/mês já consome 360 minutos. Otter Free cobre, mas adicionar podcasts semanais estoura a cota.

Pagar plano intermediário (US$ 8–16/mês/usuário) resolve até ~1.200 min. Acima disso, custo por minuto das SaaS supera self-hosting de modelo local.

Latência de processamento afeta SLA

Serviços gratuitos processam em fila compartilhada. YouTube pode levar 2 horas para legendar vídeo de 30 min; Otter Free enfileira uploads grandes.

Conteúdo urgente (ata de decisão, transcrição para release) não tolera espera de horas.

Privacidade e conformidade com LGPD

Upload para YouTube, Google ou Otter move dados para servidores fora do controle da empresa. Termos de serviço permitem análise para treino de IA.

Discussões com dados sensíveis, PII de clientes ou estratégia interna exigem processamento local ou em VPS próprio.

Automatizar transcrição com IA: arquitetura e trade-offs

Whisper (OpenAI) — modelo open-source local

Whisper é o modelo de transcrição da OpenAI, disponível como código aberto no GitHub. Roda em CPU (lento) ou GPU (5–10× mais rápido).

Especificações mínimas:

  • Modelo base: 1 GB RAM, CPU multicore (transcreve 1 min de áudio em ~30 s)
  • Modelo medium: 5 GB VRAM GPU, transcreve 1 min em ~5 s
  • Modelo large-v3: 10 GB VRAM, maior precisão, ~8 s/min de áudio

Instalação em VPS (exemplo Ubuntu 22.04):

apt update && apt install -y python3-pip ffmpeg
pip3 install openai-whisper
whisper audio.mp3 --model medium --language pt --output_format txt

Processamento roda offline, sem envio de dados. Arquivos de log e transcrições ficam no servidor.

Para volumes altos, servidor para IA com GPU reduz tempo de fila. VPS PRO 30 (4 vCPU, 8 GB RAM) roda modelo medium a ~R$ 259,90/mês, sem limite de minutos transcritos.

Pipeline automatizado com n8n + Whisper

n8n é orquestrador de automação self-hosted. Workflow típico:

  1. Trigger: Webhook ouwatch folder (Dropbox, S3, pasta local)
  2. Download: puxa vídeo/áudio novo
  3. Conversão: FFmpeg extrai áudio .wav 16 kHz mono
  4. Transcrição: executa whisper via CLI
  5. Pós-processamento: limpa pontuação, identifica speakers (pyannote), envia para banco/Notion/Slack

VPS para n8n Start (R$ 89/mês) inclui n8n + Traefik + Evolution API pré-configurados. Adicionar Whisper via Docker:

version: '3.8'
services:
  whisper:
    image: onerahmet/openai-whisper-asr-webservice:latest
    ports:
      - "9000:9000"
    environment:
      - ASR_MODEL=medium
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]

n8n chama endpoint HTTP local, transcrição roda sem latência de rede externa.

API Whisper (OpenAI) vs. self-hosted: custo real

Critério API OpenAI Whisper Whisper self-hosted (VPS GPU)
Custo/hora áudio US$ 0,36 R$ 0 (fixo mensal VPS)
Breakeven ~720 min/mês (12h) VPS R$ 259,90 = ~40h/mês
Latência 10–30 s/min 5–8 s/min (GPU local)
Privacidade Upload OpenAI 100% local
Suporte idiomas 57 idiomas 57 idiomas (mesmo modelo)

Acima de 40 horas/mês, VPS próprio amortiza custo. Servidor GPU permite rodar modelos maiores (large-v3) com precisão superior.

Hermes: agente de IA para transcrição em escala

Hermes é o agente de IA da Rollin Host que processa documentos, áudio e vídeo. Integra Whisper + GPT-4 para transcrição + resumo/extração de tópicos.

Como funciona

  1. Upload via interface web ou API
  2. Whisper transcreve áudio
  3. GPT-4 analisa transcrição: extrai ação items, gera resumo executivo, identifica decisões
  4. Entrega texto estruturado (Markdown, JSON, integração Slack/Notion)

Plano Hermes Solo (R$ 56,90/mês) processa até 200 minutos de áudio/mês. Hermes Pro (R$ 89,90) libera 500 min + prioridade de fila.

Diferencial: transcrição + análise semântica em único pipeline. Ideal para equipes que precisam de atas formatadas, não só texto bruto.

Quando escolher cada caminho

Ferramentas gratuitas

  • Volume <10 vídeos/mês, <60 min cada
  • Sem requisito de privacidade estrita
  • Conteúdo público ou destinado a plataformas (YouTube)
  • Orçamento zero, aceita intervenção manual

Whisper self-hosted

  • Volume >40 horas/mês
  • Dados confidenciais (LGPD, compliance)
  • Necessidade de API local para integração
  • Equipe técnica para manter VPS

Agente Hermes ou API Whisper (OpenAI)

  • Volume 10–40 horas/mês
  • Precisa de análise pós-transcrição (resumo, tags)
  • Sem equipe de infra para gerenciar servidor
  • SLA de <30 min/arquivo

Principais aprendizados

  • Ferramentas gratuitas limitam volume (600 min/mês Otter) e exigem upload manual, adequadas para uso esporádico.
  • Whisper self-hosted em VPS GPU processa horas ilimitadas a custo fixo mensal; breakeven em ~40h para VPS R$ 259,90.
  • Pipeline n8n + Whisper automatiza ingestão e entrega, eliminando trabalho manual de upload/download.
  • API Whisper (OpenAI) custa US$ 0,36/hora; competitivo até ~12h/mês, depois self-hosting amortiza.
  • Hermes combina transcrição + análise de IA; entrega texto estruturado pronto para publicação.

Perguntas frequentes

Qual a ferramenta gratuita mais precisa para português?

YouTube Auto-Caption e Otter.ai (plano pago) lideram em português brasileiro. Google Docs voz tem precisão menor com sotaques regionais.

Whisper roda em VPS sem GPU?

Sim, mas transcreve 5–10× mais lento. Modelo base em CPU processa 1 min de áudio em ~30–60 s; com GPU cai para ~5 s.

Posso integrar Whisper com CRM ou Notion?

Sim. n8n ou Zapier chamam Whisper via HTTP (container webservice), pegam resposta JSON e postam em webhook de destino. VPS para n8n facilita setup.

API Whisper da OpenAI guarda os áudios enviados?

Segundo política de 2026, OpenAI não treina modelos com dados de API, mas armazena por 30 dias para debug. Self-hosting garante que arquivo nunca sai do servidor.

Hermes suporta vídeos de quanto tempo?

Hermes Solo processa arquivos de até 60 min; Hermes Pro aceita até 3 horas por arquivo. Vídeos maiores precisam corte prévio ou VPS custom.

Vale a pena GPU dedicada só para transcrição?

Se volume ultrapassar 100 horas/mês, GPU amortiza. Abaixo disso, VPS CPU com modelo medium + paciência de 10–15 s/min atende. Servidor para LLMs oferece GPU compartilhada a partir de R$ 599/mês para quem roda também embeddings ou fine-tuning.


Precisa automatizar transcrição com controle total? Configure Whisper + n8n em VPS para n8n ou teste o Hermes com análise de IA inclusa. Fale com o suporte via WhatsApp e receba proposta em até 1 hora.