Migração 100% grátis · nossa equipe migra tudo pra você e o 1º mês fica por nossa conta · novos clientes Migrar agora
Agente de IA no WhatsApp por R$ 299/mês · stack montada e gerenciada pelo nosso time Quero meu agente
VPS com OpenClaw pré-instalado · 1ª mensalidade de R$ 56,90 por R$ 29,99 (-47%) · gerenciada pela Rollin Quero a VPS
VPS com Hermes Agent pré-instalado · 1ª mensalidade de R$ 56,90 por R$ 29,99 (-47%) · gerenciada pela Rollin Quero a VPS
Hospedagem com 30 dias de garantia · Não gostou? Devolvemos 100%, sem perguntas. Ver hospedagem
#scraping#automacao#inteligencia-artificial

Como usar o Firecrawl: guia completo de scraping e indexação para IA

por Equipe Rollin Host · · 9 min de leitura

Como usar o Firecrawl: guia completo de scraping e indexação para IA

Firecrawl é uma API de web scraping desenvolvida pela Mendable que extrai conteúdo de páginas web e retorna dados limpos, estruturados em Markdown ou JSON, prontos para alimentar large language models (LLMs) e pipelines de automação. Diferente de scrapers tradicionais, o Firecrawl executa JavaScript, navega por SPAs (Single Page Applications) e oferece um endpoint de crawling recursivo que mapeia sites inteiros automaticamente.

TL;DR: Firecrawl transforma qualquer URL em dados estruturados (Markdown/JSON) via API REST, com suporte a crawling multi-página, extração de metadata e integração nativa com LLMs e ferramentas no-code como n8n.

A ferramenta ganhou destaque em 2026 por simplificar a ingestão de conhecimento externo em agentes de IA e sistemas RAG (Retrieval-Augmented Generation), eliminando a necessidade de parsers customizados para cada site.


O que é o Firecrawl e como ele funciona?

Firecrawl é uma API REST hospedada (SaaS) que recebe uma URL e devolve o conteúdo renderizado da página em formato limpo. Sob o capô, utiliza Playwright para renderizar páginas dinâmicas (React, Vue, Angular), extrai o DOM, remove elementos de navegação/publicidade e converte o conteúdo principal em Markdown ou JSON estruturado.

O diferencial está em três componentes:

  • Scraping simples (/scrape): uma URL → um documento Markdown/JSON com metadata (título, descrição, imagens).
  • Crawling recursivo (/crawl): inicia em uma URL raiz, descobre links internos, segue-os respeitando regras de profundidade e patterns, retorna um mapa completo do site.
  • Mapeamento de site (/map): gera uma lista de URLs do site sem baixar o conteúdo — útil para planejamento de scraping seletivo.

Cada endpoint aceita parâmetros de filtragem (incluir/excluir URLs via regex, limitar profundidade, aguardar seletores CSS específicos) e opções de formato (Markdown, HTML limpo, structured data via LLM extraction).


Por que usar Firecrawl em vez de scrapers tradicionais?

Bibliotecas como BeautifulSoup e Scrapy exigem manutenção constante: sites mudam estrutura HTML, adicionam JavaScript assíncrono, implementam rate limiting. Firecrawl abstrai essa complexidade em uma API gerenciada.

Vantagens concretas:

  • Renderização JavaScript nativa: SPAs modernas carregam conteúdo via fetch/AJAX — Firecrawl espera a página carregar completamente antes de extrair.
  • Limpeza automática de ruído: remove menus, rodapés, cookies banners, sidebars, mantendo apenas o conteúdo principal (baseado em heurísticas de densidade de texto).
  • Formato otimizado para LLMs: Markdown preserva hierarquia (headings, listas, code blocks) e reduz tokens comparado a HTML bruto — crucial para manter custos de inferência baixos.
  • Crawling em escala sem infra: o endpoint /crawl gerencia fila, respeita robots.txt, distribui requisições — você recebe um webhook quando terminar, sem provisionar workers.

Trade-off honesto: a camada de abstração limita controle granular. Sites com proteção anti-bot avançada (Cloudflare Turnstile, PerimeterX) podem bloquear a infraestrutura do Firecrawl. Para esses casos, scrapers self-hosted com rotação de IP residencial ainda são necessários.


Como fazer scraping de uma única página com Firecrawl

A operação mais básica usa o endpoint POST /v0/scrape. Exemplo via cURL:

curl -X POST https://api.firecrawl.dev/v0/scrape \
  -H 'Authorization: Bearer SEU_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "url": "https://example.com/artigo",
    "formats": ["markdown", "html"]
  }'

Resposta (simplificada):

{
  "success": true,
  "data": {
    "markdown": "# Título do Artigo\n\nPrimeiro parágrafo...",
    "html": "<article>...</article>",
    "metadata": {
      "title": "Título do Artigo",
      "description": "Meta description...",
      "ogImage": "https://example.com/imagem.jpg"
    }
  }
}

Parâmetros úteis:

  • waitFor: aguarda um seletor CSS antes de extrair (útil para conteúdo lazy-loaded).
  • excludeTags: remove tags específicas (['nav', 'footer', 'script']).
  • onlyMainContent: força extração apenas do <main> ou equivalente heurístico.

Para integração com automações no n8n, a Rollin Host oferece VPS para n8n com Traefik e EvolutionAPI pré-configurados — ideal para orquestrar scraping recorrente via HTTP Request node.


Como rastrear um site inteiro com o endpoint Crawl

O endpoint /crawl inicia um job assíncrono que mapeia e extrai múltiplas páginas. Exemplo:

curl -X POST https://api.firecrawl.dev/v0/crawl \
  -H 'Authorization: Bearer SEU_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "url": "https://docs.example.com",
    "crawlerOptions": {
      "includes": ["docs.example.com/guide/*"],
      "excludes": ["*/changelog", "*/api-reference"],
      "maxDepth": 3,
      "limit": 100
    },
    "pageOptions": {
      "onlyMainContent": true
    }
  }'

A API retorna um jobId. Para consultar o progresso:

curl https://api.firecrawl.dev/v0/crawl/status/SEU_JOB_ID \
  -H 'Authorization: Bearer SEU_API_KEY'

Quando status: "completed", o campo data contém um array de objetos, cada um representando uma página extraída (URL + markdown + metadata).

Casos de uso comuns:

  • Ingestão de documentação técnica em vetores para RAG: rastrear /docs, converter Markdown em embeddings, indexar no Supabase Vector ou Pinecone.
  • Monitoramento de concorrentes: crawl periódico de blogs/landing pages, diff de conteúdo, alerta via webhook.
  • Treinamento de modelos: coletar corpus textual limpo de domínios específicos.

Para quem roda LLMs locais (Llama, Mistral) e precisa de infraestrutura com GPU, considere os servidores para IA da Rollin Host, que já incluem Ollama e Open WebUI pré-configurados.


Extração estruturada com LLM (formato JSON)

Além de Markdown, o Firecrawl oferece LLM-based extraction: você descreve o schema desejado e a API usa um modelo (GPT-4 ou similar) para extrair dados estruturados.

Exemplo extraindo dados de produto:

{
  "url": "https://loja.com/produto/123",
  "formats": ["extract"],
  "extract": {
    "schema": {
      "type": "object",
      "properties": {
        "nome": { "type": "string" },
        "preco": { "type": "number" },
        "descricao": { "type": "string" },
        "disponivel": { "type": "boolean" }
      }
    }
  }
}

Resposta:

{
  "success": true,
  "data": {
    "nome": "Notebook XYZ",
    "preco": 3499.90,
    "descricao": "Processador Intel Core i7...",
    "disponivel": true
  }
}

Esse modo consome tokens de LLM (cobrados à parte no plano) mas elimina regex/parsers frágeis — ideal para sites com HTML inconsistente.


Limites de uso e preços do Firecrawl

Firecrawl opera em planos baseados em créditos. Cada scrape/crawl consome créditos proporcionais ao volume (páginas × complexidade).

Plano Créditos/mês Preço (USD) Crawl simultâneo LLM extraction
Hobby 500 $0 (free) 1 job Limitado
Standard 10.000 $49 5 jobs Incluído
Growth 100.000 $299 20 jobs Incluído
Enterprise Custom Custom Ilimitado Dedicado

1 crédito ≈ 1 página simples. Páginas com JavaScript pesado ou extraction via LLM consomem 3–5 créditos.

Rate limit: plano Standard aceita 10 req/s; Growth até 50 req/s.

Alternativa self-hosted: Firecrawl é open-source (Apache 2.0 no GitHub: mendableai/firecrawl). É possível rodar em VPS próprio via Docker, eliminando custos recorrentes — mas você gerencia infra, proxies, manutenção de dependências (Playwright, Redis para filas). Para deploys self-hosted escaláveis, a Rollin Host oferece servidores cloud com CPU dedicada e NVMe, ideais para workloads de scraping intensivo.


Integração com ferramentas no-code e frameworks de IA

Firecrawl possui integrações nativas com:

  • LangChain (Python/JS): loader FirecrawlLoader converte URLs em Document objects prontos para vector stores.
  • n8n: node HTTP Request aponta para a API + webhook listener para crawls assíncronos.
  • Make (Integromat): módulo HTTP + iteradores para processar arrays de páginas.
  • Zapier: via Webhooks by Zapier (trigger no fim do crawl).

Exemplo LangChain (Python):

from langchain.document_loaders import FirecrawlLoader

loader = FirecrawlLoader(
    api_key="SEU_API_KEY",
    url="https://docs.example.com",
    mode="crawl"
)
docs = loader.load()
# docs é lista de Document com page_content (markdown) e metadata

Para automações complexas (scraping → processamento com LLM → armazenamento), a stack n8n + Flowise + Supabase roda completa em uma VPS para n8n da Rollin Host, com provisionamento em ~5 minutos.


Boas práticas e considerações de compliance

Web scraping levanta questões legais e técnicas. Diretrizes recomendadas:

  • Respeite robots.txt e ToS: Firecrawl respeita robots.txt por padrão, mas o uso final dos dados é responsabilidade do cliente. Não raspe sites que proíbem scraping nos termos de serviço.
  • Rate limiting consciente: mesmo com API gerenciada, evite crawls massivos simultâneos que sobrecarreguem sites pequenos.
  • Armazene metadata de origem: guarde URL, timestamp do scrape, checksum do conteúdo — essencial para auditoria e atribuição de fonte.
  • LGPD/GDPR: se o conteúdo extraído inclui dados pessoais, você é controlador/processador — aplique as salvaguardas legais (anonimização, consentimento, direito ao esquecimento).

Fallback para sites bloqueados: Firecrawl pode falhar em sites com Cloudflare Challenge ou login obrigatório. Soluções:

  • Configurar headers customizados (User-Agent, cookies de sessão).
  • Usar o parâmetro actions (cliques, preenchimento de form) — experimental.
  • Migrar para scraper self-hosted com Puppeteer Stealth + proxies residenciais.

Principais aprendizados

  • Firecrawl transforma URLs em Markdown/JSON limpo via API REST, renderizando JavaScript e filtrando ruído — ideal para alimentar LLMs e RAG.
  • O endpoint /crawl rastreia sites inteiros com regras de profundidade e patterns, retornando dados via webhook assíncrono.
  • LLM extraction permite definir schemas JSON e extrair dados estruturados sem parsers, consumindo tokens adicionais.
  • Planos variam de gratuito (500 créditos/mês) a enterprise; versão self-hosted open-source disponível para deploys customizados.
  • Integra nativamente com LangChain, n8n, Make e frameworks de IA, acelerando desenvolvimento de agentes e automações.

Perguntas frequentes

Firecrawl funciona com sites que exigem login?

Sim, via parâmetro headers é possível passar cookies de sessão válidos. Para fluxos complexos (OAuth, CAPTCHA), a API experimental actions permite simular cliques e preenchimento de formulários, mas a confiabilidade é menor.

Quanto custa raspar 10.000 páginas por mês?

No plano Standard ($49/mês, 10.000 créditos), páginas simples consomem 1 crédito cada — suficiente para ~10.000 páginas. Páginas com LLM extraction (3–5 créditos) exigiriam o plano Growth ($299/mês, 100.000 créditos).

Posso usar Firecrawl para monitoramento contínuo de preços?

Sim, configurando crawls recorrentes via cron/n8n. Para scrapers de alta frequência (verificação a cada minuto), a versão self-hosted é mais econômica — hospede em VPS com IP dedicado para evitar rate limits compartilhados.

Firecrawl extrai conteúdo de PDFs e imagens?

Não nativamente. A API processa HTML/JavaScript. PDFs precisam ser baixados separadamente e parseados com PyPDF2/pdfplumber; imagens exigem OCR (Tesseract, Google Vision). Para pipelines multimodais, combine Firecrawl (texto) + ferramentas especializadas (PDFs, imagens) orquestradas via n8n.

É legal fazer scraping de qualquer site?

Não. Scraping de dados públicos para fins informativos geralmente é tolerado, mas violar termos de serviço ou extrair dados pessoais sem base legal (LGPD/GDPR) é arriscado. Sites como LinkedIn e Meta proíbem scraping explicitamente e processam violadores. Sempre consulte jurídico antes de scrapar em escala comercial.

Qual a diferença entre Firecrawl e Puppeteer/Playwright?

Firecrawl é API gerenciada SaaS com limpeza automática de HTML e formato otimizado para LLM; Puppeteer/Playwright são bibliotecas que exigem código, infra própria, manutenção de seletores. Firecrawl acelera MVPs; Puppeteer oferece controle total para casos complexos (automação de UI, testes E2E).


Comece a integrar scraping estruturado em suas automações

Firecrawl reduz o esforço de transformar conteúdo web em dados prontos para IA — de horas de parser customizado para uma chamada de API.

Se você está construindo agentes de IA, sistemas RAG ou automações que precisam de conhecimento externo atualizado, experimente combinar Firecrawl com infraestrutura otimizada: servidores para LLMs para inferência local, VPS para n8n para orquestração de workflows, ou hospedagem para IA com Ollama + Open WebUI pré-configurados.

Precisa de ajuda para integrar scraping em sua stack de automação? O suporte 24/7 da Rollin Host (em português, com equipe técnica brasileira) pode orientar a arquitetura ideal para seu caso de uso — desde deploys self-hosted até integrações com APIs de terceiros. Entre em contato e simplifique a coleta de dados para seus projetos de IA.