Migração 100% grátis na contratação semestral · nossa equipe migra tudo de qualquer provedor · novos clientes Migrar agora
Agente de IA no WhatsApp na API Oficial da Meta · somos Tech Provider aprovado · orçamento sob consulta Pedir orçamento
VPS com OpenClaw pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
VPS com Hermes Agent pré-instalado · a partir de R$ 56,90/mês · gerenciada pela Rollin Quero a VPS
Hospedagem com 30 dias de garantia · Não gostou? Devolvemos 100%, sem perguntas. Ver hospedagem

LLMs self-hosted · Visión general

Cuándo tiene sentido ejecutar LLMs en tu propio servidor con Ollama, vLLM o llama.cpp, y cómo elegir el modelo, el hardware y el runtime.

Ejecutar un LLM propio resuelve 3 problemas: costo predecible en alto volumen, datos que no pueden salir de tu infraestructura (LGPD, compliance) y latencia mínima cuando el LLM está en el mismo data center que la aplicación.

Cuándo NO tiene sentido

Si respondes sí a alguna de las tres, quédate con GPT/Claude

  • ¿Volumen < 10 millones de tokens/mes? OpenAI/Anthropic sale más barato
  • ¿Necesitas razonamiento de nivel GPT-4o? Los modelos open todavía están un escalón abajo
  • ¿No tienes a nadie para monitorear 24/7? Una GPU que se cae a las 3 de la mañana no tiene soporte de Anthropic

Cuándo tiene todo el sentido

  • Volumen alto (50M+ tokens/mes): el servidor se paga en 2-3 meses
  • Datos sensibles que no pueden ir a una API externa (salud, legal, financiero)
  • Embeddings a escala (RAG con millones de documentos)
  • Inferencia batch (resumen de llamadas, clasificación de tickets)

Guías

Hardware recomendado

ModeloCuantizaciónVRAM mínimaPlan sugerido
Llama 3 8BQ4_K_M8 GBGPU Estação
Llama 3 70BQ4_K_M48 GBGPU Estúdio
Llama 3.1 405BQ4_K_M240 GBGPU Cluster
Qwen 2.5 72BQ4_K_M48 GBGPU Estúdio
DeepSeek V3 (671B)FP88× H100bajo consulta

Costo comparativo

EscenarioOpenAI GPT-4oLlama 3 70B (self-hosted)
10M tokens/mesR$ 750R$ 4.500 (servidor ocioso)
100M tokens/mesR$ 7.500R$ 4.500
1B tokens/mesR$ 75.000R$ 4.500 (con cola)

Por encima de 20-30M tokens/mes, el self-hosted empieza a tener sentido.

Última actualización: