LLMs self-hosted · Visión general
Cuándo tiene sentido ejecutar LLMs en tu propio servidor con Ollama, vLLM o llama.cpp, y cómo elegir el modelo, el hardware y el runtime.
Ejecutar un LLM propio resuelve 3 problemas: costo predecible en alto volumen, datos que no pueden salir de tu infraestructura (LGPD, compliance) y latencia mínima cuando el LLM está en el mismo data center que la aplicación.
Cuándo NO tiene sentido
Si respondes sí a alguna de las tres, quédate con GPT/Claude
- ¿Volumen < 10 millones de tokens/mes? OpenAI/Anthropic sale más barato
- ¿Necesitas razonamiento de nivel GPT-4o? Los modelos open todavía están un escalón abajo
- ¿No tienes a nadie para monitorear 24/7? Una GPU que se cae a las 3 de la mañana no tiene soporte de Anthropic
Cuándo tiene todo el sentido
- Volumen alto (50M+ tokens/mes): el servidor se paga en 2-3 meses
- Datos sensibles que no pueden ir a una API externa (salud, legal, financiero)
- Embeddings a escala (RAG con millones de documentos)
- Inferencia batch (resumen de llamadas, clasificación de tickets)
Guías
Instalar Ollama en un VPS
La forma más rápida de ejecutar Llama 3, Qwen y DeepSeek con API compatible con OpenAI.
Servir Llama 3 con vLLM
Para producción: throughput 5x mayor que Ollama gracias al continuous batching.
Hardware recomendado
| Modelo | Cuantización | VRAM mínima | Plan sugerido |
|---|---|---|---|
| Llama 3 8B | Q4_K_M | 8 GB | GPU Estação |
| Llama 3 70B | Q4_K_M | 48 GB | GPU Estúdio |
| Llama 3.1 405B | Q4_K_M | 240 GB | GPU Cluster |
| Qwen 2.5 72B | Q4_K_M | 48 GB | GPU Estúdio |
| DeepSeek V3 (671B) | FP8 | 8× H100 | bajo consulta |
Costo comparativo
| Escenario | OpenAI GPT-4o | Llama 3 70B (self-hosted) |
|---|---|---|
| 10M tokens/mes | R$ 750 | R$ 4.500 (servidor ocioso) |
| 100M tokens/mes | R$ 7.500 | R$ 4.500 |
| 1B tokens/mes | R$ 75.000 | R$ 4.500 (con cola) |
Por encima de 20-30M tokens/mes, el self-hosted empieza a tener sentido.
Última actualización: