RAG con Qdrant + LangChain
Cómo montar un stack de Retrieval-Augmented Generation (RAG) con Qdrant como vector database y LangChain como orquestador en un VPS Rollin Host.
Cuándo usar RAG
Usa Retrieval-Augmented Generation (RAG) cuando necesitas que la IA responda sobre contenido específico (manuales, base de conocimiento interna, documentación de producto) sin entrenar un modelo desde cero. El LLM sigue respondiendo, pero con contexto obtenido de una base vectorial.
Arquitectura
PDF / Markdown / Notion ──▶ embeddings ──▶ Qdrant
│
Pregunta del usuario ──▶ embedding ──▶ search ──▶ contexto + LLM ──▶ respuesta
Stack
- Qdrant: vector database, se ejecuta en Docker
- LangChain (Python o Node): orquestador de chunks, embeddings y prompt
- OpenAI ada-002 o bge-m3 self-hosted: modelo de embeddings
- Servidor: VPS Plus (8 GB RAM, 4 vCPU, 160 GB)
Próximos pasos
Pronto publicaremos el tutorial completo con código listo. Mientras tanto:
- Instalar Ollama en un VPS (para ejecutar embeddings locales)
- n8n + EvolutionAPI + OpenAI (para integrar el RAG con WhatsApp)
Última actualización: