Muse Code e Muse Spark 1.2: guia completo para rodar em VPS
Muse Code e Muse Spark 1.2 são modelos de IA generativa que rodam em infraestrutura própria, exigindo VPS com no mínimo 8GB de RAM para Spark e 16GB+ para Code. GPU não é obrigatória para inferência leve, mas acelera em 3-5x o tempo de resposta — RTX 3060 (12GB) ou superior é o recomendado para produção.
TL;DR: Muse Spark 1.2 (7B parâmetros) roda em CPU com 8GB RAM; Muse Code (15B) exige 16GB+ e GPU para performance aceitável. Setup via Docker + Ollama ou vLLM em Ubuntu 22.04+. Custos mensais de infra variam entre R$119,90 (VPS Pro 20) e R$599+ (servidor dedicado com GPU).
O que são Muse Code e Muse Spark 1.2?
Muse Code é um modelo de linguagem especializado em geração e análise de código, com 15 bilhões de parâmetros, treinado em repositórios públicos e documentação técnica. Suporta 40+ linguagens de programação.
Muse Spark 1.2 é a versão compacta (7B parâmetros) focada em conversação e tarefas gerais, com menor latência e menor consumo de recursos. Ideal para chatbots, assistentes e automação de suporte.
Ambos são modelos open-weight — você baixa os pesos, roda onde quiser, sem enviar dados para APIs externas. É o trade-off clássico: controle total e privacidade em troca de gerenciar a infraestrutura.
Por que rodar em VPS em vez de usar API de terceiros?
A decisão entre servidor para IA próprio e API gerenciada depende de quatro variáveis:
- Custo recorrente: APIs cobram por token. Em volume alto (>1M tokens/mês), VPS sai mais barato — a partir de 500k tokens mensais o break-even já aparece.
- Latência e controle: VPS elimina round-trip para datacenter de terceiro. Latência média cai de ~800ms (API) para ~200ms (VPS local).
- Privacidade: dados nunca saem do seu servidor. Essencial para LGPD, HIPAA ou contratos com cláusulas de residência de dados.
- Uptime e lock-in: você não depende da disponibilidade (ou mudança de preço) de um provedor externo.
Para quem já processa >10k requisições/dia ou lida com dados sensíveis, self-hosting é o caminho.
Requisitos de hardware para Muse Code e Spark 1.2
| Modelo | RAM mín. | VRAM (GPU) | CPU cores | Armazenamento | Latência média (CPU) | Latência média (GPU) |
|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 8 GB | Opcional (6GB+) | 4 | 20 GB | ~1.2s/resposta | ~0.3s/resposta |
| Muse Code | 16 GB | 12 GB+ (recom.) | 8 | 40 GB | ~4s/resposta | ~0.8s/resposta |
GPU: RTX 3060 (12GB), RTX 4060 Ti (16GB), A4000, A5000 ou Tesla T4 (16GB) são opções viáveis. Para produção com concorrência alta, considere RTX 4090 ou A6000.
CPU-only: funciona, mas a latência sobe 3-5x. Aceitável para automações assíncronas (análise de commits noturnos, por exemplo), inviável para chatbots em tempo real.
Na Rollin Host, VPS Pro 30 (8 cores, 16GB RAM, R$259,90/mês) roda Muse Code em CPU. Para GPU, os planos de Servidor GPU começam em configurações customizadas — contato direto para spec e pricing.
Como instalar Muse Spark 1.2 em VPS passo a passo
Exemplo com Ubuntu 22.04, Docker e Ollama (runtime open-source para LLMs).
1. Provisionar a VPS
Escolha um plano com mínimo 8GB RAM, 4 cores, 30GB SSD. VPS Pro 20 (US-East, R$159,90) ou superior atende.
Acesse via SSH:
ssh root@SEU_IP
2. Instalar dependências
Atualize o sistema e instale Docker:
apt update && apt upgrade -y
apt install -y docker.io curl git
systemctl enable --now docker
3. Instalar Ollama
Ollama simplifica o gerenciamento de modelos locais:
curl -fsSL https://ollama.ai/install.sh | sh
Inicie o serviço:
systemctl enable ollama
systemctl start ollama
4. Baixar o modelo Muse Spark 1.2
Ollama puxa os pesos automaticamente:
ollama pull muse-spark:1.2
Primeira execução demora ~10-15 min (download de 4.5GB). Modelos ficam em /usr/share/ollama/.ollama/models.
5. Testar a inferência
Execute uma requisição local:
ollama run muse-spark:1.2 "Explique SOLID em Python"
Resposta em ~1-2s (CPU) ou ~300ms (GPU).
6. Expor API HTTP
Por padrão, Ollama escuta em localhost:11434. Para acessar externamente, edite o serviço:
nano /etc/systemd/system/ollama.service
Adicione na linha Environment:
Environment="OLLAMA_HOST=0.0.0.0:11434"
Reinicie:
systemctl daemon-reload
systemctl restart ollama
Configure firewall (ufw) ou painel de segurança da VPS para liberar porta 11434 apenas para IPs confiáveis.
7. Integrar com aplicações
Exemplo de chamada via curl:
curl http://SEU_IP:11434/api/generate -d '{
"model": "muse-spark:1.2",
"prompt": "Crie uma função para validar CPF em JavaScript",
"stream": false
}'
Bibliotecas Python (LangChain, llama-index) e JavaScript (ollama-js) têm conectores nativos.
Como rodar Muse Code na VPS (modelo maior)
Processo similar, mas com ajustes de memória e GPU.
Diferenças de configuração
- RAM: mínimo 16GB (32GB recomendado para contextos >8k tokens).
- GPU obrigatória para latência <2s. RTX 3060 (12GB) é o piso.
- Contexto: Muse Code suporta até 16k tokens — ajuste
num_ctxno Ollama:
ollama run muse-code:latest --num_ctx 16384
- Quantização: modelos 4-bit (Q4_K_M) reduzem VRAM em ~40% com perda mínima de qualidade. Ideais para GPU com 12GB.
Instalação
ollama pull muse-code:latest
Peso: ~9GB (FP16) ou ~5GB (Q4).
Otimizar para produção
Use vLLM em vez de Ollama para throughput alto (>10 req/s simultâneas):
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model muse-code \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.9
vLLM implementa PagedAttention — usa VRAM 2-3x mais eficientemente que Ollama.
Configurações de firewall e segurança
Expor uma API de IA sem autenticação é vetor de ataque e custo inesperado (DDoS via inferência).
Regras obrigatórias
- IP allowlist: libere porta 11434 apenas para IPs conhecidos (seu frontend, n8n, etc.).
- Autenticação: coloque proxy reverso (Nginx, Traefik) com auth básica ou token JWT.
- Rate limiting: limite a 10-20 req/min por IP. No Nginx:
limit_req_zone $binary_remote_addr zone=ai:10m rate=10r/m;
server {
location /api/generate {
limit_req zone=ai burst=5;
proxy_pass http://127.0.0.1:11434;
}
}
- SSL obrigatório: use Let's Encrypt. Dados de inferência podem vazar informações sensíveis.
Na Rollin Host, todas as VPS já vêm com proteção anti-DDoS L3/L4 via Cloudflare. Para L7 (application layer), configure WAF no painel ou proxy reverso.
Custos reais de infraestrutura
Comparação de TCO (Total Cost of Ownership) mensal para rodar Muse Code em produção (assumindo 500k tokens/dia):
| Cenário | Custo/mês | Latência média | Obs |
|---|---|---|---|
| API OpenAI (GPT-3.5) | ~R$800 | ~600ms | Pay-per-token, sem controle |
| VPS Pro 30 (CPU-only) | R$259,90 | ~3.5s | Inviável para tempo real |
| VPS Pro 50 + GPU dedicada | R$899 | ~0.8s | Setup custom, contato direto |
| Servidor para LLMs (Hawk) | R$519,90 | ~1.2s | CPU dedicada, sem GPU |
Break-even entre API e self-hosting: ~400k tokens/dia (com VPS Pro 30) ou ~1M tokens/dia (com GPU dedicada).
Não esqueça custos indiretos: monitoramento (Grafana + Prometheus), backups (snapshots semanais), updates de modelo.
Monitoramento e observabilidade
Rode Prometheus + Grafana para métricas de uso:
docker run -d -p 9090:9090 prom/prometheus
docker run -d -p 3000:3000 grafana/grafana
Métricas críticas:
- VRAM usage (GPU):
nvidia-smi dmonou Prometheus exporter. - Request latency (p50, p95, p99): identifica gargalos.
- Throughput (req/s): ajuste
max_concurrent_requestsno vLLM. - Model temperature drift: se respostas ficarem repetitivas, restart pode limpar cache corrompido.
Alertas via Webhook (Slack, Discord, API do WhatsApp da Rollin Host) quando latência >3s ou VRAM >90%.
Principais aprendizados
- Muse Spark 1.2 (7B) roda confortavelmente em VPS de 8GB; Muse Code (15B) exige 16GB+ e GPU para produção.
- Self-hosting compensa financeiramente a partir de ~400-500k tokens/dia; abaixo disso, API gerenciada pode sair mais barato.
- Ollama é ideal para prototipagem; vLLM vence em throughput (>10 req/s).
- Segurança é crítica: IP allowlist, rate limiting, SSL e autenticação são obrigatórios.
- Custo de infra com GPU começa em ~R$900/mês (custom); CPU-only a partir de R$259,90 (VPS Pro 30).
Perguntas frequentes
Muse Code roda em VPS sem GPU?
Sim, mas a latência sobe para 3-5s por resposta. Aceitável para análises assíncronas (revisão de código noturna), inviável para IDE assistants ou chatbots em tempo real.
Qual a diferença entre Ollama e vLLM?
Ollama é runtime simples, ideal para testar modelos localmente. vLLM implementa PagedAttention e batching avançado — usa VRAM 2-3x melhor e suporta throughput 5-10x maior em produção.
Quanto custa rodar Muse Spark 1.2 por mês?
Com VPS Pro 20 (US-East, R$159,90/mês), você processa ~1M tokens/dia em CPU. Com GPU dedicada (setup custom), sobe para R$899+/mês mas latência cai de ~1.5s para ~300ms.
Posso usar Muse Code em pipelines de CI/CD?
Sim. Integre via API HTTP em hooks do GitHub Actions, GitLab CI ou Jenkins. Exemplo: análise automática de PRs, sugestão de testes unitários, detecção de code smells. Latência tolerável em CPU-only porque não bloqueia o usuário.
Preciso de conhecimento em ML para rodar os modelos?
Não. Ollama abstrai toda a complexidade — você só puxa o modelo e faz requisições HTTP. Para otimizações (quantização, ajuste de contexto), conhecimento básico de GPUs e VRAM ajuda.
Como migrar de API OpenAI para Muse Code sem reescrever código?
vLLM expõe endpoint compatível com OpenAI API (/v1/completions). Basta trocar a URL base e a chave (ou remover auth). Bibliotecas como LangChain funcionam sem mudança.
Quer rodar Muse Code ou Spark 1.2 na sua VPS? Nossa equipe configura o ambiente completo — Ollama ou vLLM, GPU opcional, firewall, SSL e monitoramento — em ~30 minutos. Entre em contato e receba a spec exata para o seu volume de inferência.