Migração 100% grátis · nossa equipe migra tudo pra você e o 1º mês fica por nossa conta · novos clientes Migrar agora
Agente de IA no WhatsApp por R$ 299/mês · stack montada e gerenciada pelo nosso time Quero meu agente
VPS com OpenClaw pré-instalado · 1ª mensalidade de R$ 56,90 por R$ 29,99 (-47%) · gerenciada pela Rollin Quero a VPS
VPS com Hermes Agent pré-instalado · 1ª mensalidade de R$ 56,90 por R$ 29,99 (-47%) · gerenciada pela Rollin Quero a VPS
Hospedagem com 30 dias de garantia · Não gostou? Devolvemos 100%, sem perguntas. Ver hospedagem
#ia#vps#muse

Muse Code e Muse Spark 1.2: guia completo para rodar em VPS

por Equipe Rollin Host · · 8 min de leitura

Muse Code e Muse Spark 1.2: guia completo para rodar em VPS

Muse Code e Muse Spark 1.2 são modelos de IA generativa que rodam em infraestrutura própria, exigindo VPS com no mínimo 8GB de RAM para Spark e 16GB+ para Code. GPU não é obrigatória para inferência leve, mas acelera em 3-5x o tempo de resposta — RTX 3060 (12GB) ou superior é o recomendado para produção.

TL;DR: Muse Spark 1.2 (7B parâmetros) roda em CPU com 8GB RAM; Muse Code (15B) exige 16GB+ e GPU para performance aceitável. Setup via Docker + Ollama ou vLLM em Ubuntu 22.04+. Custos mensais de infra variam entre R$119,90 (VPS Pro 20) e R$599+ (servidor dedicado com GPU).

O que são Muse Code e Muse Spark 1.2?

Muse Code é um modelo de linguagem especializado em geração e análise de código, com 15 bilhões de parâmetros, treinado em repositórios públicos e documentação técnica. Suporta 40+ linguagens de programação.

Muse Spark 1.2 é a versão compacta (7B parâmetros) focada em conversação e tarefas gerais, com menor latência e menor consumo de recursos. Ideal para chatbots, assistentes e automação de suporte.

Ambos são modelos open-weight — você baixa os pesos, roda onde quiser, sem enviar dados para APIs externas. É o trade-off clássico: controle total e privacidade em troca de gerenciar a infraestrutura.

Por que rodar em VPS em vez de usar API de terceiros?

A decisão entre servidor para IA próprio e API gerenciada depende de quatro variáveis:

  • Custo recorrente: APIs cobram por token. Em volume alto (>1M tokens/mês), VPS sai mais barato — a partir de 500k tokens mensais o break-even já aparece.
  • Latência e controle: VPS elimina round-trip para datacenter de terceiro. Latência média cai de ~800ms (API) para ~200ms (VPS local).
  • Privacidade: dados nunca saem do seu servidor. Essencial para LGPD, HIPAA ou contratos com cláusulas de residência de dados.
  • Uptime e lock-in: você não depende da disponibilidade (ou mudança de preço) de um provedor externo.

Para quem já processa >10k requisições/dia ou lida com dados sensíveis, self-hosting é o caminho.

Requisitos de hardware para Muse Code e Spark 1.2

Modelo RAM mín. VRAM (GPU) CPU cores Armazenamento Latência média (CPU) Latência média (GPU)
Muse Spark 1.2 8 GB Opcional (6GB+) 4 20 GB ~1.2s/resposta ~0.3s/resposta
Muse Code 16 GB 12 GB+ (recom.) 8 40 GB ~4s/resposta ~0.8s/resposta

GPU: RTX 3060 (12GB), RTX 4060 Ti (16GB), A4000, A5000 ou Tesla T4 (16GB) são opções viáveis. Para produção com concorrência alta, considere RTX 4090 ou A6000.

CPU-only: funciona, mas a latência sobe 3-5x. Aceitável para automações assíncronas (análise de commits noturnos, por exemplo), inviável para chatbots em tempo real.

Na Rollin Host, VPS Pro 30 (8 cores, 16GB RAM, R$259,90/mês) roda Muse Code em CPU. Para GPU, os planos de Servidor GPU começam em configurações customizadas — contato direto para spec e pricing.

Como instalar Muse Spark 1.2 em VPS passo a passo

Exemplo com Ubuntu 22.04, Docker e Ollama (runtime open-source para LLMs).

1. Provisionar a VPS

Escolha um plano com mínimo 8GB RAM, 4 cores, 30GB SSD. VPS Pro 20 (US-East, R$159,90) ou superior atende.

Acesse via SSH:

ssh root@SEU_IP

2. Instalar dependências

Atualize o sistema e instale Docker:

apt update && apt upgrade -y
apt install -y docker.io curl git
systemctl enable --now docker

3. Instalar Ollama

Ollama simplifica o gerenciamento de modelos locais:

curl -fsSL https://ollama.ai/install.sh | sh

Inicie o serviço:

systemctl enable ollama
systemctl start ollama

4. Baixar o modelo Muse Spark 1.2

Ollama puxa os pesos automaticamente:

ollama pull muse-spark:1.2

Primeira execução demora ~10-15 min (download de 4.5GB). Modelos ficam em /usr/share/ollama/.ollama/models.

5. Testar a inferência

Execute uma requisição local:

ollama run muse-spark:1.2 "Explique SOLID em Python"

Resposta em ~1-2s (CPU) ou ~300ms (GPU).

6. Expor API HTTP

Por padrão, Ollama escuta em localhost:11434. Para acessar externamente, edite o serviço:

nano /etc/systemd/system/ollama.service

Adicione na linha Environment:

Environment="OLLAMA_HOST=0.0.0.0:11434"

Reinicie:

systemctl daemon-reload
systemctl restart ollama

Configure firewall (ufw) ou painel de segurança da VPS para liberar porta 11434 apenas para IPs confiáveis.

7. Integrar com aplicações

Exemplo de chamada via curl:

curl http://SEU_IP:11434/api/generate -d '{
  "model": "muse-spark:1.2",
  "prompt": "Crie uma função para validar CPF em JavaScript",
  "stream": false
}'

Bibliotecas Python (LangChain, llama-index) e JavaScript (ollama-js) têm conectores nativos.

Como rodar Muse Code na VPS (modelo maior)

Processo similar, mas com ajustes de memória e GPU.

Diferenças de configuração

  • RAM: mínimo 16GB (32GB recomendado para contextos >8k tokens).
  • GPU obrigatória para latência <2s. RTX 3060 (12GB) é o piso.
  • Contexto: Muse Code suporta até 16k tokens — ajuste num_ctx no Ollama:
ollama run muse-code:latest --num_ctx 16384
  • Quantização: modelos 4-bit (Q4_K_M) reduzem VRAM em ~40% com perda mínima de qualidade. Ideais para GPU com 12GB.

Instalação

ollama pull muse-code:latest

Peso: ~9GB (FP16) ou ~5GB (Q4).

Otimizar para produção

Use vLLM em vez de Ollama para throughput alto (>10 req/s simultâneas):

pip install vllm
python -m vllm.entrypoints.openai.api_server \
  --model muse-code \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.9

vLLM implementa PagedAttention — usa VRAM 2-3x mais eficientemente que Ollama.

Configurações de firewall e segurança

Expor uma API de IA sem autenticação é vetor de ataque e custo inesperado (DDoS via inferência).

Regras obrigatórias

  • IP allowlist: libere porta 11434 apenas para IPs conhecidos (seu frontend, n8n, etc.).
  • Autenticação: coloque proxy reverso (Nginx, Traefik) com auth básica ou token JWT.
  • Rate limiting: limite a 10-20 req/min por IP. No Nginx:
limit_req_zone $binary_remote_addr zone=ai:10m rate=10r/m;

server {
  location /api/generate {
    limit_req zone=ai burst=5;
    proxy_pass http://127.0.0.1:11434;
  }
}
  • SSL obrigatório: use Let's Encrypt. Dados de inferência podem vazar informações sensíveis.

Na Rollin Host, todas as VPS já vêm com proteção anti-DDoS L3/L4 via Cloudflare. Para L7 (application layer), configure WAF no painel ou proxy reverso.

Custos reais de infraestrutura

Comparação de TCO (Total Cost of Ownership) mensal para rodar Muse Code em produção (assumindo 500k tokens/dia):

Cenário Custo/mês Latência média Obs
API OpenAI (GPT-3.5) ~R$800 ~600ms Pay-per-token, sem controle
VPS Pro 30 (CPU-only) R$259,90 ~3.5s Inviável para tempo real
VPS Pro 50 + GPU dedicada R$899 ~0.8s Setup custom, contato direto
Servidor para LLMs (Hawk) R$519,90 ~1.2s CPU dedicada, sem GPU

Break-even entre API e self-hosting: ~400k tokens/dia (com VPS Pro 30) ou ~1M tokens/dia (com GPU dedicada).

Não esqueça custos indiretos: monitoramento (Grafana + Prometheus), backups (snapshots semanais), updates de modelo.

Monitoramento e observabilidade

Rode Prometheus + Grafana para métricas de uso:

docker run -d -p 9090:9090 prom/prometheus
docker run -d -p 3000:3000 grafana/grafana

Métricas críticas:

  • VRAM usage (GPU): nvidia-smi dmon ou Prometheus exporter.
  • Request latency (p50, p95, p99): identifica gargalos.
  • Throughput (req/s): ajuste max_concurrent_requests no vLLM.
  • Model temperature drift: se respostas ficarem repetitivas, restart pode limpar cache corrompido.

Alertas via Webhook (Slack, Discord, API do WhatsApp da Rollin Host) quando latência >3s ou VRAM >90%.

Principais aprendizados

  • Muse Spark 1.2 (7B) roda confortavelmente em VPS de 8GB; Muse Code (15B) exige 16GB+ e GPU para produção.
  • Self-hosting compensa financeiramente a partir de ~400-500k tokens/dia; abaixo disso, API gerenciada pode sair mais barato.
  • Ollama é ideal para prototipagem; vLLM vence em throughput (>10 req/s).
  • Segurança é crítica: IP allowlist, rate limiting, SSL e autenticação são obrigatórios.
  • Custo de infra com GPU começa em ~R$900/mês (custom); CPU-only a partir de R$259,90 (VPS Pro 30).

Perguntas frequentes

Muse Code roda em VPS sem GPU?

Sim, mas a latência sobe para 3-5s por resposta. Aceitável para análises assíncronas (revisão de código noturna), inviável para IDE assistants ou chatbots em tempo real.

Qual a diferença entre Ollama e vLLM?

Ollama é runtime simples, ideal para testar modelos localmente. vLLM implementa PagedAttention e batching avançado — usa VRAM 2-3x melhor e suporta throughput 5-10x maior em produção.

Quanto custa rodar Muse Spark 1.2 por mês?

Com VPS Pro 20 (US-East, R$159,90/mês), você processa ~1M tokens/dia em CPU. Com GPU dedicada (setup custom), sobe para R$899+/mês mas latência cai de ~1.5s para ~300ms.

Posso usar Muse Code em pipelines de CI/CD?

Sim. Integre via API HTTP em hooks do GitHub Actions, GitLab CI ou Jenkins. Exemplo: análise automática de PRs, sugestão de testes unitários, detecção de code smells. Latência tolerável em CPU-only porque não bloqueia o usuário.

Preciso de conhecimento em ML para rodar os modelos?

Não. Ollama abstrai toda a complexidade — você só puxa o modelo e faz requisições HTTP. Para otimizações (quantização, ajuste de contexto), conhecimento básico de GPUs e VRAM ajuda.

Como migrar de API OpenAI para Muse Code sem reescrever código?

vLLM expõe endpoint compatível com OpenAI API (/v1/completions). Basta trocar a URL base e a chave (ou remover auth). Bibliotecas como LangChain funcionam sem mudança.


Quer rodar Muse Code ou Spark 1.2 na sua VPS? Nossa equipe configura o ambiente completo — Ollama ou vLLM, GPU opcional, firewall, SSL e monitoramento — em ~30 minutos. Entre em contato e receba a spec exata para o seu volume de inferência.