Só CPU, com dimensionamento honesto

VPS para Ollama
para LLMs privados na CPU

Rode modelos de linguagem abertos e pequenos com o Ollama em um servidor KVM na Alemanha. Seus prompts e dados ficam na sua própria máquina, com uma API simples para seus apps e agentes.

Para que serve uma VPS com Ollama

Modelos pequenos na CPU são mais lentos que numa GPU, e para muitas tarefas isso não é problema nenhum.

Privado por natureza

Prompts, documentos e respostas nunca saem do seu servidor. Útil para ferramentas internas, dados pessoais e tudo o que você prefere não enviar a um fornecedor de IA.

API local para seus apps

O Ollama expõe uma API HTTP que muitas ferramentas já suportam, então n8n, OpenClaw, bots e seu próprio código podem chamar o modelo diretamente.

Embeddings para busca e RAG

Modelos de embedding são pequenos e rápidos na CPU. Indexe seus documentos e alimente uma busca semântica sem pagar por token.

vCPU e RAM dedicadas

A inferência usa todos os núcleos que você der a ela. Planos KVM com vCPU reservada mantêm a velocidade de tokens estável, sem variar por causa dos vizinhos.

NVMe para carregar modelos rápido

Modelos quantizados têm vários gigabytes cada. O armazenamento NVMe carrega esses modelos na memória rapidamente e guarda alguns ao mesmo tempo.

Sem GPU, dito logo de cara

Nossos planos são só CPU. Espere alguns tokens por segundo em modelos pequenos, não a velocidade de um serviço de chat hospedado.

Planos de VPS para Ollama

Planos com pelo menos 8 GB de RAM. Todos só com CPU. Os preços são mensais para o orçamento, com cobrança por hora.

VPS-4
$12.16/mês
$0.0167/hora
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
Tráfego
32 TB

Ideal para: Modelos quantizados de 3B a 4B e embeddings para busca

Contratar VPS-4
VPS-5
$18.24/mês
$0.0250/hora
CPU
6 vCPU
RAM
12 GB
NVMe
192 GB
Tráfego
32 TB
Contratar VPS-5
VPS-6
$24.12/mês
$0.0330/hora
CPU
6 vCPU
RAM
16 GB
NVMe
256 GB
Tráfego
32 TB

Ideal para: Um modelo quantizado de 7B a 8B para uso privado via API

Contratar VPS-6
VPS-7
$33.45/mês
$0.0458/hora
CPU
8 vCPU
RAM
24 GB
NVMe
320 GB
Tráfego
32 TB

Ideal para: 7B a 8B com contexto mais longo ou dois modelos, mais vCPU

Contratar VPS-7
n1.medium
$116.80/mês
$0.1600/hora
CPU
8 vCPU
RAM
8 GB
NVMe
64 GB
Tráfego
Ilimitado
Contratar n1.medium

Ver todos os planos e preços

O que esperar de um LLM em uma VPS com CPU

Nenhum dos nossos planos inclui GPU, então o Ollama roda os modelos na CPU. Isso funciona bem para modelos quantizados pequenos, na faixa de 1B a 8B, e não funciona para modelos grandes com dezenas de bilhões de parâmetros. A velocidade é modesta: alguns tokens por segundo em um modelo de 7B ou 8B, mais rápido em modelos de 3B e 4B, dependendo do número de vCPU.

Essa velocidade combina mais com trabalho em segundo plano do que com chat ao vivo. Classificar tickets de suporte, extrair campos de textos, resumir documentos durante a noite, marcar conteúdo ou gerar embeddings são tarefas em que ninguém fica olhando o texto aparecer. Para um assistente interativo, um modelo menor dá um tempo de resposta mais agradável, e o streaming da resposta token a token faz a espera parecer menor.

Quanta RAM cada tamanho de modelo precisa

O modelo inteiro precisa caber na memória, com espaço para a janela de contexto e o sistema operacional. Para modelos de 3B e 4B com quantização de 4 bits, 8 GB de RAM são um começo viável, o que corresponde ao VPS-4, com 4 vCPU. Mais vCPU significa mais tokens por segundo, então o número de núcleos importa quase tanto quanto a memória.

Para modelos de 7B e 8B, conte com 16 a 24 GB. Só os pesos ocupam vários gigabytes, e um contexto mais longo, um segundo modelo carregado ou um modelo de embedding ao lado consomem o resto rapidinho. O VPS-6, com 16 GB, serve bem para um modelo desse porte, e o VPS-7, com 24 GB e 8 vCPU, oferece a melhor velocidade que temos.

  • 8 GB de RAM: modelos quantizados de 3B a 4B e modelos de embedding.
  • 16 GB de RAM: um modelo quantizado de 7B a 8B.
  • 24 GB de RAM: modelos de 7B a 8B com contexto longo ou um segundo modelo.

Configurando o Ollama e mantendo tudo privado

A instalação é manual e rápida. Nosso guia passo a passo cobre a conexão por SSH, a instalação do Ollama no Ubuntu, o download de um modelo e o teste pela linha de comando. O Ollama roda como serviço do sistema e volta a iniciar após um reboot, então a API fica pronta sempre que suas aplicações a chamarem.

Por padrão, o Ollama escuta só no localhost e não tem autenticação embutida. Mantenha assim se seus apps rodam no mesmo servidor. Se precisar acessá-lo de outro lugar, use um túnel SSH ou coloque-o atrás de um proxy reverso com HTTPS e senha, e nunca abra a porta do Ollama para toda a internet.

Combinando o Ollama com agentes e automação

O Ollama fica mais útil quando outras ferramentas o chamam. O n8n pode enviar cada novo envio de formulário a um modelo local para classificação. O OpenClaw e outros agentes podem usá-lo para subtarefas baratas enquanto um modelo hospedado cuida do raciocínio mais difícil. Um bot de Telegram pode responder perguntas simples a partir dos seus próprios documentos sem taxa por mensagem.

Rodar tudo em uma só VPS mantém a latência baixa e os dados em um só lugar. Dimensione o servidor primeiro para o modelo e depois adicione alguns gigabytes para os outros serviços. Como a cobrança é por hora, você pode testar um modelo em um plano maior por um dia, medir a velocidade e então ficar com o plano que servir.

Guias passo a passo

Escritos pela nossa equipe e testados em servidores DataPasa. Os guias estão em inglês.

Perguntas frequentes sobre VPS para Ollama

Sim, modelos quantizados pequenos rodam na CPU com o Ollama. Espere alguns tokens por segundo em modelos de 7B e 8B e respostas mais rápidas em modelos de 3B e 4B. Modelos grandes não são viáveis na CPU.

Cerca de 8 GB para modelos quantizados de 3B a 4B, e de 16 a 24 GB para modelos de 7B a 8B, para sobrar espaço para o contexto, o sistema e outros serviços.

Não. Todos os nossos planos são só CPU, com vCPU e RAM dedicadas. Para modelos grandes ou chat interativo rápido, você precisa de um servidor com GPU, que no momento não oferecemos.

Seus prompts e dados ficam no seu servidor e não são enviados a um fornecedor de modelos. Mantenha a API do Ollama no localhost ou atrás de autenticação, porque ela não tem senha própria.

Classificação, extração, resumos, embeddings para busca semântica e subtarefas baratas para agentes e ferramentas de automação como o n8n. Tarefas que rodam em segundo plano combinam melhor com a velocidade da CPU.

Sim. Recarregue a partir de $5 com USDT, BTC, ETH, XMR e muitas outras moedas, ou com cartão. O servidor é cobrado por hora a partir do seu saldo.

Rode seu próprio modelo no seu próprio servidor

Escolha um plano com RAM suficiente para o seu modelo, siga o guia e chame sua API privada em minutos.