Rode modelos de linguagem abertos e pequenos com o Ollama em um servidor KVM na Alemanha. Seus prompts e dados ficam na sua própria máquina, com uma API simples para seus apps e agentes.
Modelos pequenos na CPU são mais lentos que numa GPU, e para muitas tarefas isso não é problema nenhum.
Privado por natureza
Prompts, documentos e respostas nunca saem do seu servidor. Útil para ferramentas internas, dados pessoais e tudo o que você prefere não enviar a um fornecedor de IA.
API local para seus apps
O Ollama expõe uma API HTTP que muitas ferramentas já suportam, então n8n, OpenClaw, bots e seu próprio código podem chamar o modelo diretamente.
Embeddings para busca e RAG
Modelos de embedding são pequenos e rápidos na CPU. Indexe seus documentos e alimente uma busca semântica sem pagar por token.
vCPU e RAM dedicadas
A inferência usa todos os núcleos que você der a ela. Planos KVM com vCPU reservada mantêm a velocidade de tokens estável, sem variar por causa dos vizinhos.
NVMe para carregar modelos rápido
Modelos quantizados têm vários gigabytes cada. O armazenamento NVMe carrega esses modelos na memória rapidamente e guarda alguns ao mesmo tempo.
Sem GPU, dito logo de cara
Nossos planos são só CPU. Espere alguns tokens por segundo em modelos pequenos, não a velocidade de um serviço de chat hospedado.
Planos de VPS para Ollama
Planos com pelo menos 8 GB de RAM. Todos só com CPU. Os preços são mensais para o orçamento, com cobrança por hora.
VPS-4
$12.16/mês
$0.0167/hora
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
Tráfego
32 TB
Ideal para: Modelos quantizados de 3B a 4B e embeddings para busca
Nenhum dos nossos planos inclui GPU, então o Ollama roda os modelos na CPU. Isso funciona bem para modelos quantizados pequenos, na faixa de 1B a 8B, e não funciona para modelos grandes com dezenas de bilhões de parâmetros. A velocidade é modesta: alguns tokens por segundo em um modelo de 7B ou 8B, mais rápido em modelos de 3B e 4B, dependendo do número de vCPU.
Essa velocidade combina mais com trabalho em segundo plano do que com chat ao vivo. Classificar tickets de suporte, extrair campos de textos, resumir documentos durante a noite, marcar conteúdo ou gerar embeddings são tarefas em que ninguém fica olhando o texto aparecer. Para um assistente interativo, um modelo menor dá um tempo de resposta mais agradável, e o streaming da resposta token a token faz a espera parecer menor.
Quanta RAM cada tamanho de modelo precisa
O modelo inteiro precisa caber na memória, com espaço para a janela de contexto e o sistema operacional. Para modelos de 3B e 4B com quantização de 4 bits, 8 GB de RAM são um começo viável, o que corresponde ao VPS-4, com 4 vCPU. Mais vCPU significa mais tokens por segundo, então o número de núcleos importa quase tanto quanto a memória.
Para modelos de 7B e 8B, conte com 16 a 24 GB. Só os pesos ocupam vários gigabytes, e um contexto mais longo, um segundo modelo carregado ou um modelo de embedding ao lado consomem o resto rapidinho. O VPS-6, com 16 GB, serve bem para um modelo desse porte, e o VPS-7, com 24 GB e 8 vCPU, oferece a melhor velocidade que temos.
8 GB de RAM: modelos quantizados de 3B a 4B e modelos de embedding.
16 GB de RAM: um modelo quantizado de 7B a 8B.
24 GB de RAM: modelos de 7B a 8B com contexto longo ou um segundo modelo.
Configurando o Ollama e mantendo tudo privado
A instalação é manual e rápida. Nosso guia passo a passo cobre a conexão por SSH, a instalação do Ollama no Ubuntu, o download de um modelo e o teste pela linha de comando. O Ollama roda como serviço do sistema e volta a iniciar após um reboot, então a API fica pronta sempre que suas aplicações a chamarem.
Por padrão, o Ollama escuta só no localhost e não tem autenticação embutida. Mantenha assim se seus apps rodam no mesmo servidor. Se precisar acessá-lo de outro lugar, use um túnel SSH ou coloque-o atrás de um proxy reverso com HTTPS e senha, e nunca abra a porta do Ollama para toda a internet.
Combinando o Ollama com agentes e automação
O Ollama fica mais útil quando outras ferramentas o chamam. O n8n pode enviar cada novo envio de formulário a um modelo local para classificação. O OpenClaw e outros agentes podem usá-lo para subtarefas baratas enquanto um modelo hospedado cuida do raciocínio mais difícil. Um bot de Telegram pode responder perguntas simples a partir dos seus próprios documentos sem taxa por mensagem.
Rodar tudo em uma só VPS mantém a latência baixa e os dados em um só lugar. Dimensione o servidor primeiro para o modelo e depois adicione alguns gigabytes para os outros serviços. Como a cobrança é por hora, você pode testar um modelo em um plano maior por um dia, medir a velocidade e então ficar com o plano que servir.
Guias passo a passo
Escritos pela nossa equipe e testados em servidores DataPasa. Os guias estão em inglês.
Sim, modelos quantizados pequenos rodam na CPU com o Ollama. Espere alguns tokens por segundo em modelos de 7B e 8B e respostas mais rápidas em modelos de 3B e 4B. Modelos grandes não são viáveis na CPU.
Cerca de 8 GB para modelos quantizados de 3B a 4B, e de 16 a 24 GB para modelos de 7B a 8B, para sobrar espaço para o contexto, o sistema e outros serviços.
Não. Todos os nossos planos são só CPU, com vCPU e RAM dedicadas. Para modelos grandes ou chat interativo rápido, você precisa de um servidor com GPU, que no momento não oferecemos.
Seus prompts e dados ficam no seu servidor e não são enviados a um fornecedor de modelos. Mantenha a API do Ollama no localhost ou atrás de autenticação, porque ela não tem senha própria.
Classificação, extração, resumos, embeddings para busca semântica e subtarefas baratas para agentes e ferramentas de automação como o n8n. Tarefas que rodam em segundo plano combinam melhor com a velocidade da CPU.
Sim. Recarregue a partir de $5 com USDT, BTC, ETH, XMR e muitas outras moedas, ou com cartão. O servidor é cobrado por hora a partir do seu saldo.