Solo CPU, con requisitos honestos

VPS para Ollama
con LLM privados en CPU

Ejecuta modelos de lenguaje abiertos y pequeños con Ollama en un servidor KVM en Alemania. Tus prompts y datos se quedan en tu propia máquina, con una API sencilla para tus aplicaciones y agentes.

Para qué sirve un VPS con Ollama

Los modelos pequeños en CPU son más lentos que en una GPU, y para muchas tareas eso no es ningún problema.

Privado por diseño

Los prompts, documentos y resultados nunca salen de tu servidor. Útil para herramientas internas, datos personales y todo lo que prefieras no enviar a un proveedor de IA.

API local para tus aplicaciones

Ollama expone una API HTTP que muchas herramientas ya admiten, así que n8n, OpenClaw, bots y tu propio código pueden llamar al modelo directamente.

Embeddings para búsqueda y RAG

Los modelos de embeddings son pequeños y rápidos en CPU. Indexa tus documentos y ofrece búsqueda semántica sin pagar por token.

vCPU y RAM dedicadas

La inferencia usa todos los núcleos que le des. Los planes KVM con vCPU reservadas mantienen estable la velocidad de tokens en lugar de variar según los vecinos.

NVMe para cargar modelos rápido

Cada modelo cuantizado ocupa varios gigabytes. El almacenamiento NVMe los carga rápido en memoria y guarda varios modelos a la vez.

Sin GPU, dicho desde el principio

Nuestros planes son solo CPU. Espera unos pocos tokens por segundo en modelos pequeños, no la velocidad de un servicio de chat alojado.

Planes VPS para Ollama

Planes con al menos 8 GB de RAM. Todos solo con CPU. Precios mensuales para presupuestar, facturados por horas.

VPS-4
$12.16/mes
$0.0167/hora
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
Tráfico
32 TB

Ideal para: Modelos cuantizados de 3B a 4B y embeddings para búsqueda

Contratar VPS-4
VPS-5
$18.24/mes
$0.0250/hora
CPU
6 vCPU
RAM
12 GB
NVMe
192 GB
Tráfico
32 TB
Contratar VPS-5
VPS-6
$24.12/mes
$0.0330/hora
CPU
6 vCPU
RAM
16 GB
NVMe
256 GB
Tráfico
32 TB

Ideal para: Un modelo cuantizado de 7B a 8B para uso privado por API

Contratar VPS-6
VPS-7
$33.45/mes
$0.0458/hora
CPU
8 vCPU
RAM
24 GB
NVMe
320 GB
Tráfico
32 TB

Ideal para: De 7B a 8B con contexto más largo o dos modelos, máximo de vCPU

Contratar VPS-7
n1.medium
$116.80/mes
$0.1600/hora
CPU
8 vCPU
RAM
8 GB
NVMe
64 GB
Tráfico
Ilimitado
Contratar n1.medium

Ver todos los planes y precios

Qué esperar de un LLM en un VPS con CPU

Ninguno de nuestros planes incluye GPU, así que Ollama ejecuta los modelos en la CPU. Funciona bien con modelos cuantizados pequeños, de 1B a 8B, y no funciona con modelos grandes de decenas de miles de millones de parámetros. La velocidad es modesta: unos pocos tokens por segundo en un modelo 7B u 8B, más en modelos 3B y 4B, según el número de vCPU.

Esa velocidad encaja mejor con trabajo en segundo plano que con un chat en vivo. Clasificar tickets de soporte, extraer campos de un texto, resumir documentos durante la noche, etiquetar contenido o generar embeddings son tareas en las que nadie mira cómo aparece el texto. Para un asistente interactivo, un modelo más pequeño da un tiempo de respuesta más agradable, y mostrar la respuesta token a token hace que la espera parezca más corta.

Cuánta RAM necesita cada tamaño de modelo

Todo el modelo tiene que caber en memoria, con espacio para la ventana de contexto y el sistema operativo. Para modelos 3B y 4B con cuantización de 4 bits, 8 GB de RAM son un punto de partida viable, es decir, VPS-4 con 4 vCPU. Más vCPU significa más tokens por segundo, así que el número de núcleos importa casi tanto como la memoria.

Para modelos 7B y 8B, calcula de 16 a 24 GB. Solo los pesos ocupan varios gigabytes, y un contexto más largo, un segundo modelo cargado o un modelo de embeddings al lado consumen rápidamente el resto. VPS-6 con 16 GB encaja bien para uno de esos modelos, y VPS-7 con 24 GB y 8 vCPU ofrece la mejor velocidad que tenemos.

  • 8 GB de RAM: modelos cuantizados de 3B a 4B y modelos de embeddings.
  • 16 GB de RAM: un modelo cuantizado de 7B a 8B.
  • 24 GB de RAM: modelos de 7B a 8B con contexto largo o un segundo modelo.

Cómo configurar Ollama y mantenerlo privado

La instalación es manual y rápida. Nuestra guía paso a paso explica cómo conectarte por SSH, instalar Ollama en Ubuntu, descargar un modelo y probarlo desde la línea de comandos. Ollama funciona como servicio del sistema y vuelve a arrancar tras un reinicio, así que la API está lista cada vez que tus aplicaciones la llaman.

Por defecto, Ollama solo escucha en localhost y no tiene autenticación integrada. Déjalo así si tus aplicaciones funcionan en el mismo servidor. Si necesitas acceder desde otro sitio, usa un túnel SSH o ponlo detrás de un proxy inverso con HTTPS y contraseña, y nunca abras el puerto de Ollama a todo internet.

Ollama junto a agentes y automatizaciones

Ollama se vuelve más útil cuando otras herramientas lo llaman. n8n puede enviar cada nueva entrada de un formulario a un modelo local para clasificarla. OpenClaw y otros agentes pueden usarlo para subtareas baratas mientras un modelo alojado se encarga del razonamiento más difícil. Un bot de Telegram puede responder preguntas sencillas a partir de tus propios documentos sin pagar por mensaje.

Ejecutarlo todo en un solo VPS mantiene baja la latencia y los datos en un único lugar. Dimensiona primero el servidor para el modelo y luego añade unos gigabytes para los demás servicios. Como la facturación es por horas, puedes probar un modelo en un plan más grande durante un día, medir la velocidad y quedarte con el plan que encaje.

Guías paso a paso

Escritas por nuestro equipo y probadas en servidores de DataPasa. Las guías están en inglés.

Preguntas frecuentes sobre VPS para Ollama

Sí, los modelos cuantizados pequeños funcionan en CPU con Ollama. Espera unos pocos tokens por segundo en modelos 7B y 8B y más velocidad en modelos 3B y 4B. Los modelos grandes no son prácticos en CPU.

Unos 8 GB para modelos cuantizados de 3B a 4B, y de 16 a 24 GB para modelos de 7B a 8B, para que quede espacio para el contexto, el sistema y otros servicios.

No. Todos nuestros planes son solo CPU, con vCPU y RAM dedicadas. Para modelos grandes o un chat interactivo rápido necesitas un servidor con GPU, que por ahora no ofrecemos.

Tus prompts y datos se quedan en tu servidor y no se envían a ningún proveedor de modelos. Mantén la API de Ollama en localhost o detrás de autenticación, porque no tiene contraseña propia.

Clasificación, extracción, resúmenes, embeddings para búsqueda semántica y subtareas baratas para agentes y herramientas de automatización como n8n. Las tareas en segundo plano son las que mejor encajan con la velocidad de una CPU.

Sí. Recarga desde $5 con USDT, BTC, ETH, XMR y muchas otras monedas, o con tarjeta. El servidor se cobra por horas desde tu saldo.

Ejecuta tu propio modelo en tu propio servidor

Elige un plan con RAM suficiente para tu modelo, sigue la guía y llama a tu API privada en minutos.