Nur CPU, ehrlich dimensioniert

Ollama VPS
für private LLMs auf der CPU

Betreiben Sie kleine offene Sprachmodelle mit Ollama auf einem KVM Server in Deutschland. Ihre Prompts und Daten bleiben auf Ihrer eigenen Maschine, mit einer einfachen API für Ihre Apps und Agenten.

Wofür sich ein Ollama VPS eignet

Kleine Modelle auf der CPU sind langsamer als auf einer GPU, und für viele Aufgaben ist das völlig in Ordnung.

Privat von Grund auf

Prompts, Dokumente und Ergebnisse verlassen Ihren Server nie. Nützlich für interne Tools, persönliche Daten und alles, was Sie lieber nicht an einen KI-Anbieter schicken.

Lokale API für Ihre Apps

Ollama bietet eine HTTP API, die viele Tools schon unterstützen. n8n, OpenClaw, Bots und Ihr eigener Code können das Modell direkt aufrufen.

Embeddings für Suche und RAG

Embedding-Modelle sind klein und auf der CPU schnell. Indexieren Sie Ihre Dokumente und betreiben Sie semantische Suche, ohne pro Token zu zahlen.

Dedizierte vCPU und RAM

Inferenz nutzt jeden Kern, den Sie ihr geben. KVM Tarife mit reservierter vCPU halten die Token-Geschwindigkeit stabil, statt sie mit den Nachbarn schwanken zu lassen.

NVMe für schnelles Laden der Modelle

Quantisierte Modelle sind jeweils mehrere Gigabyte groß. NVMe Speicher lädt sie schnell in den Arbeitsspeicher und fasst mehrere Modelle gleichzeitig.

Keine GPU, offen gesagt

Unsere Tarife sind reine CPU-Tarife. Rechnen Sie bei kleinen Modellen mit einigen Token pro Sekunde, nicht mit dem Tempo eines gehosteten Chat-Dienstes.

VPS Tarife für Ollama

Tarife mit mindestens 8 GB RAM, alle nur mit CPU. Die Monatspreise dienen der Planung, abgerechnet wird pro Stunde.

VPS-4
$12.16/Monat
$0.0167/Std.
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
Traffic
32 TB

Geeignet für: Quantisierte 3B bis 4B Modelle und Embeddings für die Suche

Bestellen VPS-4
VPS-5
$18.24/Monat
$0.0250/Std.
CPU
6 vCPU
RAM
12 GB
NVMe
192 GB
Traffic
32 TB
Bestellen VPS-5
VPS-6
$24.12/Monat
$0.0330/Std.
CPU
6 vCPU
RAM
16 GB
NVMe
256 GB
Traffic
32 TB

Geeignet für: Ein quantisiertes 7B bis 8B Modell für private API-Nutzung

Bestellen VPS-6
VPS-7
$33.45/Monat
$0.0458/Std.
CPU
8 vCPU
RAM
24 GB
NVMe
320 GB
Traffic
32 TB

Geeignet für: 7B bis 8B mit längerem Kontext oder zwei Modellen, meiste vCPU

Bestellen VPS-7
n1.medium
$116.80/Monat
$0.1600/Std.
CPU
8 vCPU
RAM
8 GB
NVMe
64 GB
Traffic
Unbegrenzt
Bestellen n1.medium

Alle Tarife und Preise ansehen

Was Sie von einem LLM auf einem CPU VPS erwarten können

Keiner unserer Tarife enthält eine GPU, Ollama führt die Modelle also auf der CPU aus. Das klappt gut mit kleinen quantisierten Modellen im Bereich 1B bis 8B und klappt nicht mit großen Modellen mit Dutzenden Milliarden Parametern. Das Tempo ist bescheiden: einige Token pro Sekunde bei einem 7B oder 8B Modell, schneller bei 3B und 4B Modellen, abhängig von der Zahl der vCPU.

Dieses Tempo passt besser zu Hintergrundaufgaben als zum Live-Chat. Support-Tickets klassifizieren, Felder aus Texten extrahieren, Dokumente über Nacht zusammenfassen, Inhalte taggen oder Embeddings erzeugen sind Aufgaben, bei denen niemand zusieht, wie der Text erscheint. Für einen interaktiven Assistenten liefert ein kleineres Modell angenehmere Antwortzeiten, und das Streamen Token für Token lässt das Warten kürzer wirken.

Wie viel RAM jede Modellgröße braucht

Das ganze Modell muss in den Arbeitsspeicher passen, mit Platz für das Kontextfenster und das Betriebssystem. Für 3B und 4B Modelle mit 4 Bit Quantisierung sind 8 GB RAM ein brauchbarer Anfang, das ist VPS-4 mit 4 vCPU. Mehr vCPU bedeutet mehr Token pro Sekunde, die Zahl der Kerne zählt also fast so viel wie der Speicher.

Für 7B und 8B Modelle planen Sie 16 bis 24 GB ein. Allein die Gewichte belegen mehrere Gigabyte, und ein längerer Kontext, ein zweites geladenes Modell oder ein Embedding-Modell daneben verbrauchen den Rest schnell. VPS-6 mit 16 GB passt gut für ein solches Modell, VPS-7 mit 24 GB und 8 vCPU bietet das höchste Tempo, das wir anbieten.

  • 8 GB RAM: quantisierte 3B bis 4B Modelle und Embedding-Modelle.
  • 16 GB RAM: ein quantisiertes 7B bis 8B Modell.
  • 24 GB RAM: 7B bis 8B Modelle mit langem Kontext oder ein zweites Modell.

Ollama einrichten und privat halten

Die Installation erfolgt von Hand und geht schnell. Unsere Schritt-für-Schritt-Anleitung zeigt, wie Sie sich per SSH verbinden, Ollama unter Ubuntu installieren, ein Modell laden und es auf der Kommandozeile testen. Ollama läuft als Systemdienst und startet nach einem Neustart wieder, die API ist also bereit, wann immer Ihre Anwendungen sie aufrufen.

Standardmäßig lauscht Ollama nur auf localhost und hat keine eingebaute Authentifizierung. Lassen Sie es so, wenn Ihre Apps auf demselben Server laufen. Müssen Sie von anderswo zugreifen, nutzen Sie einen SSH-Tunnel oder stellen Sie Ollama hinter einen Reverse Proxy mit HTTPS und Passwort. Öffnen Sie den Ollama Port nie für das ganze Internet.

Ollama mit Agenten und Automatisierung kombinieren

Ollama wird nützlicher, wenn andere Tools es aufrufen. n8n kann jeden neuen Formulareintrag zur Klassifizierung an ein lokales Modell schicken. OpenClaw und andere Agenten können es für günstige Teilaufgaben nutzen, während ein gehostetes Modell das schwierigere Denken übernimmt. Ein Telegram Bot kann einfache Fragen aus Ihren eigenen Dokumenten beantworten, ohne Gebühren pro Nachricht.

Alles auf einem VPS zu betreiben hält die Latenz niedrig und die Daten an einem Ort. Dimensionieren Sie den Server zuerst für das Modell und rechnen Sie dann ein paar Gigabyte für die anderen Dienste dazu. Da stündlich abgerechnet wird, können Sie ein Modell einen Tag lang auf einem größeren Tarif testen, das Tempo messen und sich dann für den passenden Tarif entscheiden.

Schritt-für-Schritt-Anleitungen

Von unserem Team geschrieben und auf DataPasa Servern getestet. Die Anleitungen sind auf Englisch verfasst.

Häufige Fragen zum Ollama VPS

Ja, kleine quantisierte Modelle laufen mit Ollama auf der CPU. Rechnen Sie mit einigen Token pro Sekunde bei 7B und 8B Modellen und schnellerer Ausgabe bei 3B und 4B Modellen. Große Modelle sind auf der CPU nicht praktikabel.

Etwa 8 GB für quantisierte 3B bis 4B Modelle und 16 bis 24 GB für 7B bis 8B Modelle, damit Platz für Kontext, System und andere Dienste bleibt.

Nein. Alle unsere Tarife sind reine CPU-Tarife mit dedizierter vCPU und RAM. Für große Modelle oder schnellen interaktiven Chat brauchen Sie einen GPU-Server, den wir derzeit nicht anbieten.

Ihre Prompts und Daten bleiben auf Ihrem Server und werden nicht an einen Modellanbieter geschickt. Lassen Sie die Ollama API auf localhost oder hinter einer Authentifizierung, denn sie hat kein eigenes Passwort.

Klassifizierung, Extraktion, Zusammenfassungen, Embeddings für semantische Suche und günstige Teilaufgaben für Agenten und Automatisierungstools wie n8n. Aufgaben, die im Hintergrund laufen, passen am besten zum CPU-Tempo.

Ja. Laden Sie ab $5 mit USDT, BTC, ETH, XMR und vielen anderen Coins auf, oder mit Karte. Der Server wird stündlich von Ihrem Guthaben abgerechnet.

Ihr eigenes Modell auf Ihrem eigenen Server

Wählen Sie einen Tarif mit genug RAM für Ihr Modell, folgen Sie der Anleitung und rufen Sie Ihre private API in wenigen Minuten auf.