Faites tourner de petits modèles de langage open source avec Ollama sur un serveur KVM en Allemagne. Vos prompts et vos données restent sur votre propre machine, avec une API simple pour vos applications et vos agents.
De petits modèles sur CPU sont plus lents qu’un GPU, et pour beaucoup de tâches, cela convient parfaitement.
Confidentiel par conception
Prompts, documents et résultats ne quittent jamais votre serveur. Utile pour les outils internes, les données personnelles et tout ce que vous préférez ne pas envoyer à un fournisseur d’IA.
Une API locale pour vos applications
Ollama expose une API HTTP déjà prise en charge par de nombreux outils : n8n, OpenClaw, vos bots et votre propre code peuvent appeler le modèle directement.
Embeddings pour la recherche et le RAG
Les modèles d’embedding sont petits et rapides sur CPU. Indexez vos documents et alimentez une recherche sémantique sans payer au token.
vCPU et RAM dédiés
L’inférence utilise tous les cœurs que vous lui donnez. Les offres KVM avec vCPU réservés gardent une vitesse de génération stable, indépendante des voisins.
NVMe pour charger vite les modèles
Les modèles quantifiés pèsent plusieurs gigaoctets chacun. Le stockage NVMe les charge rapidement en mémoire et en conserve plusieurs à la fois.
Pas de GPU, annoncé d’emblée
Nos offres fonctionnent uniquement sur CPU. Comptez quelques tokens par seconde sur les petits modèles, pas la vitesse d’un service de chat hébergé.
Offres VPS pour Ollama
Offres avec au moins 8 Go de RAM. Toutes uniquement sur CPU. Les prix sont mensuels pour votre budget, facturés à l’heure.
VPS-4
$12.16/mois
$0.0167/h
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
Trafic
32 TB
Idéal pour: Modèles quantifiés 3B à 4B et embeddings pour la recherche
Aucune de nos offres n’inclut de GPU : Ollama fait donc tourner les modèles sur le CPU. Cela fonctionne bien pour de petits modèles quantifiés entre 1B et 8B, et pas pour les grands modèles à plusieurs dizaines de milliards de paramètres. La vitesse est modeste : quelques tokens par seconde sur un modèle 7B ou 8B, davantage sur les modèles 3B et 4B, selon le nombre de vCPU.
Cette vitesse convient mieux aux traitements en arrière-plan qu’au chat en direct. Classer des tickets de support, extraire des champs d’un texte, résumer des documents pendant la nuit, étiqueter du contenu ou générer des embeddings : personne ne regarde le texte s’afficher. Pour un assistant interactif, un modèle plus petit offre un temps de réponse plus agréable, et le streaming de la réponse token par token rend l’attente plus courte.
Combien de RAM pour chaque taille de modèle
Le modèle entier doit tenir en mémoire, avec de la place pour la fenêtre de contexte et le système d’exploitation. Pour les modèles 3B et 4B en quantification 4 bits, 8 Go de RAM sont un point de départ réaliste : c’est VPS-4 avec 4 vCPU. Plus de vCPU signifie plus de tokens par seconde, le nombre de cœurs compte donc presque autant que la mémoire.
Pour les modèles 7B et 8B, prévoyez 16 à 24 Go. Les poids occupent à eux seuls plusieurs gigaoctets, et un contexte plus long, un second modèle chargé ou un modèle d’embedding à côté consomment vite le reste. VPS-6 avec 16 Go convient bien à un tel modèle, et VPS-7 avec 24 Go et 8 vCPU offre la meilleure vitesse de notre gamme.
8 Go de RAM : modèles quantifiés 3B à 4B et modèles d’embedding.
16 Go de RAM : un modèle quantifié 7B à 8B.
24 Go de RAM : modèles 7B à 8B avec un long contexte ou un second modèle.
Installer Ollama et le garder privé
L’installation est manuelle et rapide. Notre guide pas à pas couvre la connexion SSH, l’installation d’Ollama sous Ubuntu, le téléchargement d’un modèle et son test en ligne de commande. Ollama tourne comme service système et redémarre après un reboot : l’API est prête dès que vos applications l’appellent.
Par défaut, Ollama n’écoute que sur localhost et n’a aucune authentification intégrée. Gardez cette configuration si vos applications tournent sur le même serveur. Si vous devez y accéder depuis ailleurs, utilisez un tunnel SSH ou placez-le derrière un reverse proxy avec HTTPS et un mot de passe, et n’ouvrez jamais le port d’Ollama à tout internet.
Associer Ollama à des agents et à l’automatisation
Ollama devient plus utile quand d’autres outils l’appellent. n8n peut envoyer chaque nouvelle réponse de formulaire à un modèle local pour la classer. OpenClaw et d’autres agents peuvent l’utiliser pour des sous-tâches peu coûteuses, pendant qu’un modèle hébergé se charge du raisonnement plus difficile. Un bot Telegram peut répondre à des questions simples à partir de vos propres documents, sans frais par message.
Tout faire tourner sur un seul VPS garde une latence faible et les données au même endroit. Dimensionnez d’abord le serveur pour le modèle, puis ajoutez quelques gigaoctets pour les autres services. Comme la facturation est horaire, vous pouvez tester un modèle sur une offre plus grande pendant une journée, mesurer la vitesse, puis choisir l’offre qui convient.
Guides pas à pas
Rédigés par notre équipe et testés sur les serveurs DataPasa. Les guides sont en anglais.
Oui, les petits modèles quantifiés tournent sur CPU avec Ollama. Comptez quelques tokens par seconde sur les modèles 7B et 8B, et une génération plus rapide sur les modèles 3B et 4B. Les grands modèles ne sont pas réalistes sur CPU.
Environ 8 Go pour les modèles quantifiés 3B à 4B, et 16 à 24 Go pour les modèles 7B à 8B, afin de garder de la place pour le contexte, le système et les autres services.
Non. Toutes nos offres fonctionnent uniquement sur CPU, avec vCPU et RAM dédiés. Pour de grands modèles ou un chat interactif rapide, il faut un serveur GPU, que nous ne proposons pas pour le moment.
Vos prompts et vos données restent sur votre serveur et ne sont pas envoyés à un fournisseur de modèles. Gardez l’API Ollama sur localhost ou derrière une authentification, car elle n’a pas de mot de passe propre.
Classification, extraction, résumés, embeddings pour la recherche sémantique et sous-tâches peu coûteuses pour des agents et des outils d’automatisation comme n8n. Les tâches en arrière-plan sont celles qui s’accommodent le mieux de la vitesse d’un CPU.
Oui. Rechargez dès $5 en USDT, BTC, ETH, XMR et de nombreuses autres cryptos, ou par carte. Le serveur est débité à l’heure sur votre solde.