Yalnızca CPU, dürüstçe boyutlandırılmış

Ollama VPS
CPU üzerinde özel LLM'ler için

Küçük açık dil modellerini Almanya'daki bir KVM sunucuda Ollama ile çalıştırın. Prompt'larınız ve verileriniz kendi makinenizde kalır, uygulamalarınız ve ajanlarınız için basit bir API alırsınız.

Ollama VPS ne işe yarar

CPU'daki küçük modeller GPU'dan yavaştır ve birçok iş için bu tamamen yeterlidir.

Tasarımı gereği gizli

Prompt'lar, belgeler ve çıktılar sunucunuzdan hiç çıkmaz. İç araçlar, kişisel veriler ve bir AI sağlayıcısına göndermek istemediğiniz her şey için kullanışlıdır.

Uygulamalarınız için yerel API

Ollama, birçok aracın zaten desteklediği bir HTTP API sunar, böylece n8n, OpenClaw, botlar ve kendi kodunuz modeli doğrudan çağırabilir.

Arama ve RAG için embedding'ler

Embedding modelleri küçüktür ve CPU'da hızlıdır. Belgelerinizi indeksleyin ve token başına ödemeden anlamsal arama yapın.

Ayrılmış vCPU ve RAM

Çıkarım, verdiğiniz her çekirdeği kullanır. Ayrılmış vCPU'lu KVM planları, token hızını komşulara göre değişmeden sabit tutar.

Hızlı model yükleme için NVMe

Quantize edilmiş modellerin her biri birkaç gigabayttır. NVMe depolama onları belleğe hızla yükler ve aynı anda birkaç modeli tutar.

GPU yok, baştan söylüyoruz

Planlarımız yalnızca CPU'dur. Küçük modellerde saniyede birkaç token bekleyin, barındırılan bir sohbet servisinin hızını değil.

Ollama için VPS planları

En az 8 GB RAM'li planlar. Hepsi yalnızca CPU. Fiyatlar bütçe için aylık, ücret saatlik alınır.

VPS-4
$12.16/ay
$0.0167/saat
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
Trafik
32 TB

Uygun olduğu işler: 3B ile 4B quantize modeller ve arama için embedding'ler

Sipariş ver VPS-4
VPS-5
$18.24/ay
$0.0250/saat
CPU
6 vCPU
RAM
12 GB
NVMe
192 GB
Trafik
32 TB
Sipariş ver VPS-5
VPS-6
$24.12/ay
$0.0330/saat
CPU
6 vCPU
RAM
16 GB
NVMe
256 GB
Trafik
32 TB

Uygun olduğu işler: Özel API kullanımı için tek bir 7B ile 8B quantize model

Sipariş ver VPS-6
VPS-7
$33.45/ay
$0.0458/saat
CPU
8 vCPU
RAM
24 GB
NVMe
320 GB
Trafik
32 TB

Uygun olduğu işler: Daha uzun bağlamlı 7B ile 8B veya iki model, en çok vCPU

Sipariş ver VPS-7
n1.medium
$116.80/ay
$0.1600/saat
CPU
8 vCPU
RAM
8 GB
NVMe
64 GB
Trafik
Sınırsız
Sipariş ver n1.medium

Tüm planları ve fiyatları görün

CPU VPS'te bir LLM'den ne beklemeli

Planlarımızın hiçbirinde GPU yok, bu yüzden Ollama modelleri CPU'da çalıştırır. Bu, 1B ile 8B aralığındaki küçük quantize modeller için iyi çalışır, on milyarlarca parametreli büyük modeller için çalışmaz. Hız mütevazıdır: vCPU sayısına bağlı olarak 7B veya 8B modelde saniyede birkaç token, 3B ve 4B modellerde daha hızlı.

Bu hız canlı sohbetten çok arka plan işlerine uygundur. Destek taleplerini sınıflandırmak, metinden alan çıkarmak, belgeleri gece boyunca özetlemek, içerik etiketlemek veya embedding üretmek, metnin belirişini kimsenin izlemediği işlerdir. Etkileşimli bir asistan için daha küçük bir model daha hoş bir yanıt süresi verir, cevabı token token akıtmak da beklemeyi daha kısa hissettirir.

Her model boyutu ne kadar RAM ister

Modelin tamamı, bağlam penceresi ve işletim sistemi için yer bırakarak belleğe sığmalıdır. 4 bit quantization'daki 3B ve 4B modeller için 8 GB RAM iş görür bir başlangıçtır, bu da 4 vCPU'lu VPS-4'tür. Daha fazla vCPU saniyede daha fazla token demektir, yani çekirdek sayısı neredeyse bellek kadar önemlidir.

7B ve 8B modeller için 16 ile 24 GB planlayın. Ağırlıklar tek başına birkaç gigabayt tutar, daha uzun bir bağlam, yüklü tutulan ikinci bir model ya da yanında bir embedding modeli kalanını hızla tüketir. 16 GB'lık VPS-6 böyle bir model için uygundur, 24 GB ve 8 vCPU'lu VPS-7 ise sunduğumuz en iyi hızı verir.

  • 8 GB RAM: 3B ile 4B quantize modeller ve embedding modelleri.
  • 16 GB RAM: tek bir 7B ile 8B quantize model.
  • 24 GB RAM: uzun bağlamlı 7B ile 8B modeller veya ikinci bir model.

Ollama'yı kurmak ve gizli tutmak

Kurulum elle yapılır ve hızlıdır. Adım adım rehberimiz SSH ile bağlanmayı, Ollama'yı Ubuntu'ya kurmayı, bir model çekmeyi ve komut satırından test etmeyi anlatır. Ollama bir sistem servisi olarak çalışır ve yeniden başlatmadan sonra tekrar ayağa kalkar, böylece uygulamalarınız çağırdığında API her zaman hazırdır.

Ollama varsayılan olarak yalnızca localhost'u dinler ve yerleşik bir kimlik doğrulaması yoktur. Uygulamalarınız aynı sunucuda çalışıyorsa böyle bırakın. Başka bir yerden erişmeniz gerekiyorsa SSH tüneli kullanın ya da onu HTTPS ve şifreli bir reverse proxy arkasına koyun, Ollama portunu asla tüm internete açmayın.

Ollama'yı ajanlar ve otomasyonla birleştirmek

Ollama, diğer araçlar onu çağırdığında daha kullanışlı hale gelir. n8n her yeni form kaydını sınıflandırma için yerel bir modele gönderebilir. OpenClaw ve diğer ajanlar onu ucuz alt görevler için kullanırken zor akıl yürütmeyi barındırılan bir model üstlenebilir. Bir Telegram botu, mesaj başına ücret ödemeden kendi belgelerinizden basit soruları yanıtlayabilir.

Her şeyi tek bir VPS'te çalıştırmak gecikmeyi düşük, veriyi tek yerde tutar. Sunucuyu önce modele göre boyutlandırın, sonra diğer servisler için birkaç gigabayt ekleyin. Faturalandırma saatlik olduğundan bir modeli bir gün boyunca daha büyük bir planda deneyebilir, hızı ölçebilir ve ardından uygun plana karar verebilirsiniz.

Adım adım rehberler

Ekibimiz tarafından yazıldı ve DataPasa sunucularında test edildi. Rehberler İngilizcedir.

Ollama VPS SSS

Evet, küçük quantize modeller Ollama ile CPU'da çalışır. 7B ve 8B modellerde saniyede birkaç token, 3B ve 4B modellerde daha hızlı çıktı bekleyin. Büyük modeller CPU'da pratik değildir.

3B ile 4B quantize modeller için yaklaşık 8 GB, 7B ile 8B modeller için ise bağlama, sisteme ve diğer servislere yer kalsın diye 16 ile 24 GB.

Hayır. Tüm planlarımız ayrılmış vCPU ve RAM ile yalnızca CPU'dur. Büyük modeller veya hızlı etkileşimli sohbet için GPU sunucusu gerekir, bunu şu anda sunmuyoruz.

Prompt'larınız ve verileriniz sunucunuzda kalır, bir model sağlayıcısına gönderilmez. Ollama API'sini localhost'ta veya kimlik doğrulama arkasında tutun, çünkü kendi şifresi yoktur.

Sınıflandırma, veri çıkarma, özetler, anlamsal arama için embedding'ler ve ajanlar ile n8n gibi otomasyon araçları için ucuz alt görevler. Arka planda çalışan işler CPU hızına en iyi uyanlardır.

Evet. USDT, BTC, ETH, XMR ve birçok başka coinle ya da kartla $5'dan itibaren bakiye yükleyin. Sunucu ücreti bakiyenizden saatlik alınır.

Kendi modelinizi kendi sunucunuzda çalıştırın

Modelinize yetecek RAM'e sahip bir plan seçin, rehberi izleyin ve dakikalar içinde özel API'nizi çağırın.