فقط CPU، با برآورد صادقانه

سرور مجازی Ollama
برای LLM خصوصی روی CPU

مدل‌های زبانی کوچک و متن‌باز را با Ollama روی یک سرور KVM در آلمان اجرا کنید. پرامپت‌ها و داده‌های شما روی سرور خودتان می‌مانند و یک API ساده برای برنامه‌ها و ایجنت‌هایتان در اختیار دارید.

سرور مجازی Ollama به چه کاری می‌آید

مدل‌های کوچک روی CPU کندتر از GPU هستند و برای بسیاری از کارها این کاملاً کافی است.

خصوصی از پایه

پرامپت‌ها، اسناد و خروجی‌ها هرگز از سرور شما خارج نمی‌شوند. مناسب ابزارهای داخلی، داده‌های شخصی و هر چیزی که ترجیح می‌دهید برای شرکت‌های هوش مصنوعی ارسال نکنید.

API محلی برای برنامه‌ها

Ollama یک API از نوع HTTP ارائه می‌دهد که بسیاری از ابزارها از آن پشتیبانی می‌کنند، پس n8n، OpenClaw، ربات‌ها و کد خودتان می‌توانند مستقیماً مدل را فراخوانی کنند.

Embedding برای جستجو و RAG

مدل‌های embedding کوچک هستند و روی CPU سریع اجرا می‌شوند. اسناد خود را ایندکس کنید و جستجوی معنایی راه بیندازید، بدون پرداخت به ازای هر توکن.

vCPU و RAM اختصاصی

استنتاج از تمام هسته‌هایی که در اختیارش بگذارید استفاده می‌کند. پلن‌های KVM با vCPU رزروشده سرعت تولید توکن را ثابت نگه می‌دارند و به همسایه‌ها وابسته نیستند.

NVMe برای بارگذاری سریع مدل

هر مدل کوانتیزه‌شده چند گیگابایت حجم دارد. فضای NVMe آن‌ها را سریع در حافظه بارگذاری می‌کند و چند مدل را هم‌زمان نگه می‌دارد.

بدون GPU، از همان ابتدا گفته‌ایم

پلن‌های ما فقط CPU دارند. روی مدل‌های کوچک چند توکن در ثانیه انتظار داشته باشید، نه سرعت یک سرویس چت آنلاین.

پلن‌های VPS برای Ollama

پلن‌هایی با حداقل 8 GB RAM. همه فقط CPU دارند. قیمت‌ها برای بودجه‌بندی ماهانه نوشته شده‌اند و ساعتی محاسبه می‌شوند.

VPS-4
$12.16/ماه
$0.0167/ساعت
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
ترافیک
32 TB

مناسب برای: مدل‌های کوانتیزه‌شده 3B تا 4B و embedding برای جستجو

سفارش VPS-4
VPS-5
$18.24/ماه
$0.0250/ساعت
CPU
6 vCPU
RAM
12 GB
NVMe
192 GB
ترافیک
32 TB
سفارش VPS-5
VPS-6
$24.12/ماه
$0.0330/ساعت
CPU
6 vCPU
RAM
16 GB
NVMe
256 GB
ترافیک
32 TB

مناسب برای: یک مدل کوانتیزه‌شده 7B تا 8B برای API خصوصی

سفارش VPS-6
VPS-7
$33.45/ماه
$0.0458/ساعت
CPU
8 vCPU
RAM
24 GB
NVMe
320 GB
ترافیک
32 TB

مناسب برای: مدل‌های 7B تا 8B با context طولانی‌تر یا دو مدل، بیشترین vCPU

سفارش VPS-7
n1.medium
$116.80/ماه
$0.1600/ساعت
CPU
8 vCPU
RAM
8 GB
NVMe
64 GB
ترافیک
نامحدود
سفارش n1.medium

مشاهده همه پلن‌ها و قیمت‌ها

از یک LLM روی VPS با CPU چه انتظاری داشته باشید

هیچ‌کدام از پلن‌های ما GPU ندارند، پس Ollama مدل‌ها را روی CPU اجرا می‌کند. این روش برای مدل‌های کوچک کوانتیزه‌شده در بازه 1B تا 8B خوب کار می‌کند و برای مدل‌های بزرگ با ده‌ها میلیارد پارامتر مناسب نیست. سرعت متوسط است: چند توکن در ثانیه روی مدل 7B یا 8B و سریع‌تر روی مدل‌های 3B و 4B، بسته به تعداد vCPU.

این سرعت برای کارهای پس‌زمینه مناسب‌تر از چت زنده است. دسته‌بندی تیکت‌های پشتیبانی، استخراج فیلدها از متن، خلاصه‌سازی اسناد در طول شب، برچسب‌گذاری محتوا یا تولید embedding کارهایی هستند که کسی منتظر ظاهر شدن متن نمی‌ماند. برای یک دستیار تعاملی، مدل کوچک‌تر زمان پاسخ دلپذیرتری دارد و ارسال پاسخ به‌صورت استریم، توکن به توکن، انتظار را کوتاه‌تر نشان می‌دهد.

هر اندازه مدل چقدر RAM لازم دارد

کل مدل باید همراه با فضای لازم برای پنجره context و سیستم‌عامل در حافظه جا شود. برای مدل‌های 3B و 4B با کوانتیزاسیون 4 بیتی، 8 GB RAM شروع قابل‌قبولی است که همان VPS-4 با 4 vCPU است. vCPU بیشتر یعنی توکن بیشتر در ثانیه، پس تعداد هسته‌ها تقریباً به اندازه حافظه اهمیت دارد.

برای مدل‌های 7B و 8B، روی 16 تا 24 GB حساب کنید. وزن‌ها به‌تنهایی چند گیگابایت فضا می‌گیرند و context طولانی‌تر، یک مدل دوم که بارگذاری‌شده می‌ماند یا یک مدل embedding در کنارش، باقی فضا را به‌سرعت پر می‌کند. VPS-6 با 16 GB برای یک مدل از این دست مناسب است و VPS-7 با 24 GB و 8 vCPU بهترین سرعتی را می‌دهد که ارائه می‌کنیم.

  • 8 GB RAM: مدل‌های کوانتیزه‌شده 3B تا 4B و مدل‌های embedding.
  • 16 GB RAM: یک مدل کوانتیزه‌شده 7B تا 8B.
  • 24 GB RAM: مدل‌های 7B تا 8B با context طولانی یا یک مدل دوم.

نصب Ollama و خصوصی نگه داشتن آن

نصب دستی و سریع است. راهنمای گام‌به‌گام ما اتصال از طریق SSH، نصب Ollama روی Ubuntu، دانلود یک مدل و تست آن از خط فرمان را پوشش می‌دهد. Ollama به‌عنوان سرویس سیستمی اجرا می‌شود و بعد از ریبوت دوباره بالا می‌آید، پس API هر وقت برنامه‌هایتان آن را فراخوانی کنند آماده است.

Ollama به‌طور پیش‌فرض فقط روی localhost گوش می‌دهد و احراز هویت داخلی ندارد. اگر برنامه‌هایتان روی همان سرور اجرا می‌شوند، همین‌طور نگهش دارید. اگر لازم است از جای دیگری به آن دسترسی داشته باشید، از تونل SSH استفاده کنید یا آن را پشت یک reverse proxy با HTTPS و رمز عبور قرار دهید و هرگز پورت Ollama را روی کل اینترنت باز نکنید.

ترکیب Ollama با ایجنت‌ها و اتوماسیون

Ollama وقتی ابزارهای دیگر آن را فراخوانی کنند مفیدتر می‌شود. n8n می‌تواند هر فرم جدید را برای دسته‌بندی به یک مدل محلی بفرستد. OpenClaw و ایجنت‌های دیگر می‌توانند از آن برای زیرکارهای ارزان استفاده کنند، در حالی که یک مدل آنلاین استدلال‌های سخت‌تر را انجام می‌دهد. یک ربات Telegram می‌تواند بدون هزینه به ازای هر پیام، به سؤالات ساده از روی اسناد خودتان پاسخ دهد.

اجرای همه‌چیز روی یک VPS تأخیر را پایین و داده‌ها را در یک جا نگه می‌دارد. اول سرور را به اندازه مدل انتخاب کنید و بعد چند گیگابایت برای سرویس‌های دیگر اضافه کنید. چون پرداخت ساعتی است، می‌توانید یک مدل را یک روز روی پلن بزرگ‌تر امتحان کنید، سرعت را اندازه بگیرید و بعد پلن مناسب را انتخاب کنید.

راهنماهای گام‌به‌گام

نوشته تیم ما و آزمایش‌شده روی سرورهای DataPasa. راهنماها به زبان انگلیسی هستند.

سؤالات متداول سرور مجازی Ollama

بله، مدل‌های کوچک کوانتیزه‌شده با Ollama روی CPU اجرا می‌شوند. روی مدل‌های 7B و 8B چند توکن در ثانیه و روی مدل‌های 3B و 4B خروجی سریع‌تر انتظار داشته باشید. مدل‌های بزرگ روی CPU عملی نیستند.

حدود 8 GB برای مدل‌های کوانتیزه‌شده 3B تا 4B و 16 تا 24 GB برای مدل‌های 7B تا 8B، تا برای context، سیستم و سرویس‌های دیگر جا باشد.

خیر. همه پلن‌های ما فقط CPU دارند، با vCPU و RAM اختصاصی. برای مدل‌های بزرگ یا چت تعاملی سریع به سرور GPU نیاز دارید که در حال حاضر ارائه نمی‌کنیم.

پرامپت‌ها و داده‌های شما روی سرور خودتان می‌مانند و برای هیچ شرکت ارائه‌دهنده مدل ارسال نمی‌شوند. API مربوط به Ollama را روی localhost یا پشت احراز هویت نگه دارید، چون خودش رمز عبور ندارد.

دسته‌بندی، استخراج اطلاعات، خلاصه‌سازی، embedding برای جستجوی معنایی و زیرکارهای ارزان برای ایجنت‌ها و ابزارهای اتوماسیون مثل n8n. کارهایی که در پس‌زمینه اجرا می‌شوند با سرعت CPU بهترین تطابق را دارند.

بله. موجودی خود را از $5 با USDT، BTC، ETH، XMR و بسیاری از رمزارزهای دیگر یا با کارت شارژ کنید. هزینه سرور ساعتی از موجودی شما کسر می‌شود.

مدل خودتان را روی سرور خودتان اجرا کنید

پلنی با RAM کافی برای مدل خود انتخاب کنید، راهنما را دنبال کنید و در چند دقیقه API خصوصی خود را فراخوانی کنید.