Только CPU, честный подбор ресурсов

VPS для Ollama
для приватных LLM на CPU

Запускайте небольшие открытые языковые модели в Ollama на KVM-сервере в Германии. Запросы и данные остаются на вашей машине, а приложения и агенты работают через простой API.

Для чего подходит VPS с Ollama

Небольшие модели на CPU работают медленнее, чем на GPU, и для многих задач этого вполне достаточно.

Приватность по умолчанию

Запросы, документы и ответы не покидают ваш сервер. Удобно для внутренних инструментов, личных данных и всего, что не хочется отправлять ИИ-вендору.

Локальный API для ваших приложений

Ollama предоставляет HTTP API, который уже поддерживают многие инструменты, так что n8n, OpenClaw, боты и ваш код обращаются к модели напрямую.

Эмбеддинги для поиска и RAG

Модели эмбеддингов маленькие и быстро работают на CPU. Индексируйте документы и стройте семантический поиск без оплаты за токены.

Выделенные vCPU и RAM

Инференс использует все доступные ядра. Тарифы KVM с закреплёнными vCPU держат скорость генерации стабильной, независимо от соседей.

NVMe для быстрой загрузки моделей

Квантованные модели весят по несколько гигабайт. NVMe быстро загружает их в память и вмещает сразу несколько моделей.

Без GPU, говорим об этом сразу

Наши тарифы работают только на CPU. Рассчитывайте на несколько токенов в секунду на небольших моделях, а не на скорость облачного чат-сервиса.

Тарифы VPS для Ollama

Тарифы от 8 ГБ RAM, все только на CPU. Цены указаны за месяц для удобства, оплата почасовая.

VPS-4
$12.16/мес
$0.0167/час
CPU
4 vCPU
RAM
8 GB
NVMe
128 GB
Трафик
32 TB

Подходит для: Квантованные модели 3B и 4B и эмбеддинги для поиска

Заказать VPS-4
VPS-5
$18.24/мес
$0.0250/час
CPU
6 vCPU
RAM
12 GB
NVMe
192 GB
Трафик
32 TB
Заказать VPS-5
VPS-6
$24.12/мес
$0.0330/час
CPU
6 vCPU
RAM
16 GB
NVMe
256 GB
Трафик
32 TB

Подходит для: Одна квантованная модель 7B или 8B для приватного API

Заказать VPS-6
VPS-7
$33.45/мес
$0.0458/час
CPU
8 vCPU
RAM
24 GB
NVMe
320 GB
Трафик
32 TB

Подходит для: 7B и 8B с длинным контекстом или две модели, больше всего vCPU

Заказать VPS-7
n1.medium
$116.80/мес
$0.1600/час
CPU
8 vCPU
RAM
8 GB
NVMe
64 GB
Трафик
Безлимитный
Заказать n1.medium

Все тарифы и цены

Чего ждать от LLM на CPU VPS

Ни в одном нашем тарифе нет GPU, поэтому Ollama запускает модели на процессоре. Это хорошо работает с небольшими квантованными моделями от 1B до 8B и не подходит для больших моделей на десятки миллиардов параметров. Скорость скромная: несколько токенов в секунду на модели 7B или 8B, быстрее на 3B и 4B, в зависимости от числа vCPU.

Такая скорость лучше подходит для фоновых задач, чем для живого чата. Классификация обращений в поддержку, извлечение полей из текста, ночная суммаризация документов, разметка контента или генерация эмбеддингов: здесь никто не смотрит, как появляется текст. Для интерактивного ассистента меньшая модель отвечает приятнее, а потоковый вывод по токенам делает ожидание короче.

Сколько RAM нужно моделям разного размера

Модель должна целиком поместиться в память с запасом на контекстное окно и операционную систему. Для моделей 3B и 4B в 4-битной квантизации рабочий старт 8 ГБ RAM, это VPS-4 с 4 vCPU. Чем больше vCPU, тем больше токенов в секунду, поэтому число ядер почти так же важно, как память.

Для моделей 7B и 8B закладывайте от 16 до 24 ГБ. Одни веса занимают несколько гигабайт, а длинный контекст, вторая загруженная модель или модель эмбеддингов рядом быстро съедают остальное. VPS-6 с 16 ГБ хорошо подходит для одной такой модели, а VPS-7 с 24 ГБ и 8 vCPU даёт максимальную скорость из того, что мы предлагаем.

  • 8 ГБ RAM: квантованные модели 3B и 4B и модели эмбеддингов.
  • 16 ГБ RAM: одна квантованная модель 7B или 8B.
  • 24 ГБ RAM: модели 7B и 8B с длинным контекстом или вторая модель.

Установка Ollama и защита доступа

Установка ручная и быстрая. Наш пошаговый гайд охватывает подключение по SSH, установку Ollama на Ubuntu, загрузку модели и проверку из командной строки. Ollama работает как системная служба и поднимается после перезагрузки, так что API готов, когда бы его ни вызвали ваши приложения.

По умолчанию Ollama слушает только localhost, и встроенной аутентификации у него нет. Так и оставьте, если приложения работают на том же сервере. Если нужен доступ снаружи, используйте SSH-туннель или обратный прокси с HTTPS и паролем, но никогда не открывайте порт Ollama всему интернету.

Ollama вместе с агентами и автоматизацией

Ollama становится полезнее, когда к нему обращаются другие инструменты. n8n может отправлять каждую новую заявку из формы в локальную модель на классификацию. OpenClaw и другие агенты используют его для дешёвых подзадач, а сложные рассуждения оставляют облачной модели. Telegram-бот может отвечать на простые вопросы по вашим документам без оплаты за каждое сообщение.

Когда всё работает на одном VPS, задержки минимальны, а данные хранятся в одном месте. Сначала подберите сервер под модель, затем добавьте несколько гигабайт на остальные сервисы. Оплата почасовая, поэтому можно день погонять модель на тарифе побольше, замерить скорость и выбрать подходящий.

Пошаговые инструкции

Написаны нашей командой и проверены на серверах DataPasa. Инструкции написаны на английском языке.

Вопросы о VPS для Ollama

Да, небольшие квантованные модели работают в Ollama на CPU. На моделях 7B и 8B ждите несколько токенов в секунду, на 3B и 4B быстрее. Большие модели на CPU запускать непрактично.

Около 8 ГБ для квантованных моделей 3B и 4B и от 16 до 24 ГБ для моделей 7B и 8B, чтобы хватило места на контекст, систему и другие сервисы.

Нет. Все наши тарифы работают только на CPU с выделенными vCPU и RAM. Для больших моделей или быстрого интерактивного чата нужен сервер с GPU, а таких мы пока не предлагаем.

Запросы и данные остаются на вашем сервере и не уходят вендору модели. Держите API Ollama на localhost или за аутентификацией, потому что собственного пароля у него нет.

Классификация, извлечение данных, суммаризация, эмбеддинги для семантического поиска и дешёвые подзадачи для агентов и инструментов автоматизации вроде n8n. Скорости CPU лучше всего хватает на фоновые задачи.

Да. Пополняйте баланс от $5 в USDT, BTC, ETH, XMR и многих других монетах или картой. Сервер оплачивается с баланса почасово.

Своя модель на своём сервере

Выберите тариф с достаточным объёмом RAM для вашей модели, пройдите гайд и через несколько минут обращайтесь к своему приватному API.