Запускайте небольшие открытые языковые модели в Ollama на KVM-сервере в Германии. Запросы и данные остаются на вашей машине, а приложения и агенты работают через простой API.
Ни в одном нашем тарифе нет GPU, поэтому Ollama запускает модели на процессоре. Это хорошо работает с небольшими квантованными моделями от 1B до 8B и не подходит для больших моделей на десятки миллиардов параметров. Скорость скромная: несколько токенов в секунду на модели 7B или 8B, быстрее на 3B и 4B, в зависимости от числа vCPU.
Такая скорость лучше подходит для фоновых задач, чем для живого чата. Классификация обращений в поддержку, извлечение полей из текста, ночная суммаризация документов, разметка контента или генерация эмбеддингов: здесь никто не смотрит, как появляется текст. Для интерактивного ассистента меньшая модель отвечает приятнее, а потоковый вывод по токенам делает ожидание короче.
Сколько RAM нужно моделям разного размера
Модель должна целиком поместиться в память с запасом на контекстное окно и операционную систему. Для моделей 3B и 4B в 4-битной квантизации рабочий старт 8 ГБ RAM, это VPS-4 с 4 vCPU. Чем больше vCPU, тем больше токенов в секунду, поэтому число ядер почти так же важно, как память.
Для моделей 7B и 8B закладывайте от 16 до 24 ГБ. Одни веса занимают несколько гигабайт, а длинный контекст, вторая загруженная модель или модель эмбеддингов рядом быстро съедают остальное. VPS-6 с 16 ГБ хорошо подходит для одной такой модели, а VPS-7 с 24 ГБ и 8 vCPU даёт максимальную скорость из того, что мы предлагаем.
8 ГБ RAM: квантованные модели 3B и 4B и модели эмбеддингов.
16 ГБ RAM: одна квантованная модель 7B или 8B.
24 ГБ RAM: модели 7B и 8B с длинным контекстом или вторая модель.
Установка Ollama и защита доступа
Установка ручная и быстрая. Наш пошаговый гайд охватывает подключение по SSH, установку Ollama на Ubuntu, загрузку модели и проверку из командной строки. Ollama работает как системная служба и поднимается после перезагрузки, так что API готов, когда бы его ни вызвали ваши приложения.
По умолчанию Ollama слушает только localhost, и встроенной аутентификации у него нет. Так и оставьте, если приложения работают на том же сервере. Если нужен доступ снаружи, используйте SSH-туннель или обратный прокси с HTTPS и паролем, но никогда не открывайте порт Ollama всему интернету.
Ollama вместе с агентами и автоматизацией
Ollama становится полезнее, когда к нему обращаются другие инструменты. n8n может отправлять каждую новую заявку из формы в локальную модель на классификацию. OpenClaw и другие агенты используют его для дешёвых подзадач, а сложные рассуждения оставляют облачной модели. Telegram-бот может отвечать на простые вопросы по вашим документам без оплаты за каждое сообщение.
Когда всё работает на одном VPS, задержки минимальны, а данные хранятся в одном месте. Сначала подберите сервер под модель, затем добавьте несколько гигабайт на остальные сервисы. Оплата почасовая, поэтому можно день погонять модель на тарифе побольше, замерить скорость и выбрать подходящий.
Пошаговые инструкции
Написаны нашей командой и проверены на серверах DataPasa. Инструкции написаны на английском языке.
Да, небольшие квантованные модели работают в Ollama на CPU. На моделях 7B и 8B ждите несколько токенов в секунду, на 3B и 4B быстрее. Большие модели на CPU запускать непрактично.
Около 8 ГБ для квантованных моделей 3B и 4B и от 16 до 24 ГБ для моделей 7B и 8B, чтобы хватило места на контекст, систему и другие сервисы.
Нет. Все наши тарифы работают только на CPU с выделенными vCPU и RAM. Для больших моделей или быстрого интерактивного чата нужен сервер с GPU, а таких мы пока не предлагаем.
Запросы и данные остаются на вашем сервере и не уходят вендору модели. Держите API Ollama на localhost или за аутентификацией, потому что собственного пароля у него нет.
Классификация, извлечение данных, суммаризация, эмбеддинги для семантического поиска и дешёвые подзадачи для агентов и инструментов автоматизации вроде n8n. Скорости CPU лучше всего хватает на фоновые задачи.
Да. Пополняйте баланс от $5 в USDT, BTC, ETH, XMR и многих других монетах или картой. Сервер оплачивается с баланса почасово.