از یک LLM روی VPS با CPU چه انتظاری داشته باشید
هیچکدام از پلنهای ما GPU ندارند، پس Ollama مدلها را روی CPU اجرا میکند. این روش برای مدلهای کوچک کوانتیزهشده در بازه 1B تا 8B خوب کار میکند و برای مدلهای بزرگ با دهها میلیارد پارامتر مناسب نیست. سرعت متوسط است: چند توکن در ثانیه روی مدل 7B یا 8B و سریعتر روی مدلهای 3B و 4B، بسته به تعداد vCPU.
این سرعت برای کارهای پسزمینه مناسبتر از چت زنده است. دستهبندی تیکتهای پشتیبانی، استخراج فیلدها از متن، خلاصهسازی اسناد در طول شب، برچسبگذاری محتوا یا تولید embedding کارهایی هستند که کسی منتظر ظاهر شدن متن نمیماند. برای یک دستیار تعاملی، مدل کوچکتر زمان پاسخ دلپذیرتری دارد و ارسال پاسخ بهصورت استریم، توکن به توکن، انتظار را کوتاهتر نشان میدهد.