Перейти до основного вмісту

Вимоги до обладнання

Звичайний інтерфейс Chat Libre WebUI легкий. Більшість ресурсів споживають локальні моделі Ollama; контейнерні завдання Work додають окремий бюджет CPU, пам’яті, процесів, образів і сховища проєкту.

Коротка таблиця

ОбладнанняПрактичні локальні моделіПримітки
8 ГБ оперативної пам’яті, лише CPUКвантовані 1B-4BДля тестів і легкого чату
16 ГБ оперативної пам’яті, лише CPUКвантовані 4B-8BПрацює, повільніше за GPU
8 ГБ VRAMКвантовані 4B-8BДобра щоденна конфігурація
12-16 ГБ VRAMКвантовані 8B-14BПотужна робоча станція
24 ГБ VRAMКвантовані 14B-32BРозширене локальне використання
48 ГБ+ VRAM або багато спільної пам’ятіКвантовані 32B-70BЕксперименти з великими моделями

Фактична швидкість залежить від архітектури, квантування, довжини контексту, драйверів GPU та інших процесів.

Вдалі початкові моделі

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Використовуйте nomic-embed-text для векторних подань документів, а не як модель чату.

VRAM і оперативна пам’ять

VRAM — головний чинник швидкості локальних моделей. Якщо модель уміщується у VRAM, відповіді значно швидші. Якщо частина потрапляє до системної пам’яті, модель може працювати, але повільніше.

Системна пам’ять важлива для виведення на CPU, перенесення навантаження GPU, довгого контексту й решти програми.

Apple Silicon

Apple Silicon використовує спільну пам’ять, тому модель ділить її з операційною системою й програмами. Комп’ютери з великим обсягом можуть запускати більші квантовані моделі, ніж підказує значення VRAM у системі з окремим GPU.

Залишайте достатньо пам’яті браузеру, серверній частині й ОС.

NVIDIA

GPU NVIDIA зазвичай забезпечують найкращу сумісність локального виведення через CUDA. Використовуйте актуальні драйвери й перевіряйте доступ Docker до GPU, якщо Ollama працює в контейнерах.

AMD та Intel

Підтримка AMD та Intel залежить від Ollama й драйверів платформи. За відсутності прискорення доступне виведення на CPU.

Зменшення використання пам’яті

  • Використовуйте менші моделі.
  • Використовуйте квантування Q4 замість Q8.
  • Зменшуйте контекст.
  • Вивантажуйте невикористовувані моделі.
  • Відокремлюйте вибір моделі векторних подань від моделі чату.

Місткість середовища Work

Work використовує ресурси контейнера додатково до WebUI й процесу моделі. Кожен активний контейнер типово отримує:

  • 2 ГБ пам’яті;
  • 2 CPU; і
  • 256 процесів.

Серверна частина типово дозволяє два активні контейнерні завдання на екземпляр і одне на адміністратора. Це ліміти, а не резервування, але оператор має одночасно враховувати WebUI, браузер, Docker, Ollama й контейнер. На Apple Silicon усі вони конкурують за спільну пам’ять.

Ollama Cloud або віддалений плагін дає змогу не завантажувати велику модель до локальної оперативної пам’яті чи VRAM. Це не скасовує Docker і ресурси контейнера Work.

Кожне завдання також має іменований том Docker для файлів і залежностей. Квот диска на завдання поки немає, тому пакети чи проєкти можуть вичерпати сховище Docker. Стежте за коренем даних Docker, застосовуйте ліміти хоста й копіюйте томи окремо від бази Libre WebUI.

Налаштовуйте WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT і WORK_MAX_ACTIVE_RUNTIMES_* лише після вимірювання хоста. Типові значення див. у довіднику змінних середовища.

Пов’язана документація