Вимоги до обладнання
Звичайний інтерфейс Chat Libre WebUI легкий. Більшість ресурсів споживають локальні моделі Ollama; контейнерні завдання Work додають окремий бюджет CPU, пам’яті, процесів, образів і сховища проєкту.
Коротка таблиця
| Обладнання | Практичні локальні моделі | Примітки |
|---|---|---|
| 8 ГБ оперативної пам’яті, лише CPU | Квантовані 1B-4B | Для тестів і легкого чату |
| 16 ГБ оперативної пам’яті, лише CPU | Квантовані 4B-8B | Працює, повільніше за GPU |
| 8 ГБ VRAM | Квантовані 4B-8B | Добра щоденна конфігурація |
| 12-16 ГБ VRAM | Квантовані 8B-14B | Потужна робоча станція |
| 24 ГБ VRAM | Квантовані 14B-32B | Розширене локальне використання |
| 48 ГБ+ VRAM або багато спільної пам’яті | Квантовані 32B-70B | Експерименти з великими моделями |
Фактична швидкість залежить від архітектури, квантування, довжини контексту, драйверів GPU та інших процесів.
Вдалі початкові моделі
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Використовуйте nomic-embed-text для векторних подань документів, а не як модель чату.
VRAM і оперативна пам’ять
VRAM — головний чинник швидкості локальних моделей. Якщо модель уміщується у VRAM, відповіді значно швидші. Якщо частина потрапляє до системної пам’яті, модель може працювати, але повільніше.
Системна пам’ять важлива для виведення на CPU, перенесення навантаження GPU, довгого контексту й решти програми.
Apple Silicon
Apple Silicon використовує спільну пам’ять, тому модель ділить її з операційною системою й програмами. Комп’ютери з великим обсягом можуть запускати більші квантовані моделі, ніж підказує значення VRAM у системі з окремим GPU.
Залишайте достатньо пам’яті браузеру, серверній частині й ОС.
NVIDIA
GPU NVIDIA зазвичай забезпечують найкращу сумісність локального виведення через CUDA. Використовуйте актуальні драйвери й перевіряйте доступ Docker до GPU, якщо Ollama працює в контейнерах.
AMD та Intel
Підтримка AMD та Intel залежить від Ollama й драйверів платформи. За відсутності прискорення доступне виведення на CPU.
Зменшення використання пам’яті
- Використовуйте менші моделі.
- Використовуйте квантування Q4 замість Q8.
- Зменшуйте контекст.
- Вивантажуйте невикористовувані моделі.
- Відокремлюйте вибір моделі векторних подань від моделі чату.
Місткість середовища Work
Work використовує ресурси контейнера додатково до WebUI й процесу моделі. Кожен активний контейнер типово отримує:
- 2 ГБ пам’яті;
- 2 CPU; і
- 256 процесів.
Серверна частина типово дозволяє два активні контейнерні завдання на екземпляр і одне на адміністратора. Це ліміти, а не резервування, але оператор має одночасно враховувати WebUI, браузер, Docker, Ollama й контейнер. На Apple Silicon усі вони конкурують за спільну пам’ять.
Ollama Cloud або віддалений плагін дає змогу не завантажувати велику модель до локальної оперативної пам’яті чи VRAM. Це не скасовує Docker і ресурси контейнера Work.
Кожне завдання також має іменований том Docker для файлів і залежностей. Квот диска на завдання поки немає, тому пакети чи проєкти можуть вичерпати сховище Docker. Стежте за коренем даних Docker, застосовуйте ліміти хоста й копіюйте томи окремо від бази Libre WebUI.
Налаштовуйте WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT і WORK_MAX_ACTIVE_RUNTIMES_* лише після вимірювання хоста. Типові значення див. у довіднику змінних середовища.