Требования к оборудованию
Обычный интерфейс Chat Libre WebUI легковесен. Большинство ресурсов потребляют локальные модели Ollama; контейнерные задачи Work добавляют отдельный бюджет CPU, памяти, процессов, образов и проектного хранилища.
Краткая таблица
| Оборудование | Практичные локальные модели | Примечания |
|---|---|---|
| 8 ГБ ОЗУ, только CPU | Квантованные 1B-4B | Для тестов и лёгкого чата |
| 16 ГБ ОЗУ, только CPU | Квантованные 4B-8B | Работает, медленнее GPU |
| 8 ГБ VRAM | Квантованные 4B-8B | Хорошая повседневная конфигурация |
| 12-16 ГБ VRAM | Квантованные 8B-14B | Мощный диапазон рабочей станции |
| 24 ГБ VRAM | Квантованные 14B-32B | Продвинутое локальное использование |
| 48 ГБ+ VRAM или много unified memory | Квантованные 32B-70B | Эксперименты с большими моделями |
Фактическая скорость зависит от архитектуры, квантования, длины контекста, драйверов GPU и других процессов.
Удачные стартовые модели
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Используйте nomic-embed-text для эмбеддингов документов, не как чат-модель.
VRAM и ОЗУ
VRAM — главный фактор скорости локальных моделей. Если модель помещается в VRAM, ответы намного быстрее. При выгрузке в системную память модель может работать, но медленнее.
Системная память важна для инференса на CPU, переноса нагрузки GPU, длинного контекста и остального приложения.
Apple Silicon
Apple Silicon использует unified memory, поэтому модель делит память с ОС и приложениями. Компьютеры с большим объёмом могут запускать более крупные квантованные модели, чем предполагает значение VRAM дискретной системы.
Оставляйте достаточно памяти браузеру, бэкенду и ОС.
NVIDIA
GPU NVIDIA обычно обеспечивают лучшую совместимость локального инференса через CUDA. Используйте актуальные драйверы и проверяйте доступ Docker к GPU при контейнерной Ollama.
AMD и Intel
Поддержка AMD и Intel зависит от Ollama и драйверов платформы. При отсутствии ускорения доступен CPU.
Снижение расхода памяти
- Используйте модели меньшего размера.
- Используйте квантование Q4 вместо Q8.
- Уменьшайте контекст.
- Выгружайте неиспользуемые модели.
- Отделяйте выбор модели эмбеддингов от чат-модели.
Ёмкость среды Work
Work использует контейнерные ресурсы сверх WebUI и процесса модели. Каждый активный контейнер по умолчанию получает:
- 2 ГБ памяти;
- 2 CPU; и
- 256 процессов.
Бэкенд по умолчанию допускает две активные контейнерные задачи на экземпляр и одну на администратора. Это лимиты, не резервации, но оператор должен одновременно учитывать WebUI, браузер, Docker, Ollama и контейнер. На Apple Silicon все конкурируют за unified memory.
Ollama Cloud или удалённый плагин позволяет не загружать крупную модель в локальные ОЗУ/VRAM. Это не отменяет Docker и ресурсы контейнера Work.
У каждой задачи также именованный том Docker для файлов и зависимостей. Квоты диска на задачу пока отсутствуют, поэтому пакеты или проекты могут исчерпать хранилище Docker. Следите за корнем данных Docker, применяйте лимиты хоста и копируйте тома отдельно от базы Libre WebUI.
Настраивайте WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT и WORK_MAX_ACTIVE_RUNTIMES_* только после измерения хоста. Значения по умолчанию см. в справочнике переменных окружения.