Перейти к основному содержимому

Требования к оборудованию

Обычный интерфейс Chat Libre WebUI легковесен. Большинство ресурсов потребляют локальные модели Ollama; контейнерные задачи Work добавляют отдельный бюджет CPU, памяти, процессов, образов и проектного хранилища.

Краткая таблица

ОборудованиеПрактичные локальные моделиПримечания
8 ГБ ОЗУ, только CPUКвантованные 1B-4BДля тестов и лёгкого чата
16 ГБ ОЗУ, только CPUКвантованные 4B-8BРаботает, медленнее GPU
8 ГБ VRAMКвантованные 4B-8BХорошая повседневная конфигурация
12-16 ГБ VRAMКвантованные 8B-14BМощный диапазон рабочей станции
24 ГБ VRAMКвантованные 14B-32BПродвинутое локальное использование
48 ГБ+ VRAM или много unified memoryКвантованные 32B-70BЭксперименты с большими моделями

Фактическая скорость зависит от архитектуры, квантования, длины контекста, драйверов GPU и других процессов.

Удачные стартовые модели

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Используйте nomic-embed-text для эмбеддингов документов, не как чат-модель.

VRAM и ОЗУ

VRAM — главный фактор скорости локальных моделей. Если модель помещается в VRAM, ответы намного быстрее. При выгрузке в системную память модель может работать, но медленнее.

Системная память важна для инференса на CPU, переноса нагрузки GPU, длинного контекста и остального приложения.

Apple Silicon

Apple Silicon использует unified memory, поэтому модель делит память с ОС и приложениями. Компьютеры с большим объёмом могут запускать более крупные квантованные модели, чем предполагает значение VRAM дискретной системы.

Оставляйте достаточно памяти браузеру, бэкенду и ОС.

NVIDIA

GPU NVIDIA обычно обеспечивают лучшую совместимость локального инференса через CUDA. Используйте актуальные драйверы и проверяйте доступ Docker к GPU при контейнерной Ollama.

AMD и Intel

Поддержка AMD и Intel зависит от Ollama и драйверов платформы. При отсутствии ускорения доступен CPU.

Снижение расхода памяти

  • Используйте модели меньшего размера.
  • Используйте квантование Q4 вместо Q8.
  • Уменьшайте контекст.
  • Выгружайте неиспользуемые модели.
  • Отделяйте выбор модели эмбеддингов от чат-модели.

Ёмкость среды Work

Work использует контейнерные ресурсы сверх WebUI и процесса модели. Каждый активный контейнер по умолчанию получает:

  • 2 ГБ памяти;
  • 2 CPU; и
  • 256 процессов.

Бэкенд по умолчанию допускает две активные контейнерные задачи на экземпляр и одну на администратора. Это лимиты, не резервации, но оператор должен одновременно учитывать WebUI, браузер, Docker, Ollama и контейнер. На Apple Silicon все конкурируют за unified memory.

Ollama Cloud или удалённый плагин позволяет не загружать крупную модель в локальные ОЗУ/VRAM. Это не отменяет Docker и ресурсы контейнера Work.

У каждой задачи также именованный том Docker для файлов и зависимостей. Квоты диска на задачу пока отсутствуют, поэтому пакеты или проекты могут исчерпать хранилище Docker. Следите за корнем данных Docker, применяйте лимиты хоста и копируйте тома отдельно от базы Libre WebUI.

Настраивайте WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT и WORK_MAX_ACTIVE_RUNTIMES_* только после измерения хоста. Значения по умолчанию см. в справочнике переменных окружения.

Связанная документация