Работа с моделями ИИ
Libre WebUI может использовать в одной рабочей области локальные модели Ollama и облачные модели через плагины. Менеджер моделей показывает установленные и запущенные модели Ollama, актуальные результаты Ollama Library, позиции GGUF Hugging Face и при наличии позиции Ollama Cloud.
Выбор первой модели
Используйте эти варианты как отправную точку, затем подберите модель под оборудование и задачу:
| Модель | Подходит для | Типичная конфигурация |
|---|---|---|
gemma4:12b | Быстрый универсальный чат | 16 GB RAM или 8 GB VRAM |
qwen3.8:27b | Чат, программирование, несколько языков | 32 GB RAM или 16-24 GB VRAM |
gemma4:26b | Мощный чат с эффективностью MoE | 24 GB RAM или 16 GB VRAM |
gemma4:31b | Локальный плотный чат высшего качества | 32 GB RAM или 24 GB VRAM |
nomic-embed-text | Векторные представления документов | Небольшая локальная модель |
Крупные модели 30B, 70B и MoE могут быть отличными, но требуют намного больше памяти. Если сомневаетесь, начните с небольшой и увеличивайте после стабильной работы.
Менеджер моделей
Откройте Настройки → Модели, чтобы:
- Загружать модели Ollama по имени.
- Искать в актуальной Ollama Library вместо статического списка.
- Просматривать установленные и запущенные модели.
- Обновлять все установленные модели Ollama одной операцией.
- Останавливать или выгружать запущенные модели.
- Удалять ненужные модели.
- Загружать совместимые GGUF Hugging Face через Ollama.
- Загружать Ollama Cloud через фильтр облака.
Для Ollama Cloud интерфейс нормализует имена перед загрузкой. Если требуется суффикс :cloud или -cloud, Libre WebUI применит его в облачном процессе.
Каталог и видимость моделей
Каталог моделей в Настройки → По умолчанию содержит все локальные и провайдерские модели чата с меткой провайдера и поиском. Модель по умолчанию выбирается над каталогом и задаёт начало новых чатов.
Администраторы могут отметить модель звездой, чтобы закрепить её вверху каталога и меню модели по умолчанию. При нескольких звёздах первой идёт отмеченная последней; снятие звезды возвращает модель на её ручную или провайдерскую позицию.
Администраторы также могут скрывать модель переключателем с глазом из списков остальных пользователей. Это сокращает каталог до предлагаемых сервером моделей, но не является авторизацией: это курирование, не граница безопасности. Администраторы всегда видят полный список с отметками.
Локальные и облачные модели
| Режим | Преимущества | Компромиссы |
|---|---|---|
| Локальный Ollama | Конфиденциальность, офлайн после загрузки, понятная цена | Зависит от CPU/GPU/RAM |
| Ollama Cloud | Знакомый процесс без локальных аппаратных ограничений | Требует облака и сети |
| Плагины провайдеров | Управляемые модели разных провайдеров | Действуют ключи API, цены и политика конфиденциальности |
Сохраняйте локальные модели для частной работы и включайте плагины для задач, требующих крупных размещённых моделей.
Модель компьютерного зрения по умолчанию
Можно общаться с быстрой текстовой моделью и отправлять изображения. Выберите модель в Настройки → По умолчанию → Специализированные модели → Модель компьютерного зрения. Если исходящий контекст содержит изображение — новое вложение, прежнее в сессии или историю инкогнито — ход направляется этой модели вместо модели сессии. Текстовые ходы остаются прежними.
Настройка действует для пользователя, маршрутизация автоматическая и незаметная. Использовать текущую модель чата отключает её. Проверяется наличие изображений, не возможности модели: после настройки любой ход с изображением использует модель зрения, даже если сессионная тоже способна.
Выбор сохраняет точную идентичность провайдера (Ollama или конкретный плагин) с именем, чтобы провайдер не перехватил одноимённую модель. Если идентичность потеряна, например модель недоступна, ход с изображением завершается ошибкой. Выберите модель заново в Настройки → По умолчанию → Специализированные модели → Модель компьютерного зрения, чтобы это исправить. Явная ошибка намеренна; Libre WebUI не подставляет другого провайдера.
Модели для Work
Work нужна модель чата с вызовами инструментов:
- Установленная Ollama, объявляющая
tools. - Ollama Cloud через настроенную конечную точку.
- Модель активного плагина чата/дополнения с учётными данными администратора.
Запуски через плагины используют подходящий адаптер: совместимый с OpenAI, Anthropic или Gemini. Libre WebUI сохраняет точный тип и ID плагина с задачей и запуском, поэтому одноимённая Ollama не перехватывается. Отказ в инструментах завершает запуск, а не переключает провайдера.
Локальный Ollama сохраняет запросы в настроенной инфраструктуре. Удалённый провайдер получает системный промпт Work, разговор, определения и результаты инструментов. Результаты могут содержать исходный текст, вывод команд и списки каталогов. Тома и учётные данные остаются на сервере, но содержимое файла может уйти, если попало в результат.
Один автономный запуск может вызывать модель много раз. Проверьте цены, хранение и обучение провайдера перед конфиденциальными проектами. Libre WebUI показывает закрываемое предупреждение каждому пользователю.
Требования к оборудованию
| Система | Практический диапазон | Примечания |
|---|---|---|
| Только CPU, 8-16 GB RAM | 1B-4B | Лёгкий чат и тесты |
| 8 GB VRAM | 4B-8B квантованные | Удобная отправная точка |
| 12-16 GB VRAM | 8B-14B квантованные | Для повседневной работы |
| 24 GB VRAM | 14B-32B квантованные | Мощная локальная станция |
| 48 GB+ VRAM или большая общая память | 32B-70B квантованные | Эксперименты с крупными моделями |
Квантованные модели используют меньше памяти. Q4 обычно практичный стандарт; Q8 требует больше памяти ради качества.
Рекомендации по задачам
| Задача | Направление выбора |
|---|---|
| Быстрый чат | gemma4:12b и другие небольшие актуальные модели |
| Программирование | Qwen Coder, Codestral, провайдерские модели |
| Рассуждение | Крупные Qwen и Gemma, провайдерские модели рассуждения |
| Зрение | LLaVA, Qwen VL и другие мультимодальные модели |
| Поиск документов | nomic-embed-text или другая модель представлений |
| Синтез речи | TTS-плагины Qwen3-TTS или Kyutai TTS |
Имена провайдеров меняются часто. Используйте обнаружение или вставьте точный ID из панели.
Промпты и параметры
- Температура, токены, контекст и штрафы собраны в закрытом по умолчанию разделе Расширенные параметры генерации.
- Низкая температура (
0.1-0.3) для фактических повторяемых ответов. - Средняя (
0.5-0.7) для обычной работы. - Высокая (
0.8+) для идей и творчества. - Ограничивайте контекст рядом с пределами памяти.
- Используйте персоны для постоянных параметров и системного промпта.
Устранение неполадок
Не загружается
- Проверьте Ollama:
ollama list. - Повторите в терминале для исходной ошибки.
- Проверьте диск.
- Позвольте Libre WebUI управлять облачными суффиксами.
Медленные ответы
- Меньшая модель или квантование.
ollama psпокажет загруженное.- Закройте тяжёлые GPU-приложения.
- Сократите контекст.
Недостаточно памяти
- Q8 → Q4.
- 8B вместо 14B.
- Держите только нужную модель.
- В Docker проверьте GPU или Ollama хоста.