Перейти к основному содержимому

Работа с моделями ИИ

Libre WebUI может использовать в одной рабочей области локальные модели Ollama и облачные модели через плагины. Менеджер моделей показывает установленные и запущенные модели Ollama, актуальные результаты Ollama Library, позиции GGUF Hugging Face и при наличии позиции Ollama Cloud.

Выбор первой модели

Используйте эти варианты как отправную точку, затем подберите модель под оборудование и задачу:

МодельПодходит дляТипичная конфигурация
gemma4:12bБыстрый универсальный чат16 GB RAM или 8 GB VRAM
qwen3.8:27bЧат, программирование, несколько языков32 GB RAM или 16-24 GB VRAM
gemma4:26bМощный чат с эффективностью MoE24 GB RAM или 16 GB VRAM
gemma4:31bЛокальный плотный чат высшего качества32 GB RAM или 24 GB VRAM
nomic-embed-textВекторные представления документовНебольшая локальная модель

Крупные модели 30B, 70B и MoE могут быть отличными, но требуют намного больше памяти. Если сомневаетесь, начните с небольшой и увеличивайте после стабильной работы.

Менеджер моделей

Откройте Настройки → Модели, чтобы:

  • Загружать модели Ollama по имени.
  • Искать в актуальной Ollama Library вместо статического списка.
  • Просматривать установленные и запущенные модели.
  • Обновлять все установленные модели Ollama одной операцией.
  • Останавливать или выгружать запущенные модели.
  • Удалять ненужные модели.
  • Загружать совместимые GGUF Hugging Face через Ollama.
  • Загружать Ollama Cloud через фильтр облака.

Для Ollama Cloud интерфейс нормализует имена перед загрузкой. Если требуется суффикс :cloud или -cloud, Libre WebUI применит его в облачном процессе.

Каталог и видимость моделей

Каталог моделей в Настройки → По умолчанию содержит все локальные и провайдерские модели чата с меткой провайдера и поиском. Модель по умолчанию выбирается над каталогом и задаёт начало новых чатов.

Администраторы могут отметить модель звездой, чтобы закрепить её вверху каталога и меню модели по умолчанию. При нескольких звёздах первой идёт отмеченная последней; снятие звезды возвращает модель на её ручную или провайдерскую позицию.

Администраторы также могут скрывать модель переключателем с глазом из списков остальных пользователей. Это сокращает каталог до предлагаемых сервером моделей, но не является авторизацией: это курирование, не граница безопасности. Администраторы всегда видят полный список с отметками.

Локальные и облачные модели

РежимПреимуществаКомпромиссы
Локальный OllamaКонфиденциальность, офлайн после загрузки, понятная ценаЗависит от CPU/GPU/RAM
Ollama CloudЗнакомый процесс без локальных аппаратных ограниченийТребует облака и сети
Плагины провайдеровУправляемые модели разных провайдеровДействуют ключи API, цены и политика конфиденциальности

Сохраняйте локальные модели для частной работы и включайте плагины для задач, требующих крупных размещённых моделей.

Модель компьютерного зрения по умолчанию

Можно общаться с быстрой текстовой моделью и отправлять изображения. Выберите модель в Настройки → По умолчанию → Специализированные модели → Модель компьютерного зрения. Если исходящий контекст содержит изображение — новое вложение, прежнее в сессии или историю инкогнито — ход направляется этой модели вместо модели сессии. Текстовые ходы остаются прежними.

Настройка действует для пользователя, маршрутизация автоматическая и незаметная. Использовать текущую модель чата отключает её. Проверяется наличие изображений, не возможности модели: после настройки любой ход с изображением использует модель зрения, даже если сессионная тоже способна.

Выбор сохраняет точную идентичность провайдера (Ollama или конкретный плагин) с именем, чтобы провайдер не перехватил одноимённую модель. Если идентичность потеряна, например модель недоступна, ход с изображением завершается ошибкой. Выберите модель заново в Настройки → По умолчанию → Специализированные модели → Модель компьютерного зрения, чтобы это исправить. Явная ошибка намеренна; Libre WebUI не подставляет другого провайдера.

Модели для Work

Work нужна модель чата с вызовами инструментов:

  • Установленная Ollama, объявляющая tools.
  • Ollama Cloud через настроенную конечную точку.
  • Модель активного плагина чата/дополнения с учётными данными администратора.

Запуски через плагины используют подходящий адаптер: совместимый с OpenAI, Anthropic или Gemini. Libre WebUI сохраняет точный тип и ID плагина с задачей и запуском, поэтому одноимённая Ollama не перехватывается. Отказ в инструментах завершает запуск, а не переключает провайдера.

Локальный Ollama сохраняет запросы в настроенной инфраструктуре. Удалённый провайдер получает системный промпт Work, разговор, определения и результаты инструментов. Результаты могут содержать исходный текст, вывод команд и списки каталогов. Тома и учётные данные остаются на сервере, но содержимое файла может уйти, если попало в результат.

Один автономный запуск может вызывать модель много раз. Проверьте цены, хранение и обучение провайдера перед конфиденциальными проектами. Libre WebUI показывает закрываемое предупреждение каждому пользователю.

Требования к оборудованию

СистемаПрактический диапазонПримечания
Только CPU, 8-16 GB RAM1B-4BЛёгкий чат и тесты
8 GB VRAM4B-8B квантованныеУдобная отправная точка
12-16 GB VRAM8B-14B квантованныеДля повседневной работы
24 GB VRAM14B-32B квантованныеМощная локальная станция
48 GB+ VRAM или большая общая память32B-70B квантованныеЭксперименты с крупными моделями

Квантованные модели используют меньше памяти. Q4 обычно практичный стандарт; Q8 требует больше памяти ради качества.

Рекомендации по задачам

ЗадачаНаправление выбора
Быстрый чатgemma4:12b и другие небольшие актуальные модели
ПрограммированиеQwen Coder, Codestral, провайдерские модели
РассуждениеКрупные Qwen и Gemma, провайдерские модели рассуждения
ЗрениеLLaVA, Qwen VL и другие мультимодальные модели
Поиск документовnomic-embed-text или другая модель представлений
Синтез речиTTS-плагины Qwen3-TTS или Kyutai TTS

Имена провайдеров меняются часто. Используйте обнаружение или вставьте точный ID из панели.

Промпты и параметры

  • Температура, токены, контекст и штрафы собраны в закрытом по умолчанию разделе Расширенные параметры генерации.
  • Низкая температура (0.1-0.3) для фактических повторяемых ответов.
  • Средняя (0.5-0.7) для обычной работы.
  • Высокая (0.8+) для идей и творчества.
  • Ограничивайте контекст рядом с пределами памяти.
  • Используйте персоны для постоянных параметров и системного промпта.

Устранение неполадок

Не загружается

  • Проверьте Ollama: ollama list.
  • Повторите в терминале для исходной ошибки.
  • Проверьте диск.
  • Позвольте Libre WebUI управлять облачными суффиксами.

Медленные ответы

  • Меньшая модель или квантование.
  • ollama ps покажет загруженное.
  • Закройте тяжёлые GPU-приложения.
  • Сократите контекст.

Недостаточно памяти

  • Q8 → Q4.
  • 8B вместо 14B.
  • Держите только нужную модель.
  • В Docker проверьте GPU или Ollama хоста.

Связанная документация