Перейти до основного вмісту

Робота з моделями ШІ

Libre WebUI використовує локальні моделі Ollama й хмарні моделі через плагіни в одній робочій області. Менеджер показує встановлені й запущені Ollama, актуальну Ollama Library, GGUF Hugging Face та Ollama Cloud.

Вибір першої моделі

МодельДля чогоОрієнтовні ресурси
gemma4:12bШвидкий чат16 GB RAM або 8 GB VRAM
qwen3.8:27bЧат, код, мови32 GB RAM або 16–24 GB VRAM
gemma4:26bСильний MoE-чат24 GB RAM або 16 GB VRAM
gemma4:31bЯкісний dense-чат32 GB RAM або 24 GB VRAM
nomic-embed-textВбудовування документівНевелика локальна модель

30B, 70B і MoE потребують значно більше пам’яті. Починайте з меншої.

Менеджер моделей

У Налаштування → Моделі можна завантажувати Ollama за ім’ям, шукати в Library, переглядати й зупиняти моделі, оновлювати всі встановлені моделі Ollama однією дією, видаляти їх, завантажувати GGUF Hugging Face та Ollama Cloud. Для Cloud Libre нормалізує :cloud або -cloud.

Каталог і видимість

Каталог моделей у Налаштування → Типові значення показує локальні моделі й моделі постачальників із позначкою та пошуком. Вибір типової моделі над каталогом задає модель, з якої починаються нові чати.

Адміністратор може позначити модель зіркою, щоб закріпити її вгорі каталогу та в меню типової моделі. Якщо зірок кілька, першою стоїть остання позначена; знята зірка повертає моделі її звичайне місце.

Адміністратор може приховати модель від інших селекторів; це впорядкування, а не межа авторизації. Адміністратор завжди бачить повний список.

Локальні й хмарні

РежимПеревагиКомпроміси
Локальна OllamaПриватність, автономна робота, передбачувана цінаCPU/GPU/RAM
Ollama CloudЗвичний процес без локальних обмеженьМережа й хмара
ПлагіниКеровані моделі різних постачальниківКлючі API, ціна й політика приватності постачальника

Типова модель зору

У Налаштування → Типові значення → Спеціалізовані моделі → Модель зору можна вибрати окрему модель. Кожен хід із зображенням — новим, попереднім або з історії інкогніто — надходить до неї; текстові ходи залишаються на моделі сеансу.

Налаштування на користувача й непомітне. Використовувати поточну модель чату вимикає його. Перевіряється наявність зображення, не можливість основної моделі.

Зберігається точна ідентичність постачальника. Якщо її втрачено — наприклад, модель або постачальник більше недоступні, — хід із зображенням відхиляється. Виберіть модель знову в Налаштування → Типові значення → Спеціалізовані моделі → Модель зору, щоб це виправити. Помітна помилка тут навмисна: Libre не підміняє постачальника мовчки.

Моделі для Work

Потрібна модель чату з інструментами:

  • Ollama, що оголошує tools;
  • Ollama Cloud;
  • активний плагін chat/completion із точною моделлю й обліковими даними адміністратора.

Work використовує адаптер, сумісний з OpenAI, Anthropic або Gemini, і зберігає тип та ID плагіна. Якщо tools відхилено, резервного перемикання немає.

Локальна Ollama залишає запити в інфраструктурі. Віддалений постачальник отримує системний промпт Work, розмову, визначення й результати, які можуть містити файли, команди та каталоги. Томи й облікові дані залишаються на хості, але вміст файлу може бути передано як результат.

Один автономний запуск виконує багато викликів моделі. Перевірте ціни, правила зберігання й навчання. Libre показує попередження про віддаленого постачальника.

Обладнання

СистемаПрактичний діапазонПримітка
CPU, 8–16 GB RAM1B–4BЛегкий чат
8 GB VRAM4B–8B, квантизованіСтарт
12–16 GB VRAM8B–14B, квантизованіЩоденно
24 GB VRAM14B–32B, квантизованіПотужна станція
48 GB+ VRAM/об’єднаної пам’яті32B–70B, квантизованіЕксперименти

Q4 — практичний типовий варіант; Q8 якісніший і важчий.

Рекомендації за завданням

Швидкий чат — gemma4:12b; код — Qwen Coder/Codestral; міркування — більші Qwen/Gemma; зір — LLaVA/Qwen VL; документи — nomic-embed-text; TTS — Qwen3-TTS або Kyutai. Назви постачальників змінюються — використовуйте виявлення або точний ID.

Промпти й налаштування

Розширені генеративні параметри типово згорнуті. Температура 0.1-0.3 підходить для фактів, 0.5-0.7 — для звичайної роботи, а 0.8+ — для творчих завдань. Стежте за контекстом і використовуйте персони для постійних параметрів.

Усунення неполадок

У разі помилки завантаження перевірте ollama list, диск і необроблене повідомлення про помилку. За повільної відповіді виберіть меншу модель, перевірте ollama ps, закрийте програми GPU й зменште контекст. За нестачі пам’яті використовуйте Q4 замість Q8, 8B замість 14B, одну модель і перевірте доступ Docker до GPU/Ollama.

Пов’язані документи