Робота з моделями ШІ
Libre WebUI використовує локальні моделі Ollama й хмарні моделі через плагіни в одній робочій області. Менеджер показує встановлені й запущені Ollama, актуальну Ollama Library, GGUF Hugging Face та Ollama Cloud.
Вибір першої моделі
| Модель | Для чого | Орієнтовні ресурси |
|---|---|---|
gemma4:12b | Швидкий чат | 16 GB RAM або 8 GB VRAM |
qwen3.8:27b | Чат, код, мови | 32 GB RAM або 16–24 GB VRAM |
gemma4:26b | Сильний MoE-чат | 24 GB RAM або 16 GB VRAM |
gemma4:31b | Якісний dense-чат | 32 GB RAM або 24 GB VRAM |
nomic-embed-text | Вбудовування документів | Невелика локальна модель |
30B, 70B і MoE потребують значно більше пам’яті. Починайте з меншої.
Менеджер моделей
У Налаштування → Моделі можна завантажувати Ollama за ім’ям, шукати в Library, переглядати й зупиняти моделі, оновлювати всі встановлені моделі Ollama однією дією, видаляти їх, завантажувати GGUF Hugging Face та Ollama Cloud. Для Cloud Libre нормалізує :cloud або -cloud.
Каталог і видимість
Каталог моделей у Налаштування → Типові значення показує локальні моделі й моделі постачальників із позначкою та пошуком. Вибір типової моделі над каталогом задає модель, з якої починаються нові чати.
Адміністратор може позначити модель зіркою, щоб закріпити її вгорі каталогу та в меню типової моделі. Якщо зірок кілька, першою стоїть остання позначена; знята зірка повертає моделі її звичайне місце.
Адміністратор може приховати модель від інших селекторів; це впорядкування, а не межа авторизації. Адміністратор завжди бачить повний список.
Локальні й хмарні
| Режим | Переваги | Компроміси |
|---|---|---|
| Локальна Ollama | Приватність, автономна робота, передбачувана ціна | CPU/GPU/RAM |
| Ollama Cloud | Звичний процес без локальних обмежень | Мережа й хмара |
| Плагіни | Керовані моделі різних постачальників | Ключі API, ціна й політика приватності постачальника |
Типова модель зору
У Налаштування → Типові значення → Спеціалізовані моделі → Модель зору можна вибрати окрему модель. Кожен хід із зображенням — новим, попереднім або з історії інкогніто — надходить до неї; текстові ходи залишаються на моделі сеансу.
Налаштування на користувача й непомітне. Використовувати поточну модель чату вимикає його. Перевіряється наявність зображення, не можливість основної моделі.
Зберігається точна ідентичність постачальника. Якщо її втрачено — наприклад, модель або постачальник більше недоступні, — хід із зображенням відхиляється. Виберіть модель знову в Налаштування → Типові значення → Спеціалізовані моделі → Модель зору, щоб це виправити. Помітна помилка тут навмисна: Libre не підміняє постачальника мовчки.
Моделі для Work
Потрібна модель чату з інструментами:
- Ollama, що оголошує
tools; - Ollama Cloud;
- активний плагін chat/completion із точною моделлю й обліковими даними адміністратора.
Work використовує адаптер, сумісний з OpenAI, Anthropic або Gemini, і зберігає тип та ID плагіна. Якщо tools відхилено, резервного перемикання немає.
Локальна Ollama залишає запити в інфраструктурі. Віддалений постачальник отримує системний промпт Work, розмову, визначення й результати, які можуть містити файли, команди та каталоги. Томи й облікові дані залишаються на хості, але вміст файлу може бути передано як результат.
Один автономний запуск виконує багато викликів моделі. Перевірте ціни, правила зберігання й навчання. Libre показує попередження про віддаленого постачальника.
Обладнання
| Система | Практичний діапазон | Примітка |
|---|---|---|
| CPU, 8–16 GB RAM | 1B–4B | Легкий чат |
| 8 GB VRAM | 4B–8B, квантизовані | Старт |
| 12–16 GB VRAM | 8B–14B, квантизовані | Щоденно |
| 24 GB VRAM | 14B–32B, квантизовані | Потужна станція |
| 48 GB+ VRAM/об’єднаної пам’яті | 32B–70B, квантизовані | Експерименти |
Q4 — практичний типовий варіант; Q8 якісніший і важчий.
Рекомендації за завданням
Швидкий чат — gemma4:12b; код — Qwen Coder/Codestral; міркування — більші Qwen/Gemma; зір — LLaVA/Qwen VL; документи — nomic-embed-text; TTS — Qwen3-TTS або Kyutai. Назви постачальників змінюються — використовуйте виявлення або точний ID.
Промпти й налаштування
Розширені генеративні параметри типово згорнуті. Температура 0.1-0.3 підходить для фактів, 0.5-0.7 — для звичайної роботи, а 0.8+ — для творчих завдань. Стежте за контекстом і використовуйте персони для постійних параметрів.
Усунення неполадок
У разі помилки завантаження перевірте ollama list, диск і необроблене повідомлення про помилку. За повільної відповіді виберіть меншу модель, перевірте ollama ps, закрийте програми GPU й зменште контекст. За нестачі пам’яті використовуйте Q4 замість Q8, 8B замість 14B, одну модель і перевірте доступ Docker до GPU/Ollama.