Praca z modelami AI
Libre WebUI może używać w jednym obszarze roboczym lokalnych modeli Ollama i modeli chmurowych obsługiwanych przez wtyczki. Menedżer modeli pokazuje zainstalowane i uruchomione modele Ollama, bieżące wyniki z Ollama Library, pozycje GGUF z Hugging Face oraz, gdy są dostępne, pozycje Ollama Cloud.
Wybór pierwszego modelu
Potraktuj te modele jako punkt wyjścia, a następnie dobierz inny do sprzętu i zadania:
| Model | Dobre zastosowanie | Typowa konfiguracja |
|---|---|---|
gemma4:12b | Szybki czat ogólny | 16 GB RAM lub 8 GB VRAM |
qwen3.8:27b | Czat ogólny, programowanie, wiele języków | 32 GB RAM lub 16-24 GB VRAM |
gemma4:26b | Zaawansowany czat z wydajnością MoE | 24 GB RAM lub 16 GB VRAM |
gemma4:31b | Lokalny gęsty czat najwyższej jakości | 32 GB RAM lub 24 GB VRAM |
nomic-embed-text | Osadzanie dokumentów | Mały lokalny model osadzania |
Duże modele, takie jak 30B, 70B i MoE, mogą działać znakomicie, ale wymagają znacznie więcej pamięci. W razie wątpliwości zacznij od małego modelu i zwiększ go, gdy działa płynnie.
Menedżer modeli
Otwórz Ustawienia → Modele, aby:
- Pobierać modele z Ollama według nazwy.
- Przeszukiwać bieżącą Ollama Library zamiast polegać na statycznej liście.
- Wyświetlać modele zainstalowane i uruchomione.
- Aktualizować wszystkie zainstalowane modele Ollama w jednej operacji.
- Zatrzymywać lub usuwać z pamięci uruchomione modele.
- Usuwać niepotrzebne modele.
- Pobierać zgodne modele GGUF z Hugging Face przez Ollama.
- Pobierać modele Ollama Cloud za pomocą filtra chmury.
Dla wyników Ollama Cloud interfejs normalizuje nazwy modeli przed pobraniem. Jeśli model wymaga przyrostka :cloud lub -cloud, Libre WebUI zastosuje go automatycznie w przepływie modeli chmurowych.
Katalog i widoczność modeli
Katalog modeli w Ustawienia → Domyślne zawiera wszystkie dostępne modele czatu — lokalne i pochodzące od dostawców — wraz z plakietką dostawcy i polem wyszukiwania. Model domyślny wybierz nad katalogiem, aby ustalić, od którego modelu zaczynają się nowe czaty.
Administratorzy mogą oznaczyć model gwiazdką, aby przypiąć go na górze katalogu i w menu modelu domyślnego. Przy kilku gwiazdkach pierwszy jest model oznaczony najpóźniej; usunięcie gwiazdki przywraca modelowi pozycję ręczną lub wynikającą z kolejności dostawcy.
Administratorzy otrzymują dodatkowy przełącznik z ikoną oka, który ukrywa model w selektorach pozostałych użytkowników. Ułatwia to ograniczenie długiego katalogu do modeli faktycznie oferowanych przez serwer. Jest to tylko filtrowanie listy, a nie kontrola autoryzacji, więc traktuj je jako kurację, nie granicę bezpieczeństwa. Administratorzy zawsze widzą pełną listę z oznaczeniem ukrytych modeli.
Modele lokalne i chmurowe
| Tryb | Zalety | Ograniczenia |
|---|---|---|
| Lokalny Ollama | Prywatność, działanie offline po pobraniu, przewidywalny koszt | Zależność od CPU/GPU/RAM |
| Ollama Cloud | Znany przepływ Ollama bez lokalnych ograniczeń sprzętu | Wymaga chmury i sieci |
| Wtyczki dostawców | Dostęp do zarządzanych modeli wielu dostawców | Obowiązują klucze API, ceny i polityka prywatności dostawcy |
Możesz zachować modele lokalne do pracy prywatnej i włączać wtyczki dostawców do zadań wymagających większych modeli hostowanych.
Domyślny model wizyjny
Możesz rozmawiać z szybkim modelem tekstowym i nadal wysyłać obrazy. Wybierz model wizyjny w Ustawienia → Domyślne → Modele wyspecjalizowane → Model wizyjny. Gdy kontekst wychodzącego czatu zawiera obrazy — nowy załącznik, wcześniejszy obraz w sesji lub historię czatu incognito — tura trafia do skonfigurowanego modelu wizyjnego zamiast modelu sesji. Tury tekstowe nadal używają modelu sesji.
Ustawienie obowiązuje dla konkretnego użytkownika, a routing jest automatyczny i cichy. Pozostawienie opcji Użyj bieżącego modelu czatu wyłącza funkcję. Kontrola dotyczy obecności obrazów, nie możliwości modelu sesji: po skonfigurowaniu modelu wizyjnego używa go każda tura z obrazem, nawet jeśli model sesji także obsługuje obrazy.
Wybór zapisuje dokładną tożsamość dostawcy (Ollama lub konkretna wtyczka) wraz z nazwą modelu, więc dostawca nie może przejąć modelu o tej samej nazwie. Jeśli zapisany wybór utraci tę tożsamość, na przykład model lub dostawca przestanie być dostępny, tura z obrazem zakończy się błędem. Aby to naprawić, wybierz model ponownie w Ustawienia → Domyślne → Modele wyspecjalizowane → Model wizyjny. Jawny błąd jest zamierzony; Libre WebUI nie podstawia po cichu innego dostawcy.
Modele dla Work
Work potrzebuje modelu czatu zdolnego do wywoływania narzędzi. Może używać:
- Zainstalowanego modelu Ollama deklarującego możliwość
tools. - Modelu Ollama Cloud dostępnego przez skonfigurowany punkt końcowy Ollama.
- Modelu wymienionego przez aktywną wtyczkę czatu lub uzupełniania, z poświadczeniami bieżącego administratora.
Uruchomienia Work oparte na wtyczkach używają adaptera odpowiedniego dla dostawcy: zgodnego z OpenAI, Anthropic lub Gemini. Libre WebUI utrwala dokładny typ dostawcy i identyfikator wtyczki z zadaniem oraz każdym uruchomieniem, więc wtyczka nie może przejąć modelu Ollama o tej samej nazwie. Jeśli model lub dostawca odrzuca wywołania narzędzi, uruchomienie kończy się błędem zamiast cicho przełączyć dostawcę.
Lokalny Ollama utrzymuje żądania modeli w skonfigurowanej infrastrukturze Ollama. Przy modelu zdalnym dostawca otrzymuje prompt systemowy Work, rozmowę, definicje i wyniki narzędzi. Wyniki mogą zawierać tekst źródłowy, wyjście poleceń lub listy katalogów zażądane przez model. Woluminy obszarów roboczych i poświadczenia pozostają na hoście zaplecza, ale treść pliku może go opuścić, gdy znajdzie się w wyniku narzędzia.
Jedno autonomiczne uruchomienie Work może wykonać wiele wywołań modelu. Przed użyciem poufnych projektów sprawdź ceny oraz zasady przechowywania i trenowania zdalnego dostawcy. Libre WebUI pokazuje w Work ostrzeżenie o dostawcy, które każdy użytkownik może osobno zamknąć.
Przewodnik sprzętowy
| System | Praktyczny zakres modeli | Uwagi |
|---|---|---|
| Tylko CPU, 8-16 GB RAM | 1B-4B | Lekki czat i testy |
| 8 GB VRAM | 4B-8B skwantowane | Wygodny punkt wyjścia |
| 12-16 GB VRAM | 8B-14B skwantowane | Dobry zakres do codziennej pracy |
| 24 GB VRAM | 14B-32B skwantowane | Mocna lokalna stacja robocza |
| 48 GB+ VRAM lub duża pamięć zunifikowana | 32B-70B skwantowane | Eksperymenty z dużymi modelami |
Modele skwantowane używają mniej pamięci. Kwantyzacja Q4 jest zwykle praktycznym wyborem domyślnym; Q8 zużywa więcej pamięci dla lepszej jakości.
Zalecenia według zadania
| Zadanie | Kierunek wyboru modelu |
|---|---|
| Szybki czat | gemma4:12b i inne małe aktualne modele |
| Programowanie | Qwen Coder, Codestral, modele programistyczne dostawców |
| Rozumowanie | Większe Qwen i Gemma, modele rozumowania dostawców |
| Wizja | Modele multimodalne, np. LLaVA, Qwen VL lub modele wizyjne dostawców |
| Wyszukiwanie dokumentów | nomic-embed-text lub inny model osadzania |
| Synteza mowy | Wtyczki TTS, np. Qwen3-TTS lub Kyutai TTS |
Nazwy modeli dostawców często się zmieniają. Korzystaj z wykrywania modeli dostawcy, gdy jest dostępne, albo wklej dokładny identyfikator z panelu dostawcy.
Prompty i ustawienia
- Parametry generowania, takie jak temperatura, limity tokenów, długość kontekstu i kary, znajdują się w domyślnie zwiniętej sekcji Zaawansowane ustawienia generowania.
- Niska temperatura (
0.1-0.3) daje odpowiedzi faktograficzne i powtarzalne. - Średnia (
0.5-0.7) pasuje do zwykłej pracy asystenta. - Wyższa (
0.8+) pasuje do burzy mózgów i twórczego pisania. - Utrzymuj rozsądną długość kontekstu blisko limitu pamięci.
- Używaj person, gdy potrzebujesz trwałych parametrów modelu i promptu systemowego wielokrotnego użytku.
Rozwiązywanie problemów
Pobieranie nie działa
- Sprawdź, czy Ollama działa:
ollama list. - Wypróbuj to samo pobieranie w terminalu, aby zobaczyć surowy błąd Ollama.
- Przed dużymi modelami sprawdź miejsce na dysku.
- Przy filtrze chmurowym pozwól Libre WebUI obsłużyć przyrostki.
Odpowiedzi są wolne
- Wypróbuj mniejszy model lub niższą kwantyzację.
- Użyj
ollama ps, aby sprawdzić załadowane modele. - Zamknij aplikacje intensywnie używające GPU.
- Zmniejsz długość kontekstu.
Brak pamięci
- Przejdź z Q8 na Q4.
- Użyj modelu 8B zamiast 14B.
- Pozostaw załadowany tylko potrzebny model.
- W Dockerze sprawdź dostęp kontenera do GPU lub Ollama na hoście.