Przejdź do głównej zawartości

Praca z modelami AI

Libre WebUI może używać w jednym obszarze roboczym lokalnych modeli Ollama i modeli chmurowych obsługiwanych przez wtyczki. Menedżer modeli pokazuje zainstalowane i uruchomione modele Ollama, bieżące wyniki z Ollama Library, pozycje GGUF z Hugging Face oraz, gdy są dostępne, pozycje Ollama Cloud.

Wybór pierwszego modelu

Potraktuj te modele jako punkt wyjścia, a następnie dobierz inny do sprzętu i zadania:

ModelDobre zastosowanieTypowa konfiguracja
gemma4:12bSzybki czat ogólny16 GB RAM lub 8 GB VRAM
qwen3.8:27bCzat ogólny, programowanie, wiele języków32 GB RAM lub 16-24 GB VRAM
gemma4:26bZaawansowany czat z wydajnością MoE24 GB RAM lub 16 GB VRAM
gemma4:31bLokalny gęsty czat najwyższej jakości32 GB RAM lub 24 GB VRAM
nomic-embed-textOsadzanie dokumentówMały lokalny model osadzania

Duże modele, takie jak 30B, 70B i MoE, mogą działać znakomicie, ale wymagają znacznie więcej pamięci. W razie wątpliwości zacznij od małego modelu i zwiększ go, gdy działa płynnie.

Menedżer modeli

Otwórz Ustawienia → Modele, aby:

  • Pobierać modele z Ollama według nazwy.
  • Przeszukiwać bieżącą Ollama Library zamiast polegać na statycznej liście.
  • Wyświetlać modele zainstalowane i uruchomione.
  • Aktualizować wszystkie zainstalowane modele Ollama w jednej operacji.
  • Zatrzymywać lub usuwać z pamięci uruchomione modele.
  • Usuwać niepotrzebne modele.
  • Pobierać zgodne modele GGUF z Hugging Face przez Ollama.
  • Pobierać modele Ollama Cloud za pomocą filtra chmury.

Dla wyników Ollama Cloud interfejs normalizuje nazwy modeli przed pobraniem. Jeśli model wymaga przyrostka :cloud lub -cloud, Libre WebUI zastosuje go automatycznie w przepływie modeli chmurowych.

Katalog i widoczność modeli

Katalog modeli w Ustawienia → Domyślne zawiera wszystkie dostępne modele czatu — lokalne i pochodzące od dostawców — wraz z plakietką dostawcy i polem wyszukiwania. Model domyślny wybierz nad katalogiem, aby ustalić, od którego modelu zaczynają się nowe czaty.

Administratorzy mogą oznaczyć model gwiazdką, aby przypiąć go na górze katalogu i w menu modelu domyślnego. Przy kilku gwiazdkach pierwszy jest model oznaczony najpóźniej; usunięcie gwiazdki przywraca modelowi pozycję ręczną lub wynikającą z kolejności dostawcy.

Administratorzy otrzymują dodatkowy przełącznik z ikoną oka, który ukrywa model w selektorach pozostałych użytkowników. Ułatwia to ograniczenie długiego katalogu do modeli faktycznie oferowanych przez serwer. Jest to tylko filtrowanie listy, a nie kontrola autoryzacji, więc traktuj je jako kurację, nie granicę bezpieczeństwa. Administratorzy zawsze widzą pełną listę z oznaczeniem ukrytych modeli.

Modele lokalne i chmurowe

TrybZaletyOgraniczenia
Lokalny OllamaPrywatność, działanie offline po pobraniu, przewidywalny kosztZależność od CPU/GPU/RAM
Ollama CloudZnany przepływ Ollama bez lokalnych ograniczeń sprzętuWymaga chmury i sieci
Wtyczki dostawcówDostęp do zarządzanych modeli wielu dostawcówObowiązują klucze API, ceny i polityka prywatności dostawcy

Możesz zachować modele lokalne do pracy prywatnej i włączać wtyczki dostawców do zadań wymagających większych modeli hostowanych.

Domyślny model wizyjny

Możesz rozmawiać z szybkim modelem tekstowym i nadal wysyłać obrazy. Wybierz model wizyjny w Ustawienia → Domyślne → Modele wyspecjalizowane → Model wizyjny. Gdy kontekst wychodzącego czatu zawiera obrazy — nowy załącznik, wcześniejszy obraz w sesji lub historię czatu incognito — tura trafia do skonfigurowanego modelu wizyjnego zamiast modelu sesji. Tury tekstowe nadal używają modelu sesji.

Ustawienie obowiązuje dla konkretnego użytkownika, a routing jest automatyczny i cichy. Pozostawienie opcji Użyj bieżącego modelu czatu wyłącza funkcję. Kontrola dotyczy obecności obrazów, nie możliwości modelu sesji: po skonfigurowaniu modelu wizyjnego używa go każda tura z obrazem, nawet jeśli model sesji także obsługuje obrazy.

Wybór zapisuje dokładną tożsamość dostawcy (Ollama lub konkretna wtyczka) wraz z nazwą modelu, więc dostawca nie może przejąć modelu o tej samej nazwie. Jeśli zapisany wybór utraci tę tożsamość, na przykład model lub dostawca przestanie być dostępny, tura z obrazem zakończy się błędem. Aby to naprawić, wybierz model ponownie w Ustawienia → Domyślne → Modele wyspecjalizowane → Model wizyjny. Jawny błąd jest zamierzony; Libre WebUI nie podstawia po cichu innego dostawcy.

Modele dla Work

Work potrzebuje modelu czatu zdolnego do wywoływania narzędzi. Może używać:

  • Zainstalowanego modelu Ollama deklarującego możliwość tools.
  • Modelu Ollama Cloud dostępnego przez skonfigurowany punkt końcowy Ollama.
  • Modelu wymienionego przez aktywną wtyczkę czatu lub uzupełniania, z poświadczeniami bieżącego administratora.

Uruchomienia Work oparte na wtyczkach używają adaptera odpowiedniego dla dostawcy: zgodnego z OpenAI, Anthropic lub Gemini. Libre WebUI utrwala dokładny typ dostawcy i identyfikator wtyczki z zadaniem oraz każdym uruchomieniem, więc wtyczka nie może przejąć modelu Ollama o tej samej nazwie. Jeśli model lub dostawca odrzuca wywołania narzędzi, uruchomienie kończy się błędem zamiast cicho przełączyć dostawcę.

Lokalny Ollama utrzymuje żądania modeli w skonfigurowanej infrastrukturze Ollama. Przy modelu zdalnym dostawca otrzymuje prompt systemowy Work, rozmowę, definicje i wyniki narzędzi. Wyniki mogą zawierać tekst źródłowy, wyjście poleceń lub listy katalogów zażądane przez model. Woluminy obszarów roboczych i poświadczenia pozostają na hoście zaplecza, ale treść pliku może go opuścić, gdy znajdzie się w wyniku narzędzia.

Jedno autonomiczne uruchomienie Work może wykonać wiele wywołań modelu. Przed użyciem poufnych projektów sprawdź ceny oraz zasady przechowywania i trenowania zdalnego dostawcy. Libre WebUI pokazuje w Work ostrzeżenie o dostawcy, które każdy użytkownik może osobno zamknąć.

Przewodnik sprzętowy

SystemPraktyczny zakres modeliUwagi
Tylko CPU, 8-16 GB RAM1B-4BLekki czat i testy
8 GB VRAM4B-8B skwantowaneWygodny punkt wyjścia
12-16 GB VRAM8B-14B skwantowaneDobry zakres do codziennej pracy
24 GB VRAM14B-32B skwantowaneMocna lokalna stacja robocza
48 GB+ VRAM lub duża pamięć zunifikowana32B-70B skwantowaneEksperymenty z dużymi modelami

Modele skwantowane używają mniej pamięci. Kwantyzacja Q4 jest zwykle praktycznym wyborem domyślnym; Q8 zużywa więcej pamięci dla lepszej jakości.

Zalecenia według zadania

ZadanieKierunek wyboru modelu
Szybki czatgemma4:12b i inne małe aktualne modele
ProgramowanieQwen Coder, Codestral, modele programistyczne dostawców
RozumowanieWiększe Qwen i Gemma, modele rozumowania dostawców
WizjaModele multimodalne, np. LLaVA, Qwen VL lub modele wizyjne dostawców
Wyszukiwanie dokumentównomic-embed-text lub inny model osadzania
Synteza mowyWtyczki TTS, np. Qwen3-TTS lub Kyutai TTS

Nazwy modeli dostawców często się zmieniają. Korzystaj z wykrywania modeli dostawcy, gdy jest dostępne, albo wklej dokładny identyfikator z panelu dostawcy.

Prompty i ustawienia

  • Parametry generowania, takie jak temperatura, limity tokenów, długość kontekstu i kary, znajdują się w domyślnie zwiniętej sekcji Zaawansowane ustawienia generowania.
  • Niska temperatura (0.1-0.3) daje odpowiedzi faktograficzne i powtarzalne.
  • Średnia (0.5-0.7) pasuje do zwykłej pracy asystenta.
  • Wyższa (0.8+) pasuje do burzy mózgów i twórczego pisania.
  • Utrzymuj rozsądną długość kontekstu blisko limitu pamięci.
  • Używaj person, gdy potrzebujesz trwałych parametrów modelu i promptu systemowego wielokrotnego użytku.

Rozwiązywanie problemów

Pobieranie nie działa

  • Sprawdź, czy Ollama działa: ollama list.
  • Wypróbuj to samo pobieranie w terminalu, aby zobaczyć surowy błąd Ollama.
  • Przed dużymi modelami sprawdź miejsce na dysku.
  • Przy filtrze chmurowym pozwól Libre WebUI obsłużyć przyrostki.

Odpowiedzi są wolne

  • Wypróbuj mniejszy model lub niższą kwantyzację.
  • Użyj ollama ps, aby sprawdzić załadowane modele.
  • Zamknij aplikacje intensywnie używające GPU.
  • Zmniejsz długość kontekstu.

Brak pamięci

  • Przejdź z Q8 na Q4.
  • Użyj modelu 8B zamiast 14B.
  • Pozostaw załadowany tylko potrzebny model.
  • W Dockerze sprawdź dostęp kontenera do GPU lub Ollama na hoście.

Powiązana dokumentacja