Porady dla zaawansowanych
Ta strona zbiera praktyczne sposoby pracy, dzięki którym codzienne korzystanie z Libre WebUI jest szybsze, bardziej uporządkowane i niezawodne.
Utrzymuj załadowany mały model do codziennej pracy
Do rutynowych zadań używaj szybkiego modelu lokalnego, a na większe modele przechodź tylko wtedy, gdy zadanie tego wymaga.
Dobre modele do codziennej pracy:
gemma4:12bdo szybkich codziennych rozmówqwen3.8:27bdo bardziej wymagających zadań ogólnychgemma4:26bdla wydajności MoE na mocniejszym sprzęciegemma4:31bdla najlepszej jakości lokalnego modelu densenomic-embed-textdo embeddingów dokumentów
Otwórz Models, aby sprawdzić uruchomione modele. Gdy zaczyna brakować VRAM, wyładuj modele, których nie używasz.
Używaj czatu incognito do rozmów, które nie powinny być zapisywane
Uruchom czat incognito z menu + na pasku kart, z palety poleceń, strony Home albo przyciskiem ducha na ekranie powitalnym czatu. Dostępny jest też bezpośredni adres: /chat?incognito=1.
Czat incognito nigdy nie jest utrwalany: na serwerze nie powstaje sesja, żadna wiadomość nie jest zapisywana, a rozmowa nie pojawia się na pasku bocznym ani w historii. Czat wyświetla baner Private Mode ("This conversation won't be saved"). Otwarcie zapisanego czatu wyłącza tryb incognito; odświeżenie karty incognito rozpoczyna nowy, pusty prywatny czat, więc wcześniejsze wypowiedzi znikają.
Granica jest ważna: incognito kontroluje trwałość danych, a nie ich ujawnienie dostawcy. Wybrany model — lokalny lub zdalny — nadal otrzymuje całą rozmowę, a kontekst dokumentów nadal obowiązuje, jeśli jest włączony. Jeśli rozmowa nie może opuścić Twojej infrastruktury, połącz incognito z lokalnym modelem Ollama.
Zarządzaj kartami z menu kontekstowego
Kliknij kartę prawym przyciskiem (albo naciśnij Shift + F10, gdy karta ma fokus), aby wybrać:
- Close tab
- Close other tabs
- Close tabs to the right
- Close all tabs
Home jest zawsze pierwszą kartą i nie można jej zamknąć. Administratorzy mają też bezpośrednie pozycje User Management, System i Provider Usage w menu +. Każdą z nich można przypiąć ikoną pinezki z menu awatara do stopki paska bocznego (obok Settings), aby nie trzeba było ponownie otwierać menu.
Poruszaj się szybko dzięki palecie poleceń
Cmd/Ctrl + K otwiera paletę poleceń z każdego miejsca — również wtedy, gdy fokus znajduje się w polu wiadomości. Wyszukiwanie toleruje niepełne i błędnie zapisane hasła w działaniach aplikacji, czatach i zadaniach Work: autmtn znajduje Automations, "pictures" — Imagine, a "dark" — przełącznik motywu. Od trzech znaków przeszukuje również treść wiadomości, notatek i dokumentów (w tym udostępnionych Ci notatek) oraz wyświetla fragment każdego trafienia. Odbywa się to w pamięci na Twoich odszyfrowanych danych; nic nie jest indeksowane na dysku w postaci jawnej. Dopasowane znaki są wyróżniane, wyniki sortowane według trafności, a przy pustym zapytaniu pojawiają się ostatnie czaty i zadania. Nawiguj klawiszami ↑/↓, otwieraj przez Enter, zamykaj przez Esc (lub ponownie Cmd/Ctrl + K).
Motyw domyślny
Nowe instalacje używają ciemnego motywu, stosowanego jeszcze przed pierwszym renderowaniem, aby uniknąć jasnego błysku. Administrator może zmienić domyślny motyw całej instancji w Settings > Zarządzanie użytkownikami > Motyw domyślny (Jasny, Ciemny lub Czysta Czerń). Ten domyślny motyw obowiązuje na stronie logowania, jest przypisywany każdemu nowemu kontu i działa w każdej przeglądarce, która nie wybrała własnego; zapisana preferencja osobista jest zawsze respektowana. Libre WebUI nie podąża za ustawieniem motywu systemu operacyjnego; przełącz go jawnie skrótem Cmd/Ctrl + D, przyciskiem słońce/księżyc lub w Settings. Przełącznik cyklicznie zmienia Jasny, Ciemny, Czysta Czerń i Niebiański.
Niebiański podąża za słońcem: paleta i żywe niebo (słońce lub księżyc na swoim łuku, chmury, gwiazdy po zmierzchu, lampa podążająca nocą za kursorem) zmieniają się minuta po minucie, a wschód i zachód słońca przesuwają się w ciągu roku. Wybierz go w Settings > Wygląd; suwak podgląda tam dowolną minutę doby, a Podążaj za zegarem wraca do czasu rzeczywistego. Bez lokalizacji przyjmowany jest dzień na średniej szerokości geograficznej; udostępnij lokalizację (lub wpisz współrzędne), a wschód i zachód zostaną wyliczone dla Twojego rzeczywistego nieba. Lokalizacja jest zaokrąglana do około kilometra, pozostaje wyłącznie w tej przeglądarce i nigdy nie trafia na serwer. Mając lokalizację, można też włączyć Dopasuj do pogody: bieżące warunki trafiają prosto z Open-Meteo do przeglądarki, a chmury, deszcz, śnieg, mgła i wiatr kształtują niebo.
Skupiaj zadania Work na jednym celu
Używaj osobnego zadania Work dla każdego projektu lub niezależnego celu. Każde zadanie ma własną rozmowę, zarządzaną tożsamość kontenera i trwałe pliki. Sam kontener może zostać zatrzymany lub utworzony ponownie, a jego nazwany wolumin przetrwa. Ponowne użycie tego samego zadania zachowuje użyteczny kontekst, a nowe zadanie tworzy czystą granicę.
Dobra pierwsza instrukcja przekazuje modelowi:
- Oczekiwany rezultat.
- Ważne ograniczenia techniczne lub projektowe.
- Polecenie lub zachowanie potwierdzające ukończenie.
- Pliki lub interfejsy, które muszą pozostać bez zmian.
Śledź postęp w Activity, a następnie sprawdzaj i testuj wynik w Files, Git, Terminal i Preview. Edytor plików obsługuje podświetlanie składni w jasnym i ciemnym motywie, przechowywane w przeglądarce niezapisane wersje robocze oraz formatowanie obsługiwanych typów plików. Użyj Cmd/Ctrl + S, aby zapisać, i Shift + Alt + F, aby sformatować.
Użyj zainstalowanego modelu Ollama obsługującego narzędzia, jeśli ruch modelu ma pozostać w skonfigurowanej infrastrukturze Ollama. Model zdalny lub chmurowy może zmniejszyć obciążenie lokalnej pamięci wnioskowania, ale może wykonywać wiele płatnych wywołań i otrzymuje żądane wyniki narzędzi, które mogą zawierać dane z obszaru roboczego.
Zatrzymanie wykonania lub podglądu zachowuje obszar roboczy. Usunięcie zadania Work trwale go usuwa, dlatego wcześniej skopiuj potrzebne dane.
Używaj person do powtarzalnych zadań
Twórz persony dla często powtarzanych przepływów pracy:
- Zwięzły recenzent kodu z niską temperaturą.
- Redaktor tekstu z jasno określonym przewodnikiem stylu.
- Asystent badawczy z włączonym wyszukiwaniem dokumentów.
- Asystent wsparcia o stałym tonie i strukturze odpowiedzi.
Persony przechowują wybrany model, prompt systemowy, parametry generowania, awatar/tło oraz opcjonalne ustawienia pamięci i mutacji. Można je też eksportować i importować jako JSON.
Przechowuj trwałe notatki obok swojej pracy
Otwórz Notes z menu tworzenia, gdy informacje powinny pozostać niezależne od jednego czatu lub zadania Work. Notatki obsługują podgląd Markdown, jawne edytowanie, wyszukiwanie i automatyczne zapisywanie. Podgląd renderuje też osadzony SVG i podstawowy HTML po oczyszczeniu, dzięki czemu skrypty, procedury obsługi zdarzeń i niebezpieczne adresy URL nigdy się nie uruchamiają. Szuflada narzędzi notatki dodaje historię wersji z przywracaniem, załączniki, przypinanie, udostępnianie użytkownikom (odczyt lub edycja), eksport Markdown i panel edycji AI, który pokazuje każdą propozycję jako diff przed jej zastosowaniem. Ponieważ zastosowanie zmiany najpierw zapisuje migawkę poprzedniej wersji, każdą edycję AI można cofnąć. Notatki należą do konta i są uwzględniane w pełnym archiwum użytkownika; historia wersji i załączniki pozostają w instancji i nie są częścią archiwum.
Zwiększ niezawodność artefaktów
Libre WebUI wykrywa jawne znaczniki artefaktów, bloki kodu, samodzielne dokumenty HTML i typowe wieloplikowe pakiety HTML. Aby uzyskać najlepszy artefakt od modelu, poproś:
Create one complete self-contained HTML file.
Inline the CSS and JavaScript.
Do not rely on external files unless they are CDN URLs.
Jeśli chcesz osobne bloki, nadaj im wyraźne nazwy:
```html filename="index.html"
...
```
```css filename="style.css"
...
```
```js filename="app.js"
...
```
Libre WebUI spróbuje połączyć lokalne bloki CSS i JavaScript z podglądem HTML.
Kolejkuj prompty podczas przesyłania odpowiedzi
Wysłanie wiadomości podczas generowania umieszcza prompt w kolejce zamiast go odrzucać. Prompty w kolejce pojawiają się nad polem wiadomości, można je edytować, zmieniać ich kolejność i usuwać, a po zakończeniu każdej odpowiedzi są wysyłane po kolei. Kolejka jest zapisywana z czatem, więc przetrwa odświeżenie lub ponowne połączenie.
Rozgałęziaj rozmowę
Przycisk rozgałęzienia przy dowolnej wiadomości kopiuje rozmowę do tego miejsca, wraz z wariantami, do nowego czatu i zapisuje jej pochodzenie. Oryginał pozostaje bez zmian, więc eksperymentalne dygresje nie zaśmiecają głównego wątku.
Porównuj modele w jednej turze
Przycisk kolumn obok wyboru narzędzi wysyła następny prompt do maksymalnie trzech dodatkowych modeli. Każda odpowiedź jest osobnym generowaniem z własną etykietą modelu, statystykami i przyciskiem anulowania, dzięki czemu wolny lub zawodny model nie blokuje pozostałych.
Używaj czatu z dokumentami świadomie
Document Chat przyjmuje pliki PDF, Office (DOCX/PPTX/XLSX), Markdown, HTML, kod i CSV o rozmiarze do 10 MB. Wyszukiwanie działa w dwóch trybach:
- Wyszukiwanie słów kluczowych (BM25) jest zawsze dostępne.
- Wyszukiwanie hybrydowe łączy ranking semantyczny i ranking słów kluczowych, gdy embeddingi są włączone w Settings i dostępny jest model embeddingowy.
Zainstaluj nomic-embed-text, jeśli potrzebujesz prostego lokalnego modelu embeddingowego:
ollama pull nomic-embed-text
Najlepsze wyniki uzyskasz, przesyłając do każdego czatu skupione dokumenty zamiast jednego ogromnego, mieszanego zestawu.
Dostosuj ustawienia generowania
| Ustawienie | Praktyczne zastosowanie |
|---|---|
| Temperature | Niżej dla dokładności, wyżej dla kreatywnej eksploracji |
| Top P / Top K | Pozostaw wartości domyślne, chyba że świadomie dostrajasz próbkowanie |
| Context window | Zwiększaj dla długich czatów tylko wtedy, gdy model i pamięć sobie poradzą |
| Max tokens | Ogranicz długie odpowiedzi lub zwiększ dla generowania kodu/artefaktów |
| Repeat penalty | Nieznacznie zwiększ, gdy model się zapętla |
Gdy model działa źle, najpierw zmniejsz temperaturę, potem ogranicz presję kontekstu, a następnie wypróbuj inny model.
Określ intensywność rozumowania modelu
Sterowanie obok nazwy modelu w polu wiadomości otwiera poziomy rozumowania: off, on, low, medium i high. Wybór należy do rozmowy, więc przetrwa odświeżenie i obowiązuje przy ponownym generowaniu. Settings > Generation zawiera wartość domyślną nowych odpowiedzi, a panel sterowania czatem pokazuje tę samą wartość.
Jeśli pozostawisz opcję nieustawioną, nic nie zostanie wysłane — tak działały wszystkie wcześniejsze wersje. Po ustawieniu wartości serwer tłumaczy ją dla dostawcy generującego odpowiedź: Ollama otrzymuje ją w treści żądania, dostawcy zgodni z OpenAI — intensywność rozumowania, a Anthropic i Gemini — budżet tokenów z miejscem zarezerwowanym na odpowiedź.
Warto znać dwie kwestie. Model, który według Ollama nie obsługuje rozumowania, w ogóle nie otrzymuje ustawienia, więc sterowanie jest dla niego ukryte. Nazwane poziomy istnieją wyłącznie w modelach, które je publikują, takich jak gpt-oss; w modelu rozumującym bez poziomów nazwany poziom działa po prostu jak on, więc czat przełączający modele nie zgłasza błędu. Gdy ustawiono globalną lub przypiętą wartość domyślną, przycisk pokazuje poziom faktycznie używany w następnej odpowiedzi, a pozycja "Default" podaje jej bieżące rozwiązanie.
Obserwuj okno kontekstu
Pierścień obok nazwy modelu wypełnia się wraz ze wzrostem rozmowy. Najedź na niego, aby zobaczyć zapełnienie okna, użyte tokeny i rozmiar okna. Po przekroczeniu czterech piątych zmienia kolor na bursztynowy, a przy granicy — na czerwony; model z nieznanym oknem ma pierścień przerywany zamiast pustego.
Licznik obejmuje to, co faktycznie wyśle następne żądanie — skompaktowana historia i porzucone gałęzie nic nie kosztują. Opiera się na pomiarze dostawcy z ostatniej odpowiedzi, jeśli został zgłoszony, oraz oszacowaniu jednego tokenu na cztery znaki dodane później. Gdy pomiar jeszcze nie istnieje, wynik jest oznaczony ~. Jeśli limit okna jest niższy od długości, dla której model został wytrenowany, miernik to wskazuje: mierzy rzeczywiste okno żądania, czyli OLLAMA_MAX_CONTEXT (domyślnie 32,768), a nie pełną wytrenowaną długość modelu. Zwiększenie tej zmiennej zwiększa zarówno rzeczywiste okno, jak i miernik.
Modele dostawców pokazują rozmiar okna tylko wtedy, gdy publikuje go ich lista modeli. W przeciwnym razie miernik nadal zlicza tokeny, ale nie ma wartości, przez którą mógłby je podzielić.
Pozwól długim czatom kompaktować się automatycznie
Administratorzy mogą włączyć context compaction w Settings > Generation. Gdy oszacowany kontekst rozmowy przekroczy próg tokenów, serwer prosi model o podsumowanie starszych wiadomości i zachowuje dosłownie tylko najnowsze. Podsumowanie pojawia się na karcie podsumowania w miejscu złożenia historii, a podsumowane wiadomości są przyciemnione: nadal czytelne, lecz niewysyłane do modelu. Po włączeniu kompaktowania liczba "recent messages kept" jest też ruchomym oknem wysyłanym przez rozmowę, więc jej zwiększenie faktycznie poszerza kontekst widziany przez model.
| Ustawienie | Co kontroluje |
|---|---|
| Token threshold | Szacowany rozmiar kontekstu uruchamiający kompaktowanie |
| Recent messages kept | Liczba najnowszych wiadomości zawsze zachowywanych dosłownie |
| Compaction model | Model tworzący podsumowania; domyślnie model rozmowy |
| Custom summary prompt | Własne instrukcje z {{PREVIOUS_SUMMARY}} i {{MESSAGES}} |
Kompaktowanie jest domyślnie wyłączone i dotyczy każdego użytkownika serwera, ale każdy czat zachowuje kontrolę: w panelu czatu można wyłączyć kompaktowanie dla jednej rozmowy, a każda karta podsumowania ma opcję cofnięcia. Przywrócenie ponownie aktywuje dokładnie wiadomości zastąpione przez dane podsumowanie, po jednym kompaktowaniu. Tura nigdy nie jest dzielona: wiadomości zachowane dosłownie zawsze zaczynają się od Twojej. Każde nowe kompaktowanie włącza poprzednie podsumowanie do nowego, więc rozmowa ma jedno bieżące podsumowanie. Jeśli model podsumowujący zawiedzie, generowanie trwa z nieskompaktowaną historią zamiast zostać zablokowane.
Przechowuj klucze dostawców osobno dla użytkowników
Wtyczki dostawców mogą odczytywać klucze środowiskowe, ale w instalacjach współdzielonych dane logowania użytkownika są zwykle bardziej przejrzyste. Dodaj klucze w Settings, aby każdy użytkownik kontrolował własny dostęp do dostawców.
Zmienne środowiskowe backendu stosuj jako wartości domyślne całego wdrożenia lub w zautomatyzowanych instalacjach.
Zapewnij przewidywalny dostęp zdalny
Aby uzyskać dostęp z telefonu lub sieci LAN, powiąż serwer deweloperski z interfejsem sieciowym:
npm run dev:host
Na drugim urządzeniu otwórz adres LAN lub Tailscale komputera na porcie 8080 (dev:host udostępnia frontend na 8080, a nie na domyślnym porcie Vite). W środowisku produkcyjnym jawnie ustaw CORS_ORIGIN i adres API frontendu, aby przeglądarki nie wracały do localhost.
Sprawdzaj wersję bez opuszczania aplikacji
Settings → About porównuje kompilację z najnowszym wydaniem GitHub: informuje, że używasz bieżącej wersji, łączy ze stroną wydania, jeśli wersja jest starsza, i wskazuje kompilację -dev wyprzedzającą przypięte wydanie. W tym samym wierszu przycisk View changelog ponownie otwiera informacje o wydaniu wyświetlone po aktualizacji. Jeśli Libre WebUI jest dla Ciebie przydatny, łącze Star on GitHub jest najłatwiejszym sposobem, by pomóc innym go znaleźć.
Utrzymuj zgodność dokumentacji i interfejsu
Produkt zmienia się szybko. Preferuj trwałą dokumentację opisującą zachowanie i przepływy pracy, a interfejsowi pozwól wyświetlać aktualne listy modeli dostawców. Nie kopiuj obszernych katalogów dostawców do dokumentacji, chyba że lista jest generowana przez aplikację.