Arbejde med AI-modeller
Libre WebUI kan bruge lokale Ollama-modeller og pluginbaserede cloudmodeller i samme arbejdsområde. Model Manager viser installerede Ollama-modeller, modeller der kører, aktuelle resultater fra Ollama Library, Hugging Face GGUF-poster og Ollama Cloud-poster, hvor de er tilgængelige.
Vælg en første model
Brug disse som udgangspunkter, og skift derefter ud fra din hardware og opgave:
| Model | God til | Typisk behov |
|---|---|---|
gemma4:12b | Hurtig generel chat | 16 GB RAM eller 8 GB VRAM |
qwen3.8:27b | Generel chat, kodning, flersproget brug | 32 GB RAM eller 16-24 GB VRAM |
gemma4:26b | Stærk chat med MoE-effektivitet | 24 GB RAM eller 16 GB VRAM |
gemma4:31b | Lokal chat med en tæt model af højeste kvalitet | 32 GB RAM eller 24 GB VRAM |
nomic-embed-text | Dokument-embeddings | Lille lokal embeddingmodel |
Store modeller som 30B, 70B og MoE-modeller kan være fremragende, men kræver meget mere hukommelse. Hvis du er i tvivl, skal du begynde med en lille model og gå op i størrelse, når den fungerer problemfrit.
Model Manager
Åbn Settings → Models for at:
- Hente modeller fra Ollama efter navn.
- Søge i aktuelle resultater fra Ollama Library i stedet for at stole på en statisk liste.
- Se installerede modeller og modeller, der kører.
- Opdatere alle installerede Ollama-modeller i én handling.
- Stoppe eller aflaste modeller, der kører.
- Slette modeller, du ikke længere har brug for.
- Hente Hugging Face GGUF-modeller gennem Ollama, når de er kompatible.
- Hente Ollama Cloud-modeller via cloudfilteret.
For Ollama Cloud-resultater normaliserer grænsefladen cloudmodellernes navne før
download. Hvis en cloudmodel kræver suffikset :cloud eller -cloud, tilføjer Libre
WebUI det for dig gennem cloudmodelflowet.
Modelkatalog og synlighed
Model Catalog i Settings → Defaults viser alle chatmodeller, du kan vælge, både lokale og udbyderbaserede, med et udbydermærke og et søgefelt. Vælg standardmodellen over kataloget for at bestemme, hvilken model nye chats starter med.
Administratorer kan stjernemarkere en model for at fastgøre den øverst i kataloget og i menuen med standardmodeller. Stjernemarkeres flere modeller, kommer den senest markerede først, og når stjernen fjernes, vender modellen tilbage til sin manuelle eller udbyderbestemte placering.
Administratorer får én ekstra kontrol pr. række: en øjenkontakt, der skjuler en model fra alle andres modelvælgere. Skjulning begrænser lange kataloger til de modeller, serveren faktisk ønsker, at folk bruger. Det er en forbedring af visningen, ikke en adgangskontrol, så behandl det som kuratering og ikke en sikkerhedsgrænse. Administratorer ser altid hele listen med skjulte modeller markeret.
Lokale modeller kontra cloudmodeller
| Tilstand | Styrker | Afvejninger |
|---|---|---|
| Lokal Ollama | Privat, offline efter download, forudsigelig pris | Afhænger af din CPU/GPU/RAM |
| Ollama Cloud | Velkendt Ollama-flow uden lokale hardwaregrænser | Kræver cloudadgang og netværk |
| Udbyderplugins | Adgang til administrerede modeller fra flere udbydere | API-nøgler, priser og udbyderens privatlivspolitik gælder |
Du kan beholde lokale modeller til privat arbejde og aktivere udbyderplugins til opgaver, der kræver større cloudbaserede modeller.
Standardmodel til billedforståelse
Du kan chatte med en hurtig tekstmodel og stadig sende billeder. Vælg en billedmodel under Settings → Defaults → Specialized Models → Vision Model. Når den udgående chatkontekst indeholder billeder — en ny vedhæftning, et tidligere billede i sessionen eller historik i en inkognitochat — routes den tur til den konfigurerede billedmodel i stedet for sessionsmodellen. Ture med kun tekst bruger fortsat sessionsmodellen.
Indstillingen gælder pr. bruger, og routingen er automatisk og lydløs. Hvis valget står på Use the current chat model, deaktiveres den. Bemærk, at kontrollen gælder billeder, ikke sessionsmodellens egenskaber. Når en billedmodel er konfigureret, bruger hver tur med billeder den, selv hvis sessionsmodellen selv kan håndtere billeder.
Valget gemmer den nøjagtige udbyderidentitet (Ollama eller et bestemt plugin) sammen med modelnavnet, så en udbyder ikke kan overtage en model med samme navn. Hvis det gemte valg mister identiteten — for eksempel hvis modellen eller udbyderen ikke længere er tilgængelig — mislykkes en tur med billeder. Vælg modellen igen under Settings → Defaults → Specialized Models → Vision Model for at reparere den. Den tydelige fejl er bevidst. Libre WebUI erstatter ikke udbyderen lydløst.
Modeller til Work
Work kræver en chatmodel, der kan kalde værktøjer. Den kan bruge:
- En installeret Ollama-model, der annoncerer funktionen
tools. - En Ollama Cloud-model, der er tilgængelig gennem det konfigurerede Ollama-slutpunkt.
- En model, der vises af et aktivt chat- eller completionplugin med legitimationsoplysninger konfigureret for den aktuelle administrator.
Pluginbaserede Work-kørsler bruger den udbyderadapter, der passer til det konfigurerede plugin: OpenAI-kompatibel, Anthropic eller Gemini. Libre WebUI gemmer den nøjagtige udbydertype og pluginidentifikator med opgaven og hver kørsel, så et plugin ikke kan overtage en Ollama-model med samme navn. Hvis den valgte model eller udbyder afviser værktøjskald, mislykkes kørslen i stedet for lydløst at skifte til en anden udbyder.
Lokal Ollama holder modelanmodninger på den konfigurerede Ollama-infrastruktur. Med en ekstern model modtager den konfigurerede udbyder Work-systemprompten, samtalen, værktøjsdefinitionerne og værktøjsresultaterne. Værktøjsresultater kan indeholde kildetekst, kommandooutput eller mappelister, som modellen har anmodet om. Arbejdsområdevolumener og udbyderlegitimationsoplysninger bliver på backendværten, men indholdet i en fil kan forlade værten, når det indgår i et værktøjsresultat.
Én selvstændig Work-kørsel kan foretage flere modelkald. Kontrollér den eksterne udbyders priser, opbevarings- og træningspolitikker, før du bruger følsomme projekter. Libre WebUI viser en meddelelse om den eksterne udbyder i Work, som hver bruger kan afvise.
Hardwarevejledning
| System | Praktisk modelområde | Bemærkninger |
|---|---|---|
| Kun CPU, 8-16 GB RAM | 1B-4B | God til let chat og test |
| 8 GB VRAM | 4B-8B kvantiseret | Behageligt udgangspunkt |
| 12-16 GB VRAM | 8B-14B kvantiseret | Godt område til daglig brug |
| 24 GB VRAM | 14B-32B kvantiseret | Stærk lokal arbejdsstation |
| 48 GB+ VRAM eller stor samlet hukommelse | 32B-70B kvantiseret | Eksperimenter med store modeller |
Kvantiserede modeller bruger mindre hukommelse. Q4-kvantisering er normalt det praktiske standardvalg. Q8 bruger mere hukommelse for bedre kvalitet.
Anbefalinger efter opgave
| Opgave | Modelretning |
|---|---|
| Hurtig chat | gemma4:12b og andre små aktuelle modeller |
| Kodning | Qwen Coder, Codestral, kodemodeller fra udbydere |
| Ræsonnering | Større Qwen- og Gemma-modeller, ræsonneringsmodeller fra udbydere |
| Billedforståelse | Multimodale modeller som LLaVA, Qwen VL eller udbyderes billedmodeller |
| Dokumentsøgning | nomic-embed-text eller en anden embeddingmodel |
| Tekst-til-tale | TTS-plugins som Qwen3-TTS eller Kyutai TTS |
Udbydernes modelnavne ændres ofte. Brug udbyderens modelsøgning i Libre WebUI, når den findes, eller indsæt det nøjagtige model-ID fra udbyderens dashboard.
Prompter og indstillinger
- Genereringskontroller som temperature, tokengrænser, kontekstlængde og strafværdier er samlet under Advanced generation settings og er lukket som standard.
- Lavere temperature (
0.1-0.3) til faktabaserede, reproducerbare svar. - Middel temperature (
0.5-0.7) til almindeligt assistentarbejde. - Højere temperature (
0.8+) til idéudvikling og kreativ skrivning. - Hold kontekstlængden rimelig, når du nærmer dig hukommelsesgrænserne.
- Brug personaer, når du ønsker vedvarende modelparametre og en genanvendelig systemprompt.
Fejlfinding
Download mislykkes
- Bekræft, at Ollama kører:
ollama list. - Prøv samme download i en terminal for at se Ollamas rå fejl.
- Kontrollér diskpladsen, før du henter store modeller.
- Hvis du bruger cloudfilteret i Model Manager, skal Libre WebUI håndtere cloudsuffikserne.
Svarene er langsomme
- Prøv en mindre model eller en lavere kvantisering.
- Kontrollér, hvad der er indlæst, med
ollama ps. - Luk andre GPU-tunge programmer.
- Reducer kontekstlængden.
Ikke nok hukommelse
- Skift fra Q8 til Q4.
- Brug en 8B-model i stedet for en 14B-model.
- Hold kun den model, du har brug for, indlæst.
- I Docker skal du bekræfte, at containeren kan nå GPU'en eller værtens Ollama-instans.