Hop til hovedindhold

Arbejde med AI-modeller

Libre WebUI kan bruge lokale Ollama-modeller og pluginbaserede cloudmodeller i samme arbejdsområde. Model Manager viser installerede Ollama-modeller, modeller der kører, aktuelle resultater fra Ollama Library, Hugging Face GGUF-poster og Ollama Cloud-poster, hvor de er tilgængelige.

Vælg en første model

Brug disse som udgangspunkter, og skift derefter ud fra din hardware og opgave:

ModelGod tilTypisk behov
gemma4:12bHurtig generel chat16 GB RAM eller 8 GB VRAM
qwen3.8:27bGenerel chat, kodning, flersproget brug32 GB RAM eller 16-24 GB VRAM
gemma4:26bStærk chat med MoE-effektivitet24 GB RAM eller 16 GB VRAM
gemma4:31bLokal chat med en tæt model af højeste kvalitet32 GB RAM eller 24 GB VRAM
nomic-embed-textDokument-embeddingsLille lokal embeddingmodel

Store modeller som 30B, 70B og MoE-modeller kan være fremragende, men kræver meget mere hukommelse. Hvis du er i tvivl, skal du begynde med en lille model og gå op i størrelse, når den fungerer problemfrit.

Model Manager

Åbn Settings → Models for at:

  • Hente modeller fra Ollama efter navn.
  • Søge i aktuelle resultater fra Ollama Library i stedet for at stole på en statisk liste.
  • Se installerede modeller og modeller, der kører.
  • Opdatere alle installerede Ollama-modeller i én handling.
  • Stoppe eller aflaste modeller, der kører.
  • Slette modeller, du ikke længere har brug for.
  • Hente Hugging Face GGUF-modeller gennem Ollama, når de er kompatible.
  • Hente Ollama Cloud-modeller via cloudfilteret.

For Ollama Cloud-resultater normaliserer grænsefladen cloudmodellernes navne før download. Hvis en cloudmodel kræver suffikset :cloud eller -cloud, tilføjer Libre WebUI det for dig gennem cloudmodelflowet.

Modelkatalog og synlighed

Model Catalog i Settings → Defaults viser alle chatmodeller, du kan vælge, både lokale og udbyderbaserede, med et udbydermærke og et søgefelt. Vælg standardmodellen over kataloget for at bestemme, hvilken model nye chats starter med.

Administratorer kan stjernemarkere en model for at fastgøre den øverst i kataloget og i menuen med standardmodeller. Stjernemarkeres flere modeller, kommer den senest markerede først, og når stjernen fjernes, vender modellen tilbage til sin manuelle eller udbyderbestemte placering.

Administratorer får én ekstra kontrol pr. række: en øjenkontakt, der skjuler en model fra alle andres modelvælgere. Skjulning begrænser lange kataloger til de modeller, serveren faktisk ønsker, at folk bruger. Det er en forbedring af visningen, ikke en adgangskontrol, så behandl det som kuratering og ikke en sikkerhedsgrænse. Administratorer ser altid hele listen med skjulte modeller markeret.

Lokale modeller kontra cloudmodeller

TilstandStyrkerAfvejninger
Lokal OllamaPrivat, offline efter download, forudsigelig prisAfhænger af din CPU/GPU/RAM
Ollama CloudVelkendt Ollama-flow uden lokale hardwaregrænserKræver cloudadgang og netværk
UdbyderpluginsAdgang til administrerede modeller fra flere udbydereAPI-nøgler, priser og udbyderens privatlivspolitik gælder

Du kan beholde lokale modeller til privat arbejde og aktivere udbyderplugins til opgaver, der kræver større cloudbaserede modeller.

Standardmodel til billedforståelse

Du kan chatte med en hurtig tekstmodel og stadig sende billeder. Vælg en billedmodel under Settings → Defaults → Specialized Models → Vision Model. Når den udgående chatkontekst indeholder billeder — en ny vedhæftning, et tidligere billede i sessionen eller historik i en inkognitochat — routes den tur til den konfigurerede billedmodel i stedet for sessionsmodellen. Ture med kun tekst bruger fortsat sessionsmodellen.

Indstillingen gælder pr. bruger, og routingen er automatisk og lydløs. Hvis valget står på Use the current chat model, deaktiveres den. Bemærk, at kontrollen gælder billeder, ikke sessionsmodellens egenskaber. Når en billedmodel er konfigureret, bruger hver tur med billeder den, selv hvis sessionsmodellen selv kan håndtere billeder.

Valget gemmer den nøjagtige udbyderidentitet (Ollama eller et bestemt plugin) sammen med modelnavnet, så en udbyder ikke kan overtage en model med samme navn. Hvis det gemte valg mister identiteten — for eksempel hvis modellen eller udbyderen ikke længere er tilgængelig — mislykkes en tur med billeder. Vælg modellen igen under Settings → Defaults → Specialized Models → Vision Model for at reparere den. Den tydelige fejl er bevidst. Libre WebUI erstatter ikke udbyderen lydløst.

Modeller til Work

Work kræver en chatmodel, der kan kalde værktøjer. Den kan bruge:

  • En installeret Ollama-model, der annoncerer funktionen tools.
  • En Ollama Cloud-model, der er tilgængelig gennem det konfigurerede Ollama-slutpunkt.
  • En model, der vises af et aktivt chat- eller completionplugin med legitimationsoplysninger konfigureret for den aktuelle administrator.

Pluginbaserede Work-kørsler bruger den udbyderadapter, der passer til det konfigurerede plugin: OpenAI-kompatibel, Anthropic eller Gemini. Libre WebUI gemmer den nøjagtige udbydertype og pluginidentifikator med opgaven og hver kørsel, så et plugin ikke kan overtage en Ollama-model med samme navn. Hvis den valgte model eller udbyder afviser værktøjskald, mislykkes kørslen i stedet for lydløst at skifte til en anden udbyder.

Lokal Ollama holder modelanmodninger på den konfigurerede Ollama-infrastruktur. Med en ekstern model modtager den konfigurerede udbyder Work-systemprompten, samtalen, værktøjsdefinitionerne og værktøjsresultaterne. Værktøjsresultater kan indeholde kildetekst, kommandooutput eller mappelister, som modellen har anmodet om. Arbejdsområdevolumener og udbyderlegitimationsoplysninger bliver på backendværten, men indholdet i en fil kan forlade værten, når det indgår i et værktøjsresultat.

Én selvstændig Work-kørsel kan foretage flere modelkald. Kontrollér den eksterne udbyders priser, opbevarings- og træningspolitikker, før du bruger følsomme projekter. Libre WebUI viser en meddelelse om den eksterne udbyder i Work, som hver bruger kan afvise.

Hardwarevejledning

SystemPraktisk modelområdeBemærkninger
Kun CPU, 8-16 GB RAM1B-4BGod til let chat og test
8 GB VRAM4B-8B kvantiseretBehageligt udgangspunkt
12-16 GB VRAM8B-14B kvantiseretGodt område til daglig brug
24 GB VRAM14B-32B kvantiseretStærk lokal arbejdsstation
48 GB+ VRAM eller stor samlet hukommelse32B-70B kvantiseretEksperimenter med store modeller

Kvantiserede modeller bruger mindre hukommelse. Q4-kvantisering er normalt det praktiske standardvalg. Q8 bruger mere hukommelse for bedre kvalitet.

Anbefalinger efter opgave

OpgaveModelretning
Hurtig chatgemma4:12b og andre små aktuelle modeller
KodningQwen Coder, Codestral, kodemodeller fra udbydere
RæsonneringStørre Qwen- og Gemma-modeller, ræsonneringsmodeller fra udbydere
BilledforståelseMultimodale modeller som LLaVA, Qwen VL eller udbyderes billedmodeller
Dokumentsøgningnomic-embed-text eller en anden embeddingmodel
Tekst-til-taleTTS-plugins som Qwen3-TTS eller Kyutai TTS

Udbydernes modelnavne ændres ofte. Brug udbyderens modelsøgning i Libre WebUI, når den findes, eller indsæt det nøjagtige model-ID fra udbyderens dashboard.

Prompter og indstillinger

  • Genereringskontroller som temperature, tokengrænser, kontekstlængde og strafværdier er samlet under Advanced generation settings og er lukket som standard.
  • Lavere temperature (0.1-0.3) til faktabaserede, reproducerbare svar.
  • Middel temperature (0.5-0.7) til almindeligt assistentarbejde.
  • Højere temperature (0.8+) til idéudvikling og kreativ skrivning.
  • Hold kontekstlængden rimelig, når du nærmer dig hukommelsesgrænserne.
  • Brug personaer, når du ønsker vedvarende modelparametre og en genanvendelig systemprompt.

Fejlfinding

Download mislykkes

  • Bekræft, at Ollama kører: ollama list.
  • Prøv samme download i en terminal for at se Ollamas rå fejl.
  • Kontrollér diskpladsen, før du henter store modeller.
  • Hvis du bruger cloudfilteret i Model Manager, skal Libre WebUI håndtere cloudsuffikserne.

Svarene er langsomme

  • Prøv en mindre model eller en lavere kvantisering.
  • Kontrollér, hvad der er indlæst, med ollama ps.
  • Luk andre GPU-tunge programmer.
  • Reducer kontekstlængden.

Ikke nok hukommelse

  • Skift fra Q8 til Q4.
  • Brug en 8B-model i stedet for en 14B-model.
  • Hold kun den model, du har brug for, indlæst.
  • I Docker skal du bekræfte, at containeren kan nå GPU'en eller værtens Ollama-instans.

Relateret dokumentation