Hoppa till huvudinnehåll

Arbeta med AI-modeller

Libre WebUI kan använda lokala Ollama-modeller och pluginbaserade molnmodeller i samma arbetsyta. Model Manager visar installerade Ollama-modeller, modeller som körs, aktuella resultat från Ollama Library, Hugging Face GGUF-poster och Ollama Cloud-poster där de är tillgängliga.

Välj en första modell

Använd dessa som utgångspunkter och byt sedan utifrån din hårdvara och uppgift:

ModellPassar förTypisk passform
gemma4:12bSnabb allmän chatt16 GB RAM eller 8 GB VRAM
qwen3.8:27bAllmän chatt, kodning, flerspråkighet32 GB RAM eller 16–24 GB VRAM
gemma4:26bStark chatt med MoE-effektivitet24 GB RAM eller 16 GB VRAM
gemma4:31bTät lokal chatt med högsta kvalitet32 GB RAM eller 24 GB VRAM
nomic-embed-textDokumentinbäddningarLiten lokal inbäddningsmodell

Stora modeller som 30B, 70B och MoE-modeller kan vara utmärkta, men kräver mycket mer minne. Om du är osäker, börja med en liten modell och gå uppåt när den fungerar smidigt.

Model Manager

Öppna Settings → Models för att:

  • Hämta modeller från Ollama efter namn.
  • Söka i aktuella resultat från Ollama Library i stället för att förlita dig på en statisk lista.
  • Visa installerade modeller och modeller som körs.
  • Uppdatera alla installerade Ollama-modeller i en enda åtgärd.
  • Stoppa eller avlasta modeller som körs.
  • Radera modeller som du inte längre behöver.
  • Hämta Hugging Face GGUF-modeller genom Ollama när de är kompatibla.
  • Hämta Ollama Cloud-modeller via molnfiltret.

För Ollama Cloud-resultat normaliserar gränssnittet molnmodellernas namn före hämtning. Om en molnmodell kräver suffixet :cloud eller -cloud lägger Libre WebUI till det åt dig genom molnmodellflödet.

Modellkatalog och synlighet

Model Catalog i Settings → Defaults listar alla chattmodeller som du kan välja, både lokala och leverantörsbaserade, med en leverantörsbricka och ett sökfält. Välj standardmodellen ovanför katalogen för att ange vilken modell nya chattar ska starta med.

Administratörer kan stjärnmärka en modell för att fästa den högst upp i katalogen och i menyn för standardmodell. Om flera modeller stjärnmärks hamnar den senast stjärnmärkta först, och när stjärnan tas bort återgår modellen till sin manuella eller leverantörsbestämda placering.

Administratörer får ytterligare en kontroll per rad: ett ögonreglage som döljer en modell från alla andras modellväljare. Genom att dölja modeller kan långa kataloger begränsas till de modeller som servern faktiskt vill att människor använder. Det är en förfining av listningen, inte en behörighetsspärr, så behandla den som kurering och inte en säkerhetsgräns. Administratörer ser alltid hela listan, med dolda modeller markerade.

Lokala modeller kontra molnmodeller

LägeStyrkorAvvägningar
Lokal OllamaPrivat, offline efter hämtning, förutsägbar kostnadBeror på din CPU/GPU/RAM
Ollama CloudVälkänt Ollama-flöde utan lokala hårdvarugränserKräver molnåtkomst och nätverk
LeverantörspluginÅtkomst till hanterade modeller från flera leverantörerAPI-nycklar, priser och leverantörens integritetspolicy gäller

Du kan behålla lokala modeller för privat arbete och aktivera leverantörsplugin för uppgifter som behöver större molnbaserade modeller.

Standardmodell för bildförståelse

Du kan chatta med en snabb textmodell och ändå skicka bilder. Välj en bildmodell under Settings → Defaults → Specialized Models → Vision Model. När den utgående chattkontexten innehåller bilder — en ny bilaga, en tidigare bild i sessionen eller historik i en inkognitochatt — dirigeras den turen till den konfigurerade bildmodellen i stället för sessionsmodellen. Turer med enbart text fortsätter använda sessionsmodellen.

Inställningen är per användare, och dirigeringen är automatisk och tyst. Om valet lämnas på Use the current chat model inaktiveras den. Observera att kontrollen gäller bilder, inte sessionsmodellens funktioner. När en bildmodell är konfigurerad använder varje tur med bilder den, även om sessionsmodellen själv kan hantera bilder.

Valet lagrar exakt leverantörsidentitet (Ollama eller ett visst plugin) tillsammans med modellnamnet, så att en leverantör inte kan ta över en modell med identiskt namn. Om det sparade valet förlorar identiteten — till exempel om modellen eller leverantören inte längre är tillgänglig — misslyckas en tur med bilder. Välj modellen igen under Settings → Defaults → Specialized Models → Vision Model för att reparera inställningen. Det högljudda felet är avsiktligt. Libre WebUI ersätter inte leverantören i tysthet.

Modeller för Work

Work behöver en chattmodell som kan anropa verktyg. Den kan använda:

  • En installerad Ollama-modell som annonserar funktionen tools.
  • En Ollama Cloud-modell som är tillgänglig genom den konfigurerade Ollama-slutpunkten.
  • En modell som listas av ett aktivt chatt- eller kompletteringsplugin med uppgifter konfigurerade för den aktuella administratören.

Pluginbaserade Work-körningar använder den leverantörsadapter som passar det konfigurerade pluginet: OpenAI-kompatibel, Anthropic eller Gemini. Libre WebUI sparar exakt leverantörstyp och pluginidentifierare med uppgiften och varje körning, så ett plugin inte kan ta över en Ollama-modell med samma namn. Om den valda modellen eller leverantören avvisar verktygsanrop misslyckas körningen i stället för att byta till en annan leverantör i tysthet.

Lokal Ollama håller modellförfrågningar på den konfigurerade Ollama-infrastrukturen. Med en fjärrmodell får den konfigurerade leverantören Work-systemprompten, samtalet, verktygsdefinitioner och verktygsresultat. Verktygsresultat kan innehålla källtext, kommandoutdata eller kataloglistor som modellen begärt. Arbetsytevolymer och leverantörsuppgifter stannar på backendvärden, men innehållet i en fil kan lämna värden när det ingår i ett verktygsresultat.

En autonom Work-körning kan göra flera modellanrop. Kontrollera fjärrleverantörens priser, lagrings- och träningspolicyer innan känsliga projekt används. Libre WebUI visar ett meddelande om fjärrleverantören i Work som varje användare kan avfärda.

Hårdvaruguide

SystemPraktiskt modellintervallKommentarer
Endast CPU, 8–16 GB RAM1B–4BBra för lätt chatt och testning
8 GB VRAM4B–8B kvantiseradBekväm startpunkt
12–16 GB VRAM8B–14B kvantiseradBra intervall för daglig användning
24 GB VRAM14B–32B kvantiseradStark lokal arbetsstation
48 GB+ VRAM eller stort enhetligt minne32B–70B kvantiseradExperiment med stora modeller

Kvantiserade modeller använder mindre minne. Q4-kvantisering är vanligtvis det praktiska standardvalet. Q8 använder mer minne för bättre kvalitet.

Rekommendationer efter uppgift

UppgiftModellinriktning
Snabb chattgemma4:12b och andra små aktuella modeller
KodningQwen Coder, Codestral, kodningsmodeller från leverantörer
ResonemangStörre Qwen- och Gemma-modeller, resonemangsmodeller från leverantörer
BildförståelseMultimodala modeller som LLaVA, Qwen VL eller leverantörers bildmodeller
Dokumentsökningnomic-embed-text eller en annan inbäddningsmodell
Text-till-talTTS-plugin som Qwen3-TTS eller Kyutai TTS

Leverantörers modellnamn ändras ofta. Använd leverantörens modellsökning i Libre WebUI när den finns, eller klistra in exakt modell-ID från leverantörens instrumentpanel.

Promptar och inställningar

  • Genereringskontroller som temperature, tokengränser, kontextlängd och straffvärden grupperas under Advanced generation settings och är stängda som standard.
  • Lägre temperature (0.1-0.3) för faktabaserade, repeterbara svar.
  • Medelhög temperature (0.5-0.7) för normalt assistentarbete.
  • Högre temperature (0.8+) för idégenerering och kreativt skrivande.
  • Håll kontextlängden rimlig när du närmar dig minnesgränserna.
  • Använd personas när du vill ha beständiga modellparametrar och en återanvändbar systemprompt.

Felsökning

Hämtningen misslyckas

  • Bekräfta att Ollama körs: ollama list.
  • Prova samma hämtning i en terminal för att se Ollamas råa fel.
  • Kontrollera diskutrymmet innan stora modeller hämtas.
  • Om du använder molnfiltret i Model Manager ska Libre WebUI hantera molnsuffixen.

Svaren är långsamma

  • Prova en mindre modell eller lägre kvantisering.
  • Kontrollera vad som är inläst med ollama ps.
  • Stäng andra GPU-krävande appar.
  • Minska kontextlängden.

Slut på minne

  • Byt från Q8 till Q4.
  • Använd en 8B-modell i stället för en 14B-modell.
  • Håll endast modellen du behöver inläst.
  • I Docker: bekräfta att containern kan nå GPU:n eller värdens Ollama-instans.

Relaterad dokumentation