Sari la conținutul principal

Lucrul cu modele AI

Libre WebUI folosește modele Ollama locale și cloud prin plugin în același workspace. Model Manager arată instalate, active, Ollama Library live, Hugging Face GGUF și Ollama Cloud.

Primul model

ModelPotrivit pentruResurse tipice
gemma4:12bChat general rapid16 GB RAM sau 8 GB VRAM
qwen3.8:27bChat, cod, multilingv32 GB RAM sau 16–24 GB VRAM
gemma4:26bChat puternic cu eficiență MoE24 GB RAM sau 16 GB VRAM
gemma4:31bChat local dense de calitate32 GB RAM sau 24 GB VRAM
nomic-embed-textEmbeddings documenteModel local mic

Modelele 30B, 70B și MoE cer mult mai multă memorie. Începeți mic și creșteți după ce rulează bine.

Model Manager

În Settings → Models puteți descărca după nume, căuta biblioteca live, vedea/opriri modele, actualiza toate modelele Ollama instalate într-o singură operație, șterge și descărca GGUF sau Cloud. Pentru Cloud, UI normalizează :cloud sau -cloud.

Catalog și vizibilitate

Model Catalog din Settings → Defaults listează toate modelele cu badge și căutare. Alegeți modelul implicit deasupra catalogului pentru a stabili cu ce încep chaturile noi. Adminul poate marca un model cu stea, ca să fie fixat în capul catalogului și al meniului de model implicit: cu mai multe stele apare primul cel marcat cel mai recent, iar scoaterea stelei readuce poziția manuală sau cea a furnizorului. Adminul poate și ascunde un model din selecțiile altora. Aceasta este curatare a listei, nu control de acces; admin vede totul.

Local vs cloud

ModAvantajeCompromisuri
Ollama localPrivat, offline, cost previzibilDepinde de CPU/GPU/RAM
Ollama CloudFlux Ollama fără limite localeCere cloud și rețea
Plugin furnizorModele administrate din mai mulțiChei, prețuri și privacy se aplică

Păstrați local pentru lucru privat și activați pluginuri pentru modele găzduite mai mari.

Model vision implicit

Alegeți în Settings → Defaults → Specialized Models → Vision Model. Orice tură cu imagine — atașament nou, imagine anterioară sau istoric incognito — se rutează la el; text-only rămâne la modelul sesiunii.

Setarea este per utilizator, automată și silențioasă. Use the current chat model o dezactivează. Se verifică prezența imaginii, nu capabilitatea modelului curent.

Se stochează identitatea exactă a furnizorului, astfel unul nu poate captura același nume. Dacă identitatea dispare, tura cu imagine eșuează. Selectați din nou modelul în Settings → Defaults → Specialized Models → Vision Model pentru a repara; eșecul zgomotos este intenționat, iar Libre WebUI nu substituie silențios alt furnizor.

Modele pentru Work

Work cere chat cu unelte:

  • Ollama instalat care declară tools.
  • Ollama Cloud disponibil.
  • Model din plugin activ cu credentiale admin.

Rulările folosesc adaptor OpenAI, Anthropic sau Gemini și persistă tipul/ID-ul exact, deci pluginul nu capturează Ollama cu același nume. Respingerea uneltelor eșuează fără switch.

Ollama local păstrează cererile local. Furnizorul remote primește system prompt Work, conversație, definiții și rezultate ce pot include surse, output și directoare. Volumes și credentiale rămân pe host, dar conținutul poate pleca prin rezultat.

O rulare poate face multe calls. Verificați pricing, retention și training înainte de proiecte sensibile. Work arată un avertisment per utilizator.

Ghid hardware

SistemInterval practicNote
CPU, 8–16 GB RAM1B–4BChat ușor și test
8 GB VRAM4B–8B quantizedStart confortabil
12–16 GB VRAM8B–14B quantizedUtilizare zilnică
24 GB VRAM14B–32B quantizedStație locală puternică
48 GB+ VRAM/memorie unificată32B–70B quantizedExperimente mari

Q4 este implicit practic; Q8 folosește mai mult pentru calitate.

Recomandări

SarcinăDirecție
Chat rapidgemma4:12b și modele mici
CodQwen Coder, Codestral, modele provider
RaționamentQwen/Gemma mari sau provider reasoning
VisionLLaVA, Qwen VL sau provider vision
Documentenomic-embed-text sau alt embedding
TTSQwen3-TTS sau Kyutai TTS

Numele se schimbă. Folosiți discovery sau ID exact din dashboard.

Prompturi și setări

  • Temperature, token limits, context și penalties sunt în Advanced generation settings.
  • 0.1-0.3 factual/repetabil, 0.5-0.7 normal, 0.8+ creativ.
  • Păstrați context rezonabil și folosiți personaje pentru parametri persistenți.

Depanare

Download eșuează: verificați ollama list, terminalul, discul și lăsați Libre să gestioneze suffix cloud.

Lent: model/quantization mai mic, ollama ps, închideți apps GPU, reduceți context.

Memorie: Q8→Q4, 14B→8B, un singur model; în Docker verificați GPU/Ollama host.

Documentație asociată