Lucrul cu modele AI
Libre WebUI folosește modele Ollama locale și cloud prin plugin în același workspace. Model Manager arată instalate, active, Ollama Library live, Hugging Face GGUF și Ollama Cloud.
Primul model
| Model | Potrivit pentru | Resurse tipice |
|---|---|---|
gemma4:12b | Chat general rapid | 16 GB RAM sau 8 GB VRAM |
qwen3.8:27b | Chat, cod, multilingv | 32 GB RAM sau 16–24 GB VRAM |
gemma4:26b | Chat puternic cu eficiență MoE | 24 GB RAM sau 16 GB VRAM |
gemma4:31b | Chat local dense de calitate | 32 GB RAM sau 24 GB VRAM |
nomic-embed-text | Embeddings documente | Model local mic |
Modelele 30B, 70B și MoE cer mult mai multă memorie. Începeți mic și creșteți după ce rulează bine.
Model Manager
În Settings → Models puteți descărca după nume, căuta biblioteca live, vedea/opriri
modele, actualiza toate modelele Ollama instalate într-o singură operație, șterge și
descărca GGUF sau Cloud. Pentru Cloud, UI normalizează :cloud sau -cloud.
Catalog și vizibilitate
Model Catalog din Settings → Defaults listează toate modelele cu badge și căutare. Alegeți modelul implicit deasupra catalogului pentru a stabili cu ce încep chaturile noi. Adminul poate marca un model cu stea, ca să fie fixat în capul catalogului și al meniului de model implicit: cu mai multe stele apare primul cel marcat cel mai recent, iar scoaterea stelei readuce poziția manuală sau cea a furnizorului. Adminul poate și ascunde un model din selecțiile altora. Aceasta este curatare a listei, nu control de acces; admin vede totul.
Local vs cloud
| Mod | Avantaje | Compromisuri |
|---|---|---|
| Ollama local | Privat, offline, cost previzibil | Depinde de CPU/GPU/RAM |
| Ollama Cloud | Flux Ollama fără limite locale | Cere cloud și rețea |
| Plugin furnizor | Modele administrate din mai mulți | Chei, prețuri și privacy se aplică |
Păstrați local pentru lucru privat și activați pluginuri pentru modele găzduite mai mari.
Model vision implicit
Alegeți în Settings → Defaults → Specialized Models → Vision Model. Orice tură cu imagine — atașament nou, imagine anterioară sau istoric incognito — se rutează la el; text-only rămâne la modelul sesiunii.
Setarea este per utilizator, automată și silențioasă. Use the current chat model o dezactivează. Se verifică prezența imaginii, nu capabilitatea modelului curent.
Se stochează identitatea exactă a furnizorului, astfel unul nu poate captura același nume. Dacă identitatea dispare, tura cu imagine eșuează. Selectați din nou modelul în Settings → Defaults → Specialized Models → Vision Model pentru a repara; eșecul zgomotos este intenționat, iar Libre WebUI nu substituie silențios alt furnizor.
Modele pentru Work
Work cere chat cu unelte:
- Ollama instalat care declară
tools. - Ollama Cloud disponibil.
- Model din plugin activ cu credentiale admin.
Rulările folosesc adaptor OpenAI, Anthropic sau Gemini și persistă tipul/ID-ul exact, deci pluginul nu capturează Ollama cu același nume. Respingerea uneltelor eșuează fără switch.
Ollama local păstrează cererile local. Furnizorul remote primește system prompt Work, conversație, definiții și rezultate ce pot include surse, output și directoare. Volumes și credentiale rămân pe host, dar conținutul poate pleca prin rezultat.
O rulare poate face multe calls. Verificați pricing, retention și training înainte de proiecte sensibile. Work arată un avertisment per utilizator.
Ghid hardware
| Sistem | Interval practic | Note |
|---|---|---|
| CPU, 8–16 GB RAM | 1B–4B | Chat ușor și test |
| 8 GB VRAM | 4B–8B quantized | Start confortabil |
| 12–16 GB VRAM | 8B–14B quantized | Utilizare zilnică |
| 24 GB VRAM | 14B–32B quantized | Stație locală puternică |
| 48 GB+ VRAM/memorie unificată | 32B–70B quantized | Experimente mari |
Q4 este implicit practic; Q8 folosește mai mult pentru calitate.
Recomandări
| Sarcină | Direcție |
|---|---|
| Chat rapid | gemma4:12b și modele mici |
| Cod | Qwen Coder, Codestral, modele provider |
| Raționament | Qwen/Gemma mari sau provider reasoning |
| Vision | LLaVA, Qwen VL sau provider vision |
| Documente | nomic-embed-text sau alt embedding |
| TTS | Qwen3-TTS sau Kyutai TTS |
Numele se schimbă. Folosiți discovery sau ID exact din dashboard.
Prompturi și setări
- Temperature, token limits, context și penalties sunt în Advanced generation settings.
0.1-0.3factual/repetabil,0.5-0.7normal,0.8+creativ.- Păstrați context rezonabil și folosiți personaje pentru parametri persistenți.
Depanare
Download eșuează: verificați ollama list, terminalul, discul și lăsați Libre să gestioneze suffix cloud.
Lent: model/quantization mai mic, ollama ps, închideți apps GPU, reduceți context.
Memorie: Q8→Q4, 14B→8B, un singur model; în Docker verificați GPU/Ollama host.