Εργασία με μοντέλα AI
Το Libre WebUI χρησιμοποιεί τοπικά Ollama και cloud μοντέλα plugin στον ίδιο χώρο. Το Model Manager δείχνει εγκατεστημένα και ενεργά Ollama, live Ollama Library, Hugging Face GGUF και Ollama Cloud όπου υπάρχουν.
Επιλογή πρώτου μοντέλου
Σημεία εκκίνησης ανά hardware και εργασία:
| Μοντέλο | Κατάλληλο για | Τυπική προσαρμογή |
|---|---|---|
gemma4:12b | Γρήγορο γενικό chat | 16 GB RAM ή 8 GB VRAM |
qwen3.8:27b | Chat, coding, πολλές γλώσσες | 32 GB RAM ή 16–24 GB VRAM |
gemma4:26b | Ισχυρό chat με αποδοτικότητα MoE | 24 GB RAM ή 16 GB VRAM |
gemma4:31b | Ποιοτικότερο dense τοπικό chat | 32 GB RAM ή 24 GB VRAM |
nomic-embed-text | Embeddings εγγράφων | Μικρό τοπικό embedding |
Μεγάλα 30B, 70B και MoE απαιτούν πολύ μνήμη. Ξεκινήστε μικρά και ανεβείτε όταν λειτουργεί ομαλά.
Model Manager
Στο Settings → Models μπορείτε:
- Να κατεβάζετε Ollama με όνομα και να αναζητάτε live Library.
- Να βλέπετε εγκατεστημένα/ενεργά, να σταματάτε, αποφορτώνετε και διαγράφετε.
- Να ενημερώνετε όλα τα εγκατεστημένα μοντέλα Ollama με μία ενέργεια.
- Να κατεβάζετε συμβατά Hugging Face GGUF και Ollama Cloud.
Για Cloud, το UI κανονικοποιεί ονόματα και προσθέτει :cloud ή -cloud όταν απαιτείται.
Κατάλογος και ορατότητα
Το Model Catalog στο Settings → Defaults παραθέτει όλα τα chat μοντέλα με badge παρόχου και αναζήτηση. Επιλέξτε το προεπιλεγμένο μοντέλο πάνω από τον κατάλογο για να ορίσετε με τι ξεκινούν τα νέα chat.
Οι admins μπορούν να βάλουν αστέρι σε ένα μοντέλο ώστε να καρφιτσωθεί στην κορυφή του καταλόγου και του μενού προεπιλογής. Με πολλά αστέρια προηγείται το πιο πρόσφατο· η αφαίρεση αστεριού επαναφέρει τη χειροκίνητη θέση ή τη θέση του παρόχου.
Οι admins έχουν eye toggle που κρύβει μοντέλο από άλλους. Είναι επιμέλεια λίστας, όχι authorization boundary. Οι admins βλέπουν πάντα όλη τη λίστα με ένδειξη κρυφών.
Τοπικά και cloud
| Τρόπος | Πλεονεκτήματα | Συμβιβασμοί |
|---|---|---|
| Τοπικό Ollama | Ιδιωτικό, offline μετά λήψη, προβλέψιμο κόστος | Εξαρτάται από CPU/GPU/RAM |
| Ollama Cloud | Γνώριμη ροή χωρίς τοπικά όρια hardware | Απαιτεί cloud και δίκτυο |
| Provider plugins | Πολλοί managed πάροχοι | Keys, τιμές και privacy policy παρόχου |
Κρατήστε τοπικά για ιδιωτική εργασία και ενεργοποιήστε provider plugin για μεγαλύτερα hosted μοντέλα.
Προεπιλεγμένο μοντέλο όρασης
Μπορείτε να χρησιμοποιείτε γρήγορο text model και να στέλνετε εικόνες. Επιλέξτε στο Settings → Defaults → Specialized Models → Vision Model. Κάθε σειρά με εικόνα — νέα, παλιότερη ή incognito history — δρομολογείται εκεί, ενώ text-only μένει στο session model.
Η ρύθμιση είναι ανά χρήστη, αυτόματη και σιωπηρή. Use the current chat model την απενεργοποιεί. Ελέγχεται η παρουσία εικόνας, όχι η ικανότητα του session model.
Αποθηκεύεται ακριβής identity παρόχου, ώστε ίδιο όνομα να μην καταληφθεί. Αν χαθεί, η σειρά με εικόνα αποτυγχάνει. Επιλέξτε ξανά το μοντέλο στο Settings → Defaults → Specialized Models → Vision Model για να διορθωθεί. Η ηχηρή αποτυχία είναι σκόπιμη, χωρίς σιωπηρή αντικατάσταση.
Μοντέλα για Work
Το Work χρειάζεται chat model με εργαλεία:
- Εγκατεστημένο Ollama που δηλώνει
tools. - Ollama Cloud από το ρυθμισμένο endpoint.
- Μοντέλο ενεργού chat/completion plugin με credentials του τρέχοντος admin.
Οι plugin εκτελέσεις χρησιμοποιούν adapter OpenAI, Anthropic ή Gemini και αποθηκεύουν ακριβή τύπο/ID στην εργασία και εκτέλεση. Ίδιο όνομα Ollama δεν καταλαμβάνεται. Απόρριψη εργαλείων αποτυγχάνει χωρίς εναλλαγή.
Τοπικό Ollama κρατά αιτήματα στην υποδομή. Απομακρυσμένος πάροχος λαμβάνει system prompt Work, συνομιλία, definitions και αποτελέσματα που μπορεί να περιέχουν κώδικα, output ή καταλόγους. Volumes και credentials μένουν στον host, αλλά περιεχόμενο αρχείου μπορεί να φύγει μέσω tool result.
Μία αυτόνομη εκτέλεση κάνει πολλά calls. Ελέγξτε pricing, retention και training πριν ευαίσθητα έργα. Το Work δείχνει notice παρόχου ανά χρήστη.
Οδηγός hardware
| Σύστημα | Πρακτικό εύρος | Σημειώσεις |
|---|---|---|
| CPU, 8–16 GB RAM | 1B–4B | Ελαφρύ chat και δοκιμές |
| 8 GB VRAM | 4B–8B quantized | Καλό ξεκίνημα |
| 12–16 GB VRAM | 8B–14B quantized | Καθημερινή χρήση |
| 24 GB VRAM | 14B–32B quantized | Ισχυρό workstation |
| 48 GB+ VRAM ή μεγάλη unified memory | 32B–70B quantized | Πειράματα μεγάλων μοντέλων |
Τα quantized χρησιμοποιούν λιγότερη μνήμη. Q4 είναι πρακτική προεπιλογή, Q8 περισσότερη μνήμη/ποιότητα.
Προτάσεις ανά εργασία
| Εργασία | Κατεύθυνση |
|---|---|
| Γρήγορο chat | gemma4:12b και μικρά τρέχοντα |
| Coding | Qwen Coder, Codestral, provider coding models |
| Reasoning | Μεγαλύτερα Qwen/Gemma και provider reasoning |
| Vision | LLaVA, Qwen VL ή provider vision |
| Αναζήτηση εγγράφων | nomic-embed-text ή άλλο embedding |
| Text-to-speech | Qwen3-TTS ή Kyutai TTS |
Τα ονόματα αλλάζουν. Χρησιμοποιείτε discovery παρόχου ή ακριβές ID από dashboard.
Prompt και ρυθμίσεις
- Temperature, token limits, context και penalties είναι στο κλειστό Advanced generation settings.
- Χαμηλή temperature (
0.1-0.3) για επαναλήψιμα γεγονότα. - Μέση (
0.5-0.7) για κανονική βοήθεια. - Υψηλή (
0.8+) για ιδέες και δημιουργικότητα. - Κρατήστε λογικό context κοντά στα όρια μνήμης.
- Χρησιμοποιήστε περσόνες για μόνιμες παραμέτρους και system prompt.
Αντιμετώπιση προβλημάτων
Αποτυχία λήψης
- Επιβεβαιώστε Ollama:
ollama listκαι δοκιμάστε στο terminal. - Ελέγξτε δίσκο και αφήστε το Libre να χειριστεί cloud suffix.
Αργές απαντήσεις
- Μικρότερο μοντέλο/quantization,
ollama ps, κλείσιμο GPU apps, μικρότερο context.
Out of memory
- Q8 σε Q4, 14B σε 8B, μόνο απαραίτητο μοντέλο φορτωμένο.
- Σε Docker επιβεβαιώστε GPU ή host Ollama.