Μετάβαση στο κύριο περιεχόμενο

Εργασία με μοντέλα AI

Το Libre WebUI χρησιμοποιεί τοπικά Ollama και cloud μοντέλα plugin στον ίδιο χώρο. Το Model Manager δείχνει εγκατεστημένα και ενεργά Ollama, live Ollama Library, Hugging Face GGUF και Ollama Cloud όπου υπάρχουν.

Επιλογή πρώτου μοντέλου

Σημεία εκκίνησης ανά hardware και εργασία:

ΜοντέλοΚατάλληλο γιαΤυπική προσαρμογή
gemma4:12bΓρήγορο γενικό chat16 GB RAM ή 8 GB VRAM
qwen3.8:27bChat, coding, πολλές γλώσσες32 GB RAM ή 16–24 GB VRAM
gemma4:26bΙσχυρό chat με αποδοτικότητα MoE24 GB RAM ή 16 GB VRAM
gemma4:31bΠοιοτικότερο dense τοπικό chat32 GB RAM ή 24 GB VRAM
nomic-embed-textEmbeddings εγγράφωνΜικρό τοπικό embedding

Μεγάλα 30B, 70B και MoE απαιτούν πολύ μνήμη. Ξεκινήστε μικρά και ανεβείτε όταν λειτουργεί ομαλά.

Model Manager

Στο Settings → Models μπορείτε:

  • Να κατεβάζετε Ollama με όνομα και να αναζητάτε live Library.
  • Να βλέπετε εγκατεστημένα/ενεργά, να σταματάτε, αποφορτώνετε και διαγράφετε.
  • Να ενημερώνετε όλα τα εγκατεστημένα μοντέλα Ollama με μία ενέργεια.
  • Να κατεβάζετε συμβατά Hugging Face GGUF και Ollama Cloud.

Για Cloud, το UI κανονικοποιεί ονόματα και προσθέτει :cloud ή -cloud όταν απαιτείται.

Κατάλογος και ορατότητα

Το Model Catalog στο Settings → Defaults παραθέτει όλα τα chat μοντέλα με badge παρόχου και αναζήτηση. Επιλέξτε το προεπιλεγμένο μοντέλο πάνω από τον κατάλογο για να ορίσετε με τι ξεκινούν τα νέα chat.

Οι admins μπορούν να βάλουν αστέρι σε ένα μοντέλο ώστε να καρφιτσωθεί στην κορυφή του καταλόγου και του μενού προεπιλογής. Με πολλά αστέρια προηγείται το πιο πρόσφατο· η αφαίρεση αστεριού επαναφέρει τη χειροκίνητη θέση ή τη θέση του παρόχου.

Οι admins έχουν eye toggle που κρύβει μοντέλο από άλλους. Είναι επιμέλεια λίστας, όχι authorization boundary. Οι admins βλέπουν πάντα όλη τη λίστα με ένδειξη κρυφών.

Τοπικά και cloud

ΤρόποςΠλεονεκτήματαΣυμβιβασμοί
Τοπικό OllamaΙδιωτικό, offline μετά λήψη, προβλέψιμο κόστοςΕξαρτάται από CPU/GPU/RAM
Ollama CloudΓνώριμη ροή χωρίς τοπικά όρια hardwareΑπαιτεί cloud και δίκτυο
Provider pluginsΠολλοί managed πάροχοιKeys, τιμές και privacy policy παρόχου

Κρατήστε τοπικά για ιδιωτική εργασία και ενεργοποιήστε provider plugin για μεγαλύτερα hosted μοντέλα.

Προεπιλεγμένο μοντέλο όρασης

Μπορείτε να χρησιμοποιείτε γρήγορο text model και να στέλνετε εικόνες. Επιλέξτε στο Settings → Defaults → Specialized Models → Vision Model. Κάθε σειρά με εικόνα — νέα, παλιότερη ή incognito history — δρομολογείται εκεί, ενώ text-only μένει στο session model.

Η ρύθμιση είναι ανά χρήστη, αυτόματη και σιωπηρή. Use the current chat model την απενεργοποιεί. Ελέγχεται η παρουσία εικόνας, όχι η ικανότητα του session model.

Αποθηκεύεται ακριβής identity παρόχου, ώστε ίδιο όνομα να μην καταληφθεί. Αν χαθεί, η σειρά με εικόνα αποτυγχάνει. Επιλέξτε ξανά το μοντέλο στο Settings → Defaults → Specialized Models → Vision Model για να διορθωθεί. Η ηχηρή αποτυχία είναι σκόπιμη, χωρίς σιωπηρή αντικατάσταση.

Μοντέλα για Work

Το Work χρειάζεται chat model με εργαλεία:

  • Εγκατεστημένο Ollama που δηλώνει tools.
  • Ollama Cloud από το ρυθμισμένο endpoint.
  • Μοντέλο ενεργού chat/completion plugin με credentials του τρέχοντος admin.

Οι plugin εκτελέσεις χρησιμοποιούν adapter OpenAI, Anthropic ή Gemini και αποθηκεύουν ακριβή τύπο/ID στην εργασία και εκτέλεση. Ίδιο όνομα Ollama δεν καταλαμβάνεται. Απόρριψη εργαλείων αποτυγχάνει χωρίς εναλλαγή.

Τοπικό Ollama κρατά αιτήματα στην υποδομή. Απομακρυσμένος πάροχος λαμβάνει system prompt Work, συνομιλία, definitions και αποτελέσματα που μπορεί να περιέχουν κώδικα, output ή καταλόγους. Volumes και credentials μένουν στον host, αλλά περιεχόμενο αρχείου μπορεί να φύγει μέσω tool result.

Μία αυτόνομη εκτέλεση κάνει πολλά calls. Ελέγξτε pricing, retention και training πριν ευαίσθητα έργα. Το Work δείχνει notice παρόχου ανά χρήστη.

Οδηγός hardware

ΣύστημαΠρακτικό εύροςΣημειώσεις
CPU, 8–16 GB RAM1B–4BΕλαφρύ chat και δοκιμές
8 GB VRAM4B–8B quantizedΚαλό ξεκίνημα
12–16 GB VRAM8B–14B quantizedΚαθημερινή χρήση
24 GB VRAM14B–32B quantizedΙσχυρό workstation
48 GB+ VRAM ή μεγάλη unified memory32B–70B quantizedΠειράματα μεγάλων μοντέλων

Τα quantized χρησιμοποιούν λιγότερη μνήμη. Q4 είναι πρακτική προεπιλογή, Q8 περισσότερη μνήμη/ποιότητα.

Προτάσεις ανά εργασία

ΕργασίαΚατεύθυνση
Γρήγορο chatgemma4:12b και μικρά τρέχοντα
CodingQwen Coder, Codestral, provider coding models
ReasoningΜεγαλύτερα Qwen/Gemma και provider reasoning
VisionLLaVA, Qwen VL ή provider vision
Αναζήτηση εγγράφωνnomic-embed-text ή άλλο embedding
Text-to-speechQwen3-TTS ή Kyutai TTS

Τα ονόματα αλλάζουν. Χρησιμοποιείτε discovery παρόχου ή ακριβές ID από dashboard.

Prompt και ρυθμίσεις

  • Temperature, token limits, context και penalties είναι στο κλειστό Advanced generation settings.
  • Χαμηλή temperature (0.1-0.3) για επαναλήψιμα γεγονότα.
  • Μέση (0.5-0.7) για κανονική βοήθεια.
  • Υψηλή (0.8+) για ιδέες και δημιουργικότητα.
  • Κρατήστε λογικό context κοντά στα όρια μνήμης.
  • Χρησιμοποιήστε περσόνες για μόνιμες παραμέτρους και system prompt.

Αντιμετώπιση προβλημάτων

Αποτυχία λήψης

  • Επιβεβαιώστε Ollama: ollama list και δοκιμάστε στο terminal.
  • Ελέγξτε δίσκο και αφήστε το Libre να χειριστεί cloud suffix.

Αργές απαντήσεις

  • Μικρότερο μοντέλο/quantization, ollama ps, κλείσιμο GPU apps, μικρότερο context.

Out of memory

  • Q8 σε Q4, 14B σε 8B, μόνο απαραίτητο μοντέλο φορτωμένο.
  • Σε Docker επιβεβαιώστε GPU ή host Ollama.

Σχετική τεκμηρίωση