Απαιτήσεις υλικού
Το συνηθισμένο Chat του Libre WebUI είναι ελαφρύ. Οι περισσότεροι πόροι καταναλώνονται από τοπικά μοντέλα Ollama· οι εργασίες Work σε containers προσθέτουν ξεχωριστό προϋπολογισμό CPU, μνήμης, διεργασιών, image και αποθήκευσης έργου.
Γρήγορη αναφορά
| Υλικό | Πρακτικά τοπικά μοντέλα | Σημείωση |
|---|---|---|
| 8 GB RAM, μόνο CPU | 1B–4B quantized | Δοκιμές και ελαφρύ chat |
| 16 GB RAM, μόνο CPU | 4B–8B quantized | Χρήσιμο, πιο αργό από GPU |
| 8 GB VRAM | 4B–8B quantized | Καλή καθημερινή τοπική εγκατάσταση |
| 12–16 GB VRAM | 8B–14B quantized | Ισχυρό workstation |
| 24 GB VRAM | 14B–32B quantized | Υψηλών απαιτήσεων τοπική χρήση |
| 48 GB+ VRAM ή μεγάλη unified memory | 32B–70B quantized | Πειραματισμός με μεγάλα μοντέλα |
Η πραγματική ταχύτητα εξαρτάται από αρχιτεκτονική, quantization, μήκος context, drivers GPU και άλλες διεργασίες.
Καλά αρχικά μοντέλα
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Χρησιμοποιείτε nomic-embed-text για embeddings εγγράφων, όχι ως μοντέλο chat.
VRAM έναντι RAM
Η VRAM επηρεάζει περισσότερο την ταχύτητα τοπικού μοντέλου. Αν το μοντέλο χωρά πλήρως στη VRAM, οι απαντήσεις είναι πολύ ταχύτερες. Μεταφορά σε system RAM μπορεί να λειτουργεί αλλά πιο αργά. Η system RAM είναι σημαντική για CPU inference, GPU offload, μεγάλα context windows και την υπόλοιπη εφαρμογή.
Apple Silicon
Το Apple Silicon χρησιμοποιεί unified memory, επομένως μοντέλο, λειτουργικό και εφαρμογές μοιράζονται το ίδιο pool. Μηχανήματα με περισσότερη unified memory τρέχουν μεγαλύτερα quantized μοντέλα από όσα υποδηλώνει η VRAM μιας διακριτής GPU. Αφήστε μνήμη για browser, backend και λειτουργικό.
NVIDIA
Οι GPU NVIDIA έχουν συνήθως την καλύτερη συμβατότητα τοπικού inference μέσω CUDA. Χρησιμοποιείτε πρόσφατους drivers και επαληθεύστε πρόσβαση GPU από Docker αν το Ollama τρέχει σε container.
AMD και Intel
Η υποστήριξη εξαρτάται από Ollama και drivers πλατφόρμας. CPU inference παραμένει διαθέσιμο χωρίς επιτάχυνση GPU.
Μείωση χρήσης μνήμης
- Χρησιμοποιήστε μικρότερα μοντέλα.
- Χρησιμοποιήστε Q4 αντί Q8.
- Μειώστε το context.
- Αποφορτώστε μοντέλα που δεν χρησιμοποιείτε.
- Κρατήστε embeddings εγγράφων χωριστά από το μοντέλο chat.
Χωρητικότητα runtime του Work
Το Work προσθέτει πόρους container πέρα από WebUI και model process. Κάθε ενεργό container εργασίας έχει προεπιλεγμένα:
- 2 GB μνήμης·
- 2 CPU· και
- 256 διεργασίες.
Το backend επιτρέπει δύο ενεργές εργασίες σε όλη την εγκατάσταση και μία ανά διαχειριστή. Είναι όρια, όχι κρατήσεις, αλλά πρέπει να προϋπολογίζονται ταυτόχρονα backend, browser, Docker, Ollama και containers. Στο Apple Silicon ανταγωνίζονται για το ίδιο pool.
Ollama Cloud ή απομακρυσμένο plugin αποφεύγει φόρτωση μεγάλου μοντέλου τοπικά, αλλά δεν αφαιρεί απαίτηση Docker ή πόρους Work.
Κάθε εργασία έχει επίσης named Docker volume για αρχεία και dependencies. Δεν υπάρχουν quotas ανά εργασία· εγκαταστάσεις πακέτων μπορούν να γεμίσουν το Docker. Παρακολουθείτε data root, θέστε όρια host και κρατήστε backup volumes Work χωριστά από τη βάση.
Ρυθμίστε WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT και WORK_MAX_ACTIVE_RUNTIMES_* μόνο μετά από μέτρηση του host. Δείτε μεταβλητές περιβάλλοντος.