Hardverkövetelmények
A Libre WebUI szokásos Chat funkciója kevés erőforrást használ. A legtöbb erőforrást a helyi Ollama modellek igénylik; a konténeres Work-feladatok külön CPU-, memória-, folyamat-, image- és projekttárolási keretet adnak hozzá.
Gyors áttekintés
| Hardver | Gyakorlatban használható helyi modellek | Megjegyzés |
|---|---|---|
| 8 GB RAM, csak CPU | 1B–4B kvantált | Tesztelés és könnyű Chat |
| 16 GB RAM, csak CPU | 4B–8B kvantált | Használható, a GPU-nál lassabb |
| 8 GB VRAM | 4B–8B kvantált | Jó mindennapi helyi összeállítás |
| 12–16 GB VRAM | 8B–14B kvantált | Erős munkaállomás |
| 24 GB VRAM | 14B–32B kvantált | Nagy igényű helyi használat |
| 48 GB+ VRAM vagy nagy egyesített memória | 32B–70B kvantált | Kísérletezés nagy modellekkel |
A tényleges sebesség az architektúrától, a kvantálástól, a kontextus hosszától, a GPU-illesztőprogramoktól és más folyamatoktól függ.
Jó kezdőmodellek
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
A nomic-embed-text modellt dokumentumbeágyazásokhoz használja, ne Chat-modellként.
VRAM és RAM
A helyi modell sebességét leginkább a VRAM befolyásolja. Ha a modell teljesen elfér a VRAM-ban, a válaszok sokkal gyorsabbak. A rendszermemóriába történő részleges áthelyezés működhet, de lassabb. A rendszer RAM-ja a CPU-s inferenciánál, GPU-offloadnál, nagy kontextusablakoknál és az alkalmazás többi részénél fontos.
Apple Silicon
Az Apple Silicon egyesített memóriát használ, így a modell, az operációs rendszer és az alkalmazások ugyanazon a készleten osztoznak. A több egyesített memóriával rendelkező gépek nagyobb kvantált modelleket futtathatnak, mint amit egy különálló GPU VRAM-ja sugallna. Hagyjon memóriát a böngészőnek, a backendnek és az operációs rendszernek.
NVIDIA
Az NVIDIA GPU-k általában a legjobb kompatibilitást biztosítják a helyi inferenciához CUDA segítségével. Használjon friss illesztőprogramokat, és ellenőrizze a GPU-hozzáférést a Dockerből, ha az Ollama konténerben fut.
AMD és Intel
A támogatás az Ollamától és a platform illesztőprogramjaitól függ. A CPU-s inferencia GPU-gyorsítás nélkül is elérhető.
A memóriahasználat csökkentése
- Használjon kisebb modelleket.
- Q8 helyett használjon Q4-et.
- Csökkentse a kontextust.
- Távolítsa el a memóriából a nem használt modelleket.
- A dokumentumbeágyazási modellt tartsa külön a Chat-modelltől.
A Work futtatási kapacitása
A Work a WebUI és a modellfolyamat mellé konténer-erőforrásokat ad. Minden aktív feladatkonténer alapértelmezett kerete:
- 2 GB memória;
- 2 CPU; és
- 256 folyamat.
A backend az egész példányon két aktív feladatot, rendszergazdánként pedig egyet engedélyez. Ezek korlátok, nem foglalások, de a backendet, a böngészőt, a Dockert, az Ollamát és a konténereket együtt kell méretezni. Apple Siliconon mindegyik ugyanazért a memóriakészletért versenyez.
Az Ollama Cloud vagy egy távoli bővítmény elkerüli egy nagy modell helyi betöltését, de nem szünteti meg a Docker követelményét vagy a Work erőforrásigényét.
Minden feladathoz külön elnevezett Docker-kötet tartozik a fájlok és függőségek számára. Nincsenek feladatonkénti kvóták; a csomagtelepítés megtöltheti a Docker tárhelyét. Figyelje az adatgyökeret, alkalmazzon hostszintű korlátokat, és a Work-kötetekről az adatbázistól külön készítsen biztonsági mentést.
A WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT és WORK_MAX_ACTIVE_RUNTIMES_* értékeket csak a host mérése után módosítsa. Lásd a környezeti változókat.