Ugrás a fő tartalomra

Hardverkövetelmények

A Libre WebUI szokásos Chat funkciója kevés erőforrást használ. A legtöbb erőforrást a helyi Ollama modellek igénylik; a konténeres Work-feladatok külön CPU-, memória-, folyamat-, image- és projekttárolási keretet adnak hozzá.

Gyors áttekintés

HardverGyakorlatban használható helyi modellekMegjegyzés
8 GB RAM, csak CPU1B–4B kvantáltTesztelés és könnyű Chat
16 GB RAM, csak CPU4B–8B kvantáltHasználható, a GPU-nál lassabb
8 GB VRAM4B–8B kvantáltJó mindennapi helyi összeállítás
12–16 GB VRAM8B–14B kvantáltErős munkaállomás
24 GB VRAM14B–32B kvantáltNagy igényű helyi használat
48 GB+ VRAM vagy nagy egyesített memória32B–70B kvantáltKísérletezés nagy modellekkel

A tényleges sebesség az architektúrától, a kvantálástól, a kontextus hosszától, a GPU-illesztőprogramoktól és más folyamatoktól függ.

Jó kezdőmodellek

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

A nomic-embed-text modellt dokumentumbeágyazásokhoz használja, ne Chat-modellként.

VRAM és RAM

A helyi modell sebességét leginkább a VRAM befolyásolja. Ha a modell teljesen elfér a VRAM-ban, a válaszok sokkal gyorsabbak. A rendszermemóriába történő részleges áthelyezés működhet, de lassabb. A rendszer RAM-ja a CPU-s inferenciánál, GPU-offloadnál, nagy kontextusablakoknál és az alkalmazás többi részénél fontos.

Apple Silicon

Az Apple Silicon egyesített memóriát használ, így a modell, az operációs rendszer és az alkalmazások ugyanazon a készleten osztoznak. A több egyesített memóriával rendelkező gépek nagyobb kvantált modelleket futtathatnak, mint amit egy különálló GPU VRAM-ja sugallna. Hagyjon memóriát a böngészőnek, a backendnek és az operációs rendszernek.

NVIDIA

Az NVIDIA GPU-k általában a legjobb kompatibilitást biztosítják a helyi inferenciához CUDA segítségével. Használjon friss illesztőprogramokat, és ellenőrizze a GPU-hozzáférést a Dockerből, ha az Ollama konténerben fut.

AMD és Intel

A támogatás az Ollamától és a platform illesztőprogramjaitól függ. A CPU-s inferencia GPU-gyorsítás nélkül is elérhető.

A memóriahasználat csökkentése

  • Használjon kisebb modelleket.
  • Q8 helyett használjon Q4-et.
  • Csökkentse a kontextust.
  • Távolítsa el a memóriából a nem használt modelleket.
  • A dokumentumbeágyazási modellt tartsa külön a Chat-modelltől.

A Work futtatási kapacitása

A Work a WebUI és a modellfolyamat mellé konténer-erőforrásokat ad. Minden aktív feladatkonténer alapértelmezett kerete:

  • 2 GB memória;
  • 2 CPU; és
  • 256 folyamat.

A backend az egész példányon két aktív feladatot, rendszergazdánként pedig egyet engedélyez. Ezek korlátok, nem foglalások, de a backendet, a böngészőt, a Dockert, az Ollamát és a konténereket együtt kell méretezni. Apple Siliconon mindegyik ugyanazért a memóriakészletért versenyez.

Az Ollama Cloud vagy egy távoli bővítmény elkerüli egy nagy modell helyi betöltését, de nem szünteti meg a Docker követelményét vagy a Work erőforrásigényét.

Minden feladathoz külön elnevezett Docker-kötet tartozik a fájlok és függőségek számára. Nincsenek feladatonkénti kvóták; a csomagtelepítés megtöltheti a Docker tárhelyét. Figyelje az adatgyökeret, alkalmazzon hostszintű korlátokat, és a Work-kötetekről az adatbázistól külön készítsen biztonsági mentést.

A WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT és WORK_MAX_ACTIVE_RUNTIMES_* értékeket csak a host mérése után módosítsa. Lásd a környezeti változókat.

Kapcsolódó dokumentáció