ข้ามไปยังเนื้อหาหลัก

ข้อกำหนดฮาร์ดแวร์

อินเทอร์เฟซ Chat ปกติของ Libre WebUI ใช้ทรัพยากรน้อย ความต้องการส่วนใหญ่มาจากโมเดล Ollama ในเครื่อง ส่วนงาน Work ที่ใช้คอนเทนเนอร์ต้องมีงบ CPU, หน่วยความจำ, จำนวนโปรเซส, image และพื้นที่เก็บโครงการแยกต่างหาก

ตารางอ้างอิงอย่างย่อ

ฮาร์ดแวร์โมเดลในเครื่องที่เหมาะสมหมายเหตุ
RAM 8 GB, ใช้ CPU เท่านั้นโมเดล 1B-4B แบบ quantizedเหมาะสำหรับทดสอบและแชตเบา ๆ
RAM 16 GB, ใช้ CPU เท่านั้นโมเดล 4B-8B แบบ quantizedใช้งานได้ แต่ช้ากว่า GPU
VRAM 8 GBโมเดล 4B-8B แบบ quantizedเหมาะเป็นชุดใช้งานประจำวันในเครื่อง
VRAM 12-16 GBโมเดล 8B-14B แบบ quantizedช่วงที่ดีสำหรับ workstation
VRAM 24 GBโมเดล 14B-32B แบบ quantizedสำหรับงานในเครื่องระดับสูง
VRAM 48 GB ขึ้นไปหรือ unified memory ขนาดใหญ่โมเดล 32B-70B แบบ quantizedสำหรับทดลองโมเดลขนาดใหญ่

ความเร็วจริงขึ้นอยู่กับสถาปัตยกรรมโมเดล การ quantize ความยาวบริบท ไดรเวอร์ GPU และโปรแกรมอื่นที่กำลังทำงาน

โมเดลเริ่มต้นที่แนะนำ

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

ใช้ nomic-embed-text สำหรับ embedding เอกสาร ไม่ใช่เป็นโมเดลแชต

VRAM เทียบกับ RAM

VRAM เป็นปัจจัยสำคัญที่สุดต่อความเร็วของโมเดลในเครื่อง หากโมเดลอยู่ใน VRAM ได้ทั้งหมด การตอบจะเร็วขึ้นมาก หากล้นไปใช้ RAM ของระบบ โมเดลอาจยังทำงานได้แต่จะช้าลง

RAM ของระบบสำคัญต่อการอนุมานด้วย CPU การ offload ไป GPU หน้าต่างบริบทยาว และการทำงานของส่วนอื่นในแอป

Apple Silicon

Apple Silicon ใช้ unified memory ดังนั้นหน่วยความจำโมเดลจึงใช้พูลเดียวกับระบบปฏิบัติการและแอป เครื่องที่มี unified memory มากสามารถรันโมเดล quantized ขนาดใหญ่กว่าที่ตัวเลข VRAM ของ GPU แยกจะบ่งบอก

สำรองหน่วยความจำว่างให้เพียงพอสำหรับเบราว์เซอร์ backend และระบบปฏิบัติการ

NVIDIA

โดยทั่วไป GPU ของ NVIDIA เข้ากันได้ดีที่สุดกับการอนุมานในเครื่องผ่าน CUDA ใช้ไดรเวอร์ปัจจุบันและยืนยันว่า Docker เข้าถึง GPU ได้ หากรัน Ollama ในคอนเทนเนอร์

AMD และ Intel

การรองรับ AMD และ Intel ขึ้นอยู่กับ Ollama และไดรเวอร์สำหรับแพลตฟอร์มของคุณ การอนุมานด้วย CPU ยังคงใช้ได้เมื่อไม่มีการเร่งด้วย GPU

การลดการใช้หน่วยความจำ

  • ใช้โมเดลที่เล็กลง
  • ใช้การ quantize แบบ Q4 แทน Q8
  • ลดความยาวบริบท
  • นำโมเดลที่ไม่ได้ใช้ออกจากหน่วยความจำ
  • แยก embedding เอกสารออกจากการเลือกโมเดลแชต

ความจุของ runtime สำหรับ Work

Work ใช้ทรัพยากรคอนเทนเนอร์เพิ่มจาก WebUI และโปรเซสของโมเดล ตามค่าเริ่มต้น คอนเทนเนอร์ของงานแต่ละงานที่กำลังทำงานมี:

  • หน่วยความจำ 2 GB;
  • 2 CPU; และ
  • 256 โปรเซส

ตามค่าเริ่มต้น backend อนุญาตงานที่ใช้คอนเทนเนอร์ซึ่งกำลังทำงานพร้อมกันสองงานทั่วทั้งระบบ และหนึ่งงานต่อผู้ดูแลระบบ ค่าเหล่านี้เป็นขีดจำกัด ไม่ใช่การจองทรัพยากร แต่ผู้ดำเนินการควรวางงบสำหรับ WebUI backend, เบราว์เซอร์, Docker, Ollama และคอนเทนเนอร์งานพร้อมกัน บน Apple Silicon ทุกส่วนจะแข่งขันใช้ unified memory พูลเดียวกันในท้ายที่สุด

การใช้ Ollama Cloud หรือปลั๊กอินโมเดลระยะไกลที่กำหนดค่าไว้ช่วยหลีกเลี่ยงการโหลดโมเดลขนาดใหญ่ลง RAM หรือ VRAM ในเครื่อง แต่ไม่ได้ตัดข้อกำหนด Docker หรือทรัพยากรที่คอนเทนเนอร์ Work ต้องใช้

งาน Work แต่ละงานยังมี Docker named volume สำหรับไฟล์ที่สร้างและ dependency ในเครื่อง ปัจจุบัน volume ไม่มีโควตาดิสก์ต่อแต่ละงาน การติดตั้งแพ็กเกจหรือโครงการที่สร้างจึงอาจใช้พื้นที่ Docker จนหมด ควรตรวจสอบ data root ของ Docker กำหนดขีดจำกัดระดับโฮสต์เมื่อทำได้ และสำรอง volume ของงานแยกจากฐานข้อมูล Libre WebUI

ปรับค่า WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT และ WORK_MAX_ACTIVE_RUNTIMES_* หลังจากวัดเครื่อง backend แล้วเท่านั้น ดูค่าเริ่มต้นได้ที่ เอกสารอ้างอิงตัวแปรสภาพแวดล้อม

เอกสารที่เกี่ยวข้อง