본문으로 건너뛰기

하드웨어 요구 사항

Libre WebUI의 일반 Chat 인터페이스는 가볍습니다. 대부분의 리소스 수요는 로컬 Ollama 모델에서 발생하며, 컨테이너 기반 Work 작업에는 별도의 CPU, 메모리, 프로세스, 이미지 및 프로젝트 저장소 예산이 추가됩니다.

빠른 참조

하드웨어실용적인 로컬 모델참고
8 GB RAM, CPU 전용1B-4B 양자화테스트 및 가벼운 채팅에 적합
16 GB RAM, CPU 전용4B-8B 양자화사용 가능하지만 GPU보다 느림
8 GB VRAM4B-8B 양자화일상적인 로컬 환경에 적합
12-16 GB VRAM8B-14B 양자화강력한 워크스테이션 범위
24 GB VRAM14B-32B 양자화고급 로컬 사용
48 GB+ VRAM 또는 대용량 통합 메모리32B-70B 양자화대형 모델 실험

실제 속도는 모델 아키텍처, 양자화, 컨텍스트 길이, GPU 드라이버 및 함께 실행 중인 다른 작업에 따라 달라집니다.

시작하기 좋은 모델

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

nomic-embed-text는 채팅 모델이 아니라 문서 임베딩에 사용하세요.

VRAM과 RAM

VRAM은 로컬 모델 속도에 가장 큰 영향을 줍니다. 모델이 VRAM에 들어가면 응답이 훨씬 빨라집니다. 시스템 RAM으로 넘치더라도 작동할 수 있지만 속도는 느려집니다.

시스템 RAM은 CPU 추론, GPU 오프로딩, 긴 컨텍스트 창 및 앱의 나머지 부분을 실행하는 데 중요합니다.

Apple Silicon

Apple Silicon은 통합 메모리를 사용하므로 모델 메모리는 OS 및 애플리케이션과 같은 풀에서 할당됩니다. 통합 메모리가 큰 시스템은 개별 GPU 시스템에서 GPU VRAM 수치로 예상되는 것보다 더 큰 양자화 모델을 실행할 수 있습니다.

브라우저, 백엔드 및 운영 체제를 위한 여유 메모리를 충분히 남겨 두세요.

NVIDIA

NVIDIA GPU는 일반적으로 CUDA를 통해 로컬 추론과 가장 폭넓게 호환됩니다. 최신 드라이버를 사용하고 컨테이너에서 Ollama를 실행한다면 Docker의 GPU 접근을 확인하세요.

AMD 및 Intel

AMD 및 Intel 지원은 사용 중인 플랫폼에 대한 Ollama와 드라이버 지원에 따라 달라집니다. GPU 가속을 사용할 수 없어도 CPU 추론은 계속 사용할 수 있습니다.

메모리 사용량 줄이기

  • 더 작은 모델을 사용합니다.
  • Q8 대신 Q4 양자화를 사용합니다.
  • 컨텍스트 길이를 줄입니다.
  • 사용하지 않는 모델을 언로드합니다.
  • 문서 임베딩 선택과 채팅 모델 선택을 분리합니다.

Work 런타임 용량

Work는 WebUI와 모델 프로세스 외에 컨테이너 리소스를 추가로 사용합니다. 활성 작업 컨테이너 하나의 기본값은 다음과 같습니다.

  • 메모리 2 GB
  • CPU 2개
  • 프로세스 256개

백엔드는 기본적으로 인스턴스 전체에서 활성 컨테이너 기반 작업 2개, 관리자당 1개를 허용합니다. 이는 예약량이 아니라 제한이지만, 운영자는 WebUI 백엔드, 브라우저, Docker, Ollama 및 작업 컨테이너를 동시에 실행할 수 있도록 예산을 잡아야 합니다. Apple Silicon에서는 결국 모두 같은 통합 메모리 풀을 두고 경쟁합니다.

Ollama Cloud나 설정된 원격 모델 플러그인을 사용하면 대형 모델을 로컬 RAM 또는 VRAM에 로드하지 않아도 됩니다. 하지만 Docker 요구 사항이나 Work 컨테이너에 필요한 리소스가 없어지는 것은 아닙니다.

각 Work 작업에는 생성된 파일과 로컬 종속성을 위한 Docker 명명 볼륨도 하나씩 있습니다. 현재 볼륨에는 작업별 디스크 할당량이 없으므로 패키지 설치나 생성된 프로젝트가 Docker 저장 공간을 고갈시킬 수 있습니다. Docker 데이터 루트를 모니터링하고, 가능한 경우 호스트 수준 제한을 설정하며, 작업 볼륨은 Libre WebUI 데이터베이스와 별도로 백업하세요.

백엔드 호스트를 측정한 후에만 WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMITWORK_MAX_ACTIVE_RUNTIMES_* 설정을 조정하세요. 기본값은 환경 변수 참조를 확인하세요.

관련 문서