본문으로 건너뛰기

AI 모델 사용하기

Libre WebUI에서는 로컬 Ollama 모델과 플러그인 기반 클라우드 모델을 같은 워크스페이스에서 사용할 수 있습니다. 모델 관리자에는 설치된 Ollama 모델, 실행 중인 모델, 실시간 Ollama Library 결과, Hugging Face GGUF 항목과 사용 가능한 Ollama Cloud 항목이 표시됩니다.

첫 모델 선택하기

다음 모델을 출발점으로 삼고 하드웨어와 작업에 맞춰 바꾸세요.

모델적합한 용도일반적인 환경
gemma4:12b빠른 일반 채팅16 GB RAM 또는 8 GB VRAM
qwen3.8:27b일반 채팅, 코딩, 다국어 사용32 GB RAM 또는 16-24 GB VRAM
gemma4:26bMoE 효율을 갖춘 강력한 채팅24 GB RAM 또는 16 GB VRAM
gemma4:31b최고 품질의 고밀도 로컬 채팅32 GB RAM 또는 24 GB VRAM
nomic-embed-text문서 임베딩소형 로컬 임베딩 모델

30B, 70B, MoE 모델 같은 대형 모델은 성능이 뛰어나지만 훨씬 많은 메모리가 필요합니다. 확신이 없다면 작은 모델부터 시작하고 원활하게 작동하는 것을 확인한 뒤 더 큰 모델로 옮기세요.

모델 관리자

설정 → 모델을 열어 다음 작업을 할 수 있습니다.

  • 이름으로 Ollama 모델을 가져옵니다.
  • 정적 목록 대신 실시간 Ollama Library를 검색합니다.
  • 설치된 모델과 실행 중인 모델을 확인합니다.
  • 설치된 모든 Ollama 모델을 한 번에 업데이트합니다.
  • 실행 중인 모델을 중지하거나 메모리에서 내립니다.
  • 더 이상 필요하지 않은 모델을 삭제합니다.
  • 호환되는 Hugging Face GGUF 모델을 Ollama를 통해 가져옵니다.
  • 클라우드 필터에서 Ollama Cloud 모델을 가져옵니다.

Ollama Cloud 결과를 가져올 때 UI는 클라우드 모델 이름을 정규화합니다. 클라우드 모델에 :cloud 또는 -cloud 접미사가 필요하면 Libre WebUI가 클라우드 모델 흐름에서 자동으로 적용합니다.

모델 카탈로그와 공개 범위

설정 → 기본값에 있는 모델 카탈로그에는 선택할 수 있는 모든 채팅 모델이 로컬 모델과 공급자 기반 모델을 구분하지 않고 공급자 배지, 검색 상자와 함께 표시됩니다. 카탈로그 위에서 기본 모델을 선택하면 새 채팅이 해당 모델로 시작됩니다.

관리자는 모델에 별표를 지정해 카탈로그와 기본 모델 메뉴 맨 위에 고정할 수 있습니다. 여러 모델에 별표를 지정하면 가장 최근에 지정한 모델이 맨 앞에 오고, 별표를 해제하면 해당 모델은 원래의 수동 순서나 공급자 순서 위치로 돌아갑니다.

관리자에게는 각 행에 제어 기능이 하나 더 제공됩니다. 눈 모양 토글을 사용하면 다른 모든 사용자의 모델 선택 목록에서 모델을 숨길 수 있습니다. 숨기기는 긴 카탈로그를 서버에서 실제로 사용하도록 허용할 모델로 정돈하는 목록 개선 기능이지 권한 부여 게이트가 아닙니다. 따라서 보안 경계가 아닌 큐레이션 기능으로 취급하세요. 관리자는 숨겨진 모델에 표시가 된 전체 목록을 항상 볼 수 있습니다.

로컬 모델과 클라우드 모델

모드장점고려 사항
로컬 Ollama비공개, 다운로드 후 오프라인 사용, 예측 가능한 비용CPU/GPU/RAM에 따라 성능이 달라짐
Ollama Cloud로컬 하드웨어 제약 없이 익숙한 Ollama 작업 흐름 사용클라우드 접근과 네트워크가 필요함
공급자 플러그인여러 공급자의 관리형 모델에 접근API 키, 공급자 요금과 공급자 개인정보 처리방침이 적용됨

비공개 작업에는 로컬 모델을 유지하고, 더 큰 호스팅 모델이 필요한 작업에는 공급자 플러그인을 활성화할 수 있습니다.

기본 비전 모델

빠른 텍스트 모델과 채팅하면서도 이미지를 보낼 수 있습니다. 설정 → 기본값 → 특수 모델 → 비전 모델에서 비전 모델을 선택하세요. 새 첨부 파일, 세션 앞부분의 이미지 또는 시크릿 채팅 기록처럼 전송할 채팅 컨텍스트에 이미지가 들어 있으면 해당 턴은 세션 모델 대신 구성된 비전 모델로 라우팅됩니다. 텍스트만 있는 턴은 계속 세션 모델을 사용합니다.

이 설정은 사용자별로 적용되며 라우팅은 자동으로 조용히 이루어집니다. 현재 채팅 모델 사용을 그대로 선택하면 이 기능이 비활성화됩니다. 이 검사는 세션 모델의 기능이 아니라 이미지 존재 여부를 기준으로 한다는 점에 유의하세요. 비전 모델을 구성하면 세션 모델 자체가 이미지를 처리할 수 있더라도 이미지가 포함된 모든 턴이 비전 모델을 사용합니다.

선택 항목에는 모델 이름과 함께 정확한 공급자 ID(Ollama 또는 특정 플러그인)가 저장되므로, 다른 공급자가 이름이 같은 모델을 가로챌 수 없습니다. 저장된 선택 항목에서 이 ID가 사라지면(예: 모델이나 공급자를 더 이상 사용할 수 없는 경우) 이미지가 포함된 턴이 실패합니다. 설정 → 기본값 → 특수 모델 → 비전 모델에서 모델을 다시 선택하면 복구됩니다. 명확하게 실패하도록 한 것은 의도된 동작이며, Libre WebUI는 다른 공급자로 조용히 대체하지 않습니다.

Work용 모델

Work에는 도구를 호출할 수 있는 채팅 모델이 필요합니다. 다음 모델을 사용할 수 있습니다.

  • tools 기능을 명시하는 설치된 Ollama 모델
  • 구성된 Ollama 엔드포인트를 통해 사용할 수 있는 Ollama Cloud 모델
  • 현재 관리자의 자격 증명이 구성된 활성 채팅 또는 완성 플러그인에 나열된 모델

플러그인 기반 Work 실행은 구성된 플러그인에 맞는 공급자 어댑터(OpenAI 호환, Anthropic 또는 Gemini)를 사용합니다. Libre WebUI는 작업 및 각 실행에 정확한 공급자 유형과 플러그인 식별자를 저장하므로, 플러그인이 이름이 같은 Ollama 모델을 가로챌 수 없습니다. 선택한 모델이나 공급자가 도구 호출을 거부하면 다른 공급자로 조용히 전환하지 않고 실행이 실패합니다.

로컬 Ollama를 사용하면 모델 요청이 구성된 Ollama 인프라 안에서 처리됩니다. 원격 모델을 사용하면 구성된 공급자가 Work 시스템 프롬프트, 대화, 도구 정의와 도구 결과를 받습니다. 도구 결과에는 모델이 요청한 원문, 명령 출력 또는 디렉터리 목록이 포함될 수 있습니다. 워크스페이스 볼륨과 공급자 자격 증명은 백엔드 호스트에 남지만 파일 내용이 도구 결과에 포함되면 해당 호스트 밖으로 전송될 수 있습니다.

하나의 자율 Work 실행에서 모델을 여러 번 호출할 수 있습니다. 민감한 프로젝트에 사용하기 전에 원격 공급자의 요금, 보존, 학습 정책을 확인하세요. Libre WebUI는 Work에 원격 공급자 알림을 표시하며 사용자는 이를 개별적으로 닫을 수 있습니다.

하드웨어 가이드

시스템실용적인 모델 범위참고
CPU 전용, 8-16 GB RAM1B-4B가벼운 채팅과 테스트에 적합
8 GB VRAM양자화 4B-8B부담 없이 시작할 수 있는 환경
12-16 GB VRAM양자화 8B-14B일상적으로 사용하기 좋은 범위
24 GB VRAM양자화 14B-32B강력한 로컬 워크스테이션
48 GB+ VRAM 또는 대용량 통합 메모리양자화 32B-70B대형 모델 실험

양자화 모델은 메모리를 더 적게 사용합니다. Q4 양자화가 일반적으로 실용적인 기본값이며, Q8은 품질이 더 좋은 대신 메모리를 더 많이 사용합니다.

작업별 권장 사항

작업권장 모델 방향
빠른 채팅gemma4:12b 및 기타 최신 소형 모델
코딩Qwen Coder, Codestral, 공급자 코딩 모델
추론더 큰 Qwen 및 Gemma 모델, 공급자 추론 모델
비전LLaVA, Qwen VL 같은 멀티모달 모델 또는 공급자 비전 모델
문서 검색nomic-embed-text 또는 다른 임베딩 모델
텍스트 음성 변환Qwen3-TTS 또는 Kyutai TTS 같은 TTS 플러그인

공급자 모델 이름은 자주 바뀝니다. Libre WebUI에서는 가능한 경우 공급자의 모델 검색 기능을 사용하거나 공급자 대시보드에서 정확한 모델 ID를 붙여 넣으세요.

프롬프트와 설정

  • 온도, 토큰 한도, 컨텍스트 길이, 페널티 같은 생성 제어 기능은 고급 생성 설정 아래에 모여 있으며 기본적으로 닫혀 있습니다.
  • 사실에 기반한 일관된 답변에는 낮은 온도(0.1-0.3)를 사용합니다.
  • 일반적인 어시스턴트 작업에는 중간 온도(0.5-0.7)를 사용합니다.
  • 브레인스토밍과 창작에는 높은 온도(0.8+)를 사용합니다.
  • 메모리 한도에 가까울 때는 컨텍스트 길이를 적정 수준으로 유지합니다.
  • 모델 매개변수를 유지하고 시스템 프롬프트를 재사용하려면 페르소나를 사용합니다.

문제 해결

가져오기 실패

  • Ollama가 실행 중인지 확인합니다: ollama list.
  • 터미널에서 같은 가져오기를 시도해 Ollama의 원래 오류를 확인합니다.
  • 대형 모델을 가져오기 전에 디스크 공간을 확인합니다.
  • 모델 관리자의 클라우드 필터를 사용한다면 Libre WebUI가 클라우드 접미사를 처리하도록 둡니다.

응답이 느림

  • 더 작은 모델이나 더 낮은 양자화를 사용합니다.
  • ollama ps로 로드된 모델을 확인합니다.
  • GPU를 많이 사용하는 다른 앱을 닫습니다.
  • 컨텍스트 길이를 줄입니다.

메모리 부족

  • Q8에서 Q4로 변경합니다.
  • 14B 대신 8B 모델을 사용합니다.
  • 필요한 모델 하나만 로드해 둡니다.
  • Docker에서는 컨테이너가 GPU 또는 호스트 Ollama 인스턴스에 접근할 수 있는지 확인합니다.

관련 문서