Requisitos de hardware
La interfaz normal de chat de Libre WebUI es ligera. La mayoría de los recursos los consumen los modelos Ollama locales; las tareas de Work respaldadas por contenedores añaden presupuestos independientes de CPU, memoria, procesos, imágenes y almacenamiento de proyectos.
Referencia rápida
| Hardware | Modelos locales prácticos | Notas |
|---|---|---|
| 8 GB de RAM, solo CPU | 1B-4B cuantizados | Adecuado para pruebas y chat ligero |
| 16 GB de RAM, solo CPU | 4B-8B cuantizados | Utilizable, más lento que GPU |
| 8 GB de VRAM | 4B-8B cuantizados | Buena configuración local diaria |
| 12-16 GB de VRAM | 8B-14B cuantizados | Gama sólida para workstation |
| 24 GB de VRAM | 14B-32B cuantizados | Uso local de gama alta |
| 48 GB+ de VRAM o mucha memoria unificada | 32B-70B cuantizados | Experimentación con modelos grandes |
La velocidad real depende de la arquitectura, cuantización, longitud de contexto, controladores de GPU y otros procesos activos.
Buenos modelos iniciales
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Usa nomic-embed-text para embeddings de documentos, no como modelo de chat.
VRAM frente a RAM
La VRAM es el factor principal para la velocidad de un modelo local. Si el modelo cabe en ella, las respuestas son mucho más rápidas. Si se desborda a la RAM del sistema, puede seguir funcionando, pero más despacio.
La RAM importa para la inferencia en CPU, la descarga a GPU, ventanas de contexto largas y el resto de la aplicación.
Apple Silicon
Apple Silicon usa memoria unificada, por lo que el modelo comparte la misma reserva con el sistema operativo y las aplicaciones. Las máquinas con más memoria unificada pueden ejecutar modelos cuantizados mayores de lo que sugeriría la VRAM de una GPU discreta.
Deja memoria libre suficiente para el navegador, el backend y el sistema operativo.
NVIDIA
Las GPU NVIDIA suelen ofrecer la mejor compatibilidad de inferencia local mediante CUDA. Usa controladores actuales y confirma el acceso de Docker a la GPU si ejecutas Ollama en contenedores.
AMD e Intel
La compatibilidad depende de Ollama y de los controladores de tu plataforma. La inferencia por CPU sigue disponible sin aceleración GPU.
Reducir el uso de memoria
- Usa modelos más pequeños.
- Usa cuantización Q4 en lugar de Q8.
- Reduce la longitud del contexto.
- Descarga de memoria los modelos que no uses.
- Separa los embeddings documentales de la elección del modelo de chat.
Capacidad del runtime de Work
Work añade recursos de contenedores a WebUI y al proceso del modelo. Cada contenedor de tarea activo recibe de forma predeterminada:
- 2 GB de memoria;
- 2 CPU; y
- 256 procesos.
El backend permite dos tareas activas respaldadas por contenedores en toda la instancia y una por administrador de forma predeterminada. Son límites, no reservas, pero los operadores deben presupuestar simultáneamente WebUI, el navegador, Docker, Ollama y el contenedor. En Apple Silicon todos compiten por la misma memoria unificada.
Usar Ollama Cloud o un plugin remoto puede evitar cargar un modelo grande en RAM o VRAM local. No elimina el requisito de Docker ni los recursos del contenedor de Work.
Cada tarea posee un volumen Docker con nombre para archivos generados y dependencias. Actualmente no hay cuotas de disco por tarea, por lo que las instalaciones o proyectos pueden agotar el almacenamiento. Supervisa la raíz de datos de Docker, establece límites en el host cuando estén disponibles y copia los volúmenes por separado de la base de Libre WebUI.
Ajusta WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT y
WORK_MAX_ACTIVE_RUNTIMES_* solo después de medir el host. Consulta la
referencia de variables de entorno para los valores predeterminados.