Trabajar con modelos de IA
Libre WebUI puede usar modelos Ollama locales y modelos en la nube respaldados por plugins en el mismo espacio de trabajo. El Gestor de modelos muestra modelos Ollama instalados y en ejecución, resultados en directo de la biblioteca Ollama, entradas GGUF de Hugging Face y entradas de Ollama Cloud cuando están disponibles.
Elegir un primer modelo
Úsalos como puntos de partida y cambia según tu hardware y tarea:
| Modelo | Adecuado para | Configuración típica |
|---|---|---|
gemma4:12b | Chat general rápido | 16 GB RAM o 8 GB VRAM |
qwen3.8:27b | Chat general, programación y uso multilingüe | 32 GB RAM o 16-24 GB VRAM |
gemma4:26b | Chat sólido con la eficiencia de MoE | 24 GB RAM o 16 GB VRAM |
gemma4:31b | Chat local denso de máxima calidad | 32 GB RAM o 24 GB VRAM |
nomic-embed-text | Embeddings de documentos | Modelo local pequeño |
Los modelos grandes, como 30B, 70B y MoE, pueden ser excelentes, pero necesitan mucha más memoria. Si tienes dudas, empieza con uno pequeño y aumenta cuando funcione con fluidez.
Gestor de modelos
Abre Configuración → Modelos para:
- Descargar modelos de Ollama por nombre.
- Buscar en directo en la biblioteca Ollama en vez de depender de una lista estática.
- Ver los modelos instalados y en ejecución.
- Actualizar todos los modelos de Ollama instalados en una sola operación.
- Detener o descargar modelos en ejecución.
- Eliminar modelos que ya no necesites.
- Descargar modelos GGUF de Hugging Face mediante Ollama cuando sean compatibles.
- Descargar modelos de Ollama Cloud desde el filtro de nube.
Para los resultados de Ollama Cloud, la interfaz normaliza los nombres antes de
descargarlos. Si un modelo exige el sufijo :cloud o -cloud, Libre WebUI lo aplica
por ti dentro del flujo de modelos en la nube.
Catálogo y visibilidad de modelos
El Catálogo de modelos, en Configuración → Valores predeterminados, enumera todos los modelos de chat seleccionables, tanto locales como de proveedores, con una insignia de proveedor y un buscador. Elige el modelo predeterminado encima del catálogo para definir con qué modelo empiezan los chats nuevos.
Los administradores pueden marcar un modelo con una estrella para fijarlo arriba del catálogo y del menú de modelo predeterminado. Si hay varios modelos marcados, el último en recibir la estrella aparece primero; al quitarla, el modelo recupera su posición manual o la de su proveedor.
Los administradores tienen otro control por fila: un botón con un ojo que oculta el modelo en los selectores del resto. Ocultar reduce catálogos largos a los modelos que un servidor quiere que se utilicen; es un refinamiento de listado, no una puerta de autorización, por lo que debe tratarse como selección y no como límite de seguridad. Los administradores siempre ven la lista completa, con los modelos ocultos marcados.
Modelos locales frente a modelos en la nube
| Modo | Ventajas | Inconvenientes |
|---|---|---|
| Ollama local | Privado, sin conexión tras descargar, coste previsible | Depende de tu CPU, GPU y RAM |
| Ollama Cloud | Flujo familiar sin límites del hardware local | Requiere acceso a la nube y la red |
| Plugins de proveedor | Acceso a modelos gestionados de varios proveedores | Se aplican claves de API, precios y políticas del proveedor |
Puedes reservar modelos locales para trabajo privado y activar plugins para tareas que necesiten modelos alojados más grandes.
Modelo de visión predeterminado
Puedes conversar con un modelo de texto rápido y enviar imágenes. Elige uno en Configuración → Valores predeterminados → Modelos especializados → Modelo de visión; cuando el contexto saliente contenga imágenes —un adjunto nuevo, una imagen anterior o el historial de un chat de incógnito—, ese turno se dirigirá al modelo de visión en vez del modelo de la sesión. Los turnos de solo texto conservan el modelo de la sesión.
El ajuste es por usuario y el enrutamiento, automático y silencioso. Dejar Usar el modelo del chat actual lo desactiva. La comprobación busca imágenes, no las capacidades del modelo de la sesión: si se configura un modelo de visión, todo turno con imágenes lo usa aunque el modelo de la sesión pudiera procesarlas.
La selección guarda la identidad exacta del proveedor (Ollama o un plugin concreto) junto con el nombre, de modo que un proveedor no pueda apropiarse de un modelo con el mismo nombre. Si pierde esa identidad —por ejemplo, porque el modelo o proveedor ya no está disponible—, un turno con imágenes falla. Vuelve a seleccionar el modelo en Configuración → Valores predeterminados → Modelos especializados → Modelo de visión para repararlo. El fallo explícito es deliberado; Libre WebUI no sustituye silenciosamente otro proveedor.
Modelos para Work
Work necesita un modelo de chat que pueda llamar a herramientas. Puede usar:
- Un modelo Ollama instalado que anuncie la capacidad
tools. - Un modelo Ollama Cloud disponible a través del endpoint Ollama configurado.
- Un modelo enumerado por un plugin activo de chat o completado con credenciales configuradas para el administrador actual.
Las ejecuciones de Work mediante plugins usan el adaptador adecuado: compatible con OpenAI, Anthropic o Gemini. Libre WebUI conserva el tipo de proveedor y el ID del plugin exactos con la tarea y cada ejecución, para que un plugin no pueda apropiarse de un modelo Ollama con el mismo nombre. Si el modelo o proveedor rechaza las llamadas a herramientas, la ejecución falla sin cambiar silenciosamente a otro.
Ollama local mantiene las solicitudes en la infraestructura configurada. Con un modelo remoto, el proveedor recibe el prompt de sistema de Work, la conversación, las definiciones y los resultados de las herramientas. Estos pueden incluir texto fuente, salida de comandos o listados solicitados. Los volúmenes y credenciales permanecen en el host del backend, pero el contenido de un archivo puede salir del host si se incluye en un resultado.
Una ejecución autónoma de Work puede hacer varias llamadas. Consulta los precios y políticas de conservación y entrenamiento del proveedor antes de usar proyectos confidenciales. Libre WebUI muestra un aviso de proveedor remoto en Work que cada usuario puede descartar.
Guía de hardware
| Sistema | Intervalo práctico | Notas |
|---|---|---|
| Solo CPU, 8-16 GB RAM | 1B-4B | Chat ligero y pruebas |
| 8 GB VRAM | 4B-8B cuantizados | Punto de partida cómodo |
| 12-16 GB VRAM | 8B-14B cuantizados | Buen intervalo para uso diario |
| 24 GB VRAM | 14B-32B cuantizados | Estación local sólida |
| 48 GB+ VRAM o gran memoria unificada | 32B-70B cuantizados | Experimentación con modelos grandes |
Los modelos cuantizados usan menos memoria. Q4 suele ser el valor práctico predeterminado; Q8 usa más memoria para mejorar la calidad.
Recomendaciones por tarea
| Tarea | Orientación del modelo |
|---|---|
| Chat rápido | gemma4:12b y otros modelos pequeños actuales |
| Programación | Qwen Coder, Codestral y modelos de programación de proveedores |
| Razonamiento | Modelos Qwen y Gemma grandes, y modelos de razonamiento de proveedores |
| Visión | Modelos multimodales como LLaVA, Qwen VL o modelos de proveedores |
| Buscar documentos | nomic-embed-text u otro modelo de embeddings |
| Texto a voz | Plugins TTS como Qwen3-TTS o Kyutai TTS |
Los nombres de modelos cambian con frecuencia. Usa la exploración del proveedor cuando esté disponible o pega el ID exacto de su panel.
Prompts y configuración
- Los controles de generación, como temperatura, límites de tokens, longitud de contexto y penalizaciones, están en Configuración avanzada de generación y permanecen cerrados de forma predeterminada.
- Usa una temperatura baja (
0.1-0.3) para respuestas objetivas y repetibles. - Usa una temperatura media (
0.5-0.7) para el trabajo normal de un asistente. - Usa una temperatura alta (
0.8+) para lluvia de ideas y escritura creativa. - Mantén una longitud de contexto razonable cerca de los límites de memoria.
- Usa personas para disponer de parámetros persistentes y un prompt de sistema reutilizable.
Solución de problemas
Falla la descarga
- Confirma que Ollama esté en ejecución:
ollama list. - Prueba la misma descarga en una terminal para ver el error original.
- Comprueba el espacio en disco antes de descargar modelos grandes.
- Si usas el filtro de nube, deja que Libre WebUI gestione los sufijos.
Las respuestas son lentas
- Prueba un modelo más pequeño o una cuantización menor.
- Comprueba qué está cargado con
ollama ps. - Cierra otras aplicaciones que consuman mucho GPU.
- Reduce la longitud del contexto.
Memoria insuficiente
- Pasa de Q8 a Q4.
- Usa un modelo 8B en vez de 14B.
- Mantén cargado únicamente el modelo necesario.
- En Docker, confirma que el contenedor alcance la GPU o la instancia Ollama del host.