Saltar al contenido principal

Trabajar con modelos de IA

Libre WebUI puede usar modelos Ollama locales y modelos en la nube respaldados por plugins en el mismo espacio de trabajo. El Gestor de modelos muestra modelos Ollama instalados y en ejecución, resultados en directo de la biblioteca Ollama, entradas GGUF de Hugging Face y entradas de Ollama Cloud cuando están disponibles.

Elegir un primer modelo

Úsalos como puntos de partida y cambia según tu hardware y tarea:

ModeloAdecuado paraConfiguración típica
gemma4:12bChat general rápido16 GB RAM o 8 GB VRAM
qwen3.8:27bChat general, programación y uso multilingüe32 GB RAM o 16-24 GB VRAM
gemma4:26bChat sólido con la eficiencia de MoE24 GB RAM o 16 GB VRAM
gemma4:31bChat local denso de máxima calidad32 GB RAM o 24 GB VRAM
nomic-embed-textEmbeddings de documentosModelo local pequeño

Los modelos grandes, como 30B, 70B y MoE, pueden ser excelentes, pero necesitan mucha más memoria. Si tienes dudas, empieza con uno pequeño y aumenta cuando funcione con fluidez.

Gestor de modelos

Abre Configuración → Modelos para:

  • Descargar modelos de Ollama por nombre.
  • Buscar en directo en la biblioteca Ollama en vez de depender de una lista estática.
  • Ver los modelos instalados y en ejecución.
  • Actualizar todos los modelos de Ollama instalados en una sola operación.
  • Detener o descargar modelos en ejecución.
  • Eliminar modelos que ya no necesites.
  • Descargar modelos GGUF de Hugging Face mediante Ollama cuando sean compatibles.
  • Descargar modelos de Ollama Cloud desde el filtro de nube.

Para los resultados de Ollama Cloud, la interfaz normaliza los nombres antes de descargarlos. Si un modelo exige el sufijo :cloud o -cloud, Libre WebUI lo aplica por ti dentro del flujo de modelos en la nube.

Catálogo y visibilidad de modelos

El Catálogo de modelos, en Configuración → Valores predeterminados, enumera todos los modelos de chat seleccionables, tanto locales como de proveedores, con una insignia de proveedor y un buscador. Elige el modelo predeterminado encima del catálogo para definir con qué modelo empiezan los chats nuevos.

Los administradores pueden marcar un modelo con una estrella para fijarlo arriba del catálogo y del menú de modelo predeterminado. Si hay varios modelos marcados, el último en recibir la estrella aparece primero; al quitarla, el modelo recupera su posición manual o la de su proveedor.

Los administradores tienen otro control por fila: un botón con un ojo que oculta el modelo en los selectores del resto. Ocultar reduce catálogos largos a los modelos que un servidor quiere que se utilicen; es un refinamiento de listado, no una puerta de autorización, por lo que debe tratarse como selección y no como límite de seguridad. Los administradores siempre ven la lista completa, con los modelos ocultos marcados.

Modelos locales frente a modelos en la nube

ModoVentajasInconvenientes
Ollama localPrivado, sin conexión tras descargar, coste previsibleDepende de tu CPU, GPU y RAM
Ollama CloudFlujo familiar sin límites del hardware localRequiere acceso a la nube y la red
Plugins de proveedorAcceso a modelos gestionados de varios proveedoresSe aplican claves de API, precios y políticas del proveedor

Puedes reservar modelos locales para trabajo privado y activar plugins para tareas que necesiten modelos alojados más grandes.

Modelo de visión predeterminado

Puedes conversar con un modelo de texto rápido y enviar imágenes. Elige uno en Configuración → Valores predeterminados → Modelos especializados → Modelo de visión; cuando el contexto saliente contenga imágenes —un adjunto nuevo, una imagen anterior o el historial de un chat de incógnito—, ese turno se dirigirá al modelo de visión en vez del modelo de la sesión. Los turnos de solo texto conservan el modelo de la sesión.

El ajuste es por usuario y el enrutamiento, automático y silencioso. Dejar Usar el modelo del chat actual lo desactiva. La comprobación busca imágenes, no las capacidades del modelo de la sesión: si se configura un modelo de visión, todo turno con imágenes lo usa aunque el modelo de la sesión pudiera procesarlas.

La selección guarda la identidad exacta del proveedor (Ollama o un plugin concreto) junto con el nombre, de modo que un proveedor no pueda apropiarse de un modelo con el mismo nombre. Si pierde esa identidad —por ejemplo, porque el modelo o proveedor ya no está disponible—, un turno con imágenes falla. Vuelve a seleccionar el modelo en Configuración → Valores predeterminados → Modelos especializados → Modelo de visión para repararlo. El fallo explícito es deliberado; Libre WebUI no sustituye silenciosamente otro proveedor.

Modelos para Work

Work necesita un modelo de chat que pueda llamar a herramientas. Puede usar:

  • Un modelo Ollama instalado que anuncie la capacidad tools.
  • Un modelo Ollama Cloud disponible a través del endpoint Ollama configurado.
  • Un modelo enumerado por un plugin activo de chat o completado con credenciales configuradas para el administrador actual.

Las ejecuciones de Work mediante plugins usan el adaptador adecuado: compatible con OpenAI, Anthropic o Gemini. Libre WebUI conserva el tipo de proveedor y el ID del plugin exactos con la tarea y cada ejecución, para que un plugin no pueda apropiarse de un modelo Ollama con el mismo nombre. Si el modelo o proveedor rechaza las llamadas a herramientas, la ejecución falla sin cambiar silenciosamente a otro.

Ollama local mantiene las solicitudes en la infraestructura configurada. Con un modelo remoto, el proveedor recibe el prompt de sistema de Work, la conversación, las definiciones y los resultados de las herramientas. Estos pueden incluir texto fuente, salida de comandos o listados solicitados. Los volúmenes y credenciales permanecen en el host del backend, pero el contenido de un archivo puede salir del host si se incluye en un resultado.

Una ejecución autónoma de Work puede hacer varias llamadas. Consulta los precios y políticas de conservación y entrenamiento del proveedor antes de usar proyectos confidenciales. Libre WebUI muestra un aviso de proveedor remoto en Work que cada usuario puede descartar.

Guía de hardware

SistemaIntervalo prácticoNotas
Solo CPU, 8-16 GB RAM1B-4BChat ligero y pruebas
8 GB VRAM4B-8B cuantizadosPunto de partida cómodo
12-16 GB VRAM8B-14B cuantizadosBuen intervalo para uso diario
24 GB VRAM14B-32B cuantizadosEstación local sólida
48 GB+ VRAM o gran memoria unificada32B-70B cuantizadosExperimentación con modelos grandes

Los modelos cuantizados usan menos memoria. Q4 suele ser el valor práctico predeterminado; Q8 usa más memoria para mejorar la calidad.

Recomendaciones por tarea

TareaOrientación del modelo
Chat rápidogemma4:12b y otros modelos pequeños actuales
ProgramaciónQwen Coder, Codestral y modelos de programación de proveedores
RazonamientoModelos Qwen y Gemma grandes, y modelos de razonamiento de proveedores
VisiónModelos multimodales como LLaVA, Qwen VL o modelos de proveedores
Buscar documentosnomic-embed-text u otro modelo de embeddings
Texto a vozPlugins TTS como Qwen3-TTS o Kyutai TTS

Los nombres de modelos cambian con frecuencia. Usa la exploración del proveedor cuando esté disponible o pega el ID exacto de su panel.

Prompts y configuración

  • Los controles de generación, como temperatura, límites de tokens, longitud de contexto y penalizaciones, están en Configuración avanzada de generación y permanecen cerrados de forma predeterminada.
  • Usa una temperatura baja (0.1-0.3) para respuestas objetivas y repetibles.
  • Usa una temperatura media (0.5-0.7) para el trabajo normal de un asistente.
  • Usa una temperatura alta (0.8+) para lluvia de ideas y escritura creativa.
  • Mantén una longitud de contexto razonable cerca de los límites de memoria.
  • Usa personas para disponer de parámetros persistentes y un prompt de sistema reutilizable.

Solución de problemas

Falla la descarga

  • Confirma que Ollama esté en ejecución: ollama list.
  • Prueba la misma descarga en una terminal para ver el error original.
  • Comprueba el espacio en disco antes de descargar modelos grandes.
  • Si usas el filtro de nube, deja que Libre WebUI gestione los sufijos.

Las respuestas son lentas

  • Prueba un modelo más pequeño o una cuantización menor.
  • Comprueba qué está cargado con ollama ps.
  • Cierra otras aplicaciones que consuman mucho GPU.
  • Reduce la longitud del contexto.

Memoria insuficiente

  • Pasa de Q8 a Q4.
  • Usa un modelo 8B en vez de 14B.
  • Mantén cargado únicamente el modelo necesario.
  • En Docker, confirma que el contenedor alcance la GPU o la instancia Ollama del host.

Documentación relacionada