Consejos avanzados
Esta página reúne flujos de trabajo prácticos que hacen que Libre WebUI resulte más rápido, ordenado y fiable en el uso diario.
Mantener cargado un modelo pequeño para el día a día
Usa un modelo local rápido para el trabajo habitual y cambia a modelos más grandes solo cuando la tarea lo requiera.
Buenos ejemplos para uso diario:
gemma4:12bpara chats cotidianos rápidosqwen3.8:27bpara trabajo general más exigentegemma4:26bpara aprovechar la eficiencia de MoE en hardware más potentegemma4:31bpara obtener la mejor calidad local con un modelo densenomic-embed-textpara embeddings de documentos
Abre Modelos para ver cuáles están en ejecución. Descarga de memoria los modelos que no utilices cuando escasee la VRAM.
Usar el chat de incógnito para conversaciones que no deban persistir
Inicia un chat de incógnito desde el menú + de la barra de pestañas, la paleta de comandos, la
página Inicio o el botón fantasma de la pantalla de bienvenida del chat. También tiene una
URL directa: /chat?incognito=1.
Un chat de incógnito nunca persiste: no se crea ninguna sesión en el servidor, no se guarda ningún mensaje y nunca aparece en la barra lateral ni en el historial. El chat muestra un aviso de Modo privado («Esta conversación no se guardará»). Abrir un chat guardado abandona el modo de incógnito; recargar una pestaña de incógnito inicia un chat privado nuevo y vacío, por lo que desaparecen los turnos anteriores.
Ten claro el límite: el modo de incógnito controla la persistencia, no la exposición al proveedor. El modelo seleccionado —local o remoto— sigue recibiendo toda la conversación, y el contexto documental sigue aplicándose cuando está activado. Para una conversación que no deba abandonar tu infraestructura, combina el modo de incógnito con un modelo Ollama local.
Gestionar pestañas con el menú contextual
Haz clic con el botón derecho en una pestaña (o pulsa Shift + F10 cuando tenga el foco) para:
- Cerrar pestaña
- Cerrar las demás pestañas
- Cerrar las pestañas a la derecha
- Cerrar todas las pestañas
Inicio siempre es la primera pestaña y no puede cerrarse. Los administradores también disponen
de entradas directas a Gestión de usuarios, Sistema y Uso de proveedores en el
menú +, y pueden fijar cualquiera de ellas en el pie de la barra lateral (junto a
Ajustes) con el icono de chincheta del menú del avatar, para no necesitar de nuevo ese menú.
Moverse rápidamente con la paleta de comandos
Cmd/Ctrl + K abre la paleta de comandos desde cualquier parte, incluso cuando el
editor tiene el foco. Busca de forma aproximada entre las acciones de la aplicación, tus chats y tus
tareas de Work, por lo que funcionan consultas parciales o mal escritas: autmtn encuentra
Automatizaciones, «imágenes» encuentra Imagine y «oscuro» encuentra el cambio de tema.
A partir de tres caracteres, también busca dentro del contenido de mensajes, notas y documentos
(incluidas las notas compartidas contigo) y muestra un fragmento por coincidencia. Esta búsqueda
se ejecuta sobre tus propios datos descifrados en memoria; no se indexa nada en texto claro en
el disco. Los caracteres coincidentes se resaltan, los resultados se ordenan por relevancia
y, sin consulta, aparecen tus chats y tareas más recientes. Navega con ↑/↓, abre con
Enter y cierra con Esc (o con Cmd/Ctrl + K de nuevo).
Tema predeterminado
Las instalaciones nuevas usan el tema oscuro, aplicado antes del primer renderizado para evitar un
destello claro. Un administrador puede cambiar el valor predeterminado de toda la instancia desde
Configuración > Gestión de usuarios > Tema predeterminado (Claro, Oscuro o Negro Puro). Ese valor predeterminado pinta
la página de inicio de sesión, se aplica a cada cuenta nueva y rige en cualquier navegador que no haya
elegido su propio tema; siempre se respeta una preferencia personal guardada. Libre WebUI no
sigue el ajuste de tema del sistema operativo; cámbialo explícitamente mediante
Cmd/Ctrl + D, el botón de sol/luna o desde Ajustes. El botón alterna entre Claro, Oscuro, Negro Puro y Celestial.
Celestial sigue al sol: la paleta y un cielo vivo (el sol o la luna en su arco, las nubes, las estrellas tras el anochecer, una lámpara que sigue al puntero de noche) cambian minuto a minuto, y el amanecer y el atardecer se desplazan a lo largo del año. Elígelo en Configuración > Apariencia; allí un control deslizante previsualiza cualquier minuto del día y Seguir el reloj devuelve la hora real. Sin ubicación se asume un día de latitud media; comparte tu ubicación (o escribe las coordenadas) y el amanecer y el atardecer se calculan para tu cielo real. La ubicación se redondea a alrededor de un kilómetro, se guarda solo en ese navegador y nunca se envía al servidor. Con una ubicación también puedes activar Seguir el clima: las condiciones actuales llegan directamente de Open-Meteo a tu navegador, y las nubes, la lluvia, la nieve, la niebla y el viento dan forma al cielo.
Mantener enfocadas las tareas de Work
Usa una tarea de Work distinta para cada proyecto u objetivo independiente. Cada tarea tiene su propia conversación, una identidad de contenedor gestionada y archivos persistentes. El contenedor puede detenerse o volver a crearse mientras sobrevive su volumen con nombre, por lo que reutilizar una tarea conserva el contexto útil y empezar otra establece un límite limpio.
Una buena instrucción inicial proporciona al modelo:
- El resultado que quieres.
- Las restricciones técnicas o de diseño importantes.
- El comando o comportamiento que debe verificar la finalización.
- Los archivos o interfaces que deben permanecer sin cambios.
Sigue el progreso en Actividad y después inspecciona y prueba el resultado en Archivos,
Git, Terminal y Vista previa. El editor de archivos ofrece resaltado de sintaxis con temas
claro y oscuro, borradores sin guardar respaldados por el navegador y formato para los tipos admitidos.
Usa Cmd/Ctrl + S para guardar y Shift + Alt + F para dar formato.
Usa un modelo Ollama instalado y capaz de utilizar herramientas cuando quieras que el tráfico del modelo permanezca en tu infraestructura Ollama configurada. Un modelo remoto o en la nube puede reducir la presión sobre la memoria de inferencia local, pero puede realizar varias llamadas facturables y recibe los resultados de herramientas solicitados, que podrían contener datos del espacio de trabajo.
Detener una ejecución o una vista previa conserva el espacio de trabajo. Eliminar una tarea de Work lo borra definitivamente, así que copia antes todo lo que necesites.
Usar personas para trabajos repetibles
Crea personas para los flujos que repites:
- Un revisor de código conciso con temperatura baja.
- Un editor de textos con una guía de estilo clara.
- Un asistente de investigación con la búsqueda documental activada.
- Un asistente de soporte con tono y estructura de respuesta fijos.
Las personas guardan el modelo seleccionado, el mensaje del sistema, los parámetros de generación, el avatar o fondo y ajustes opcionales de memoria y mutación. También pueden exportarse e importarse como JSON.
Conservar notas duraderas junto al trabajo
Abre Notas desde el menú de creación cuando la información deba mantenerse independiente de un chat o una tarea de Work. Las notas admiten vista previa Markdown, edición explícita, búsqueda y guardado automático. La vista previa también representa SVG en línea y HTML básico incrustados en una nota, tras sanearlos para que nunca se ejecuten scripts, controladores de eventos ni URL peligrosas. El panel de herramientas de notas añade un historial de revisiones con restauración, archivos adjuntos, fijación, uso compartido por usuario (lectura o edición), exportación Markdown y una barra lateral de edición con IA que muestra cada propuesta como un diff antes de aplicarla. Como la aplicación captura primero la versión anterior, cualquier edición con IA puede deshacerse. Las notas pertenecen a la cuenta y se incluyen en el archivo completo del usuario; el historial de revisiones y los adjuntos permanecen en la instancia y no forman parte del archivo.
Hacer más fiables los artefactos
Libre WebUI detecta etiquetas explícitas de artefactos, bloques de código cercados, documentos HTML independientes y paquetes HTML comunes con varios archivos. Para obtener el mejor artefacto de un modelo, pídele:
Create one complete self-contained HTML file.
Inline the CSS and JavaScript.
Do not rely on external files unless they are CDN URLs.
Si quieres bloques separados, ponles nombres claros:
```html filename="index.html"
...
```
```css filename="style.css"
...
```
```js filename="app.js"
...
```
Libre WebUI intentará integrar los bloques CSS y JavaScript locales en la vista previa HTML.
Poner prompts en cola mientras fluye una respuesta
Enviar durante la generación añade el prompt a la cola en lugar de descartarlo: los prompts pendientes aparecen sobre el editor, pueden editarse, reordenarse y eliminarse, y se envían uno a uno al terminar cada respuesta. La cola se guarda con el chat, por lo que sobrevive a una recarga o reconexión.
Bifurcar una conversación
El botón de bifurcación de cualquier mensaje copia la conversación hasta ese punto en un chat nuevo, incluidas las variantes, y registra su origen. La conversación original no cambia, por lo que las digresiones exploratorias no contaminan el hilo principal.
Comparar modelos en un turno
El botón de columnas junto al selector de herramientas envía tu siguiente prompt a un máximo de tres modelos adicionales. Cada respuesta es una generación independiente con su propia etiqueta, estadísticas y control de cancelación, de modo que un modelo lento o fallido no bloquea a los demás.
Usar el chat con documentos de forma deliberada
El chat con documentos acepta archivos PDF, Office (DOCX/PPTX/XLSX), Markdown, HTML, de código y CSV de hasta 10 MB. La búsqueda funciona de dos formas:
- La búsqueda por palabras clave (BM25) siempre está disponible.
- La búsqueda híbrida fusiona la clasificación semántica y por palabras clave cuando los embeddings están activados en Ajustes y hay un modelo de embeddings disponible.
Instala nomic-embed-text si quieres un modelo local de embeddings sencillo:
ollama pull nomic-embed-text
Para obtener mejores resultados, sube documentos enfocados por chat en lugar de un enorme conjunto heterogéneo.
Ajustar la configuración de generación
| Ajuste | Uso práctico |
|---|---|
| Temperatura | Bájala para mejorar la precisión y súbela para explorar creativamente |
| Top P / Top K | Conserva los valores predeterminados salvo que ajustes el muestreo a propósito |
| Ventana de contexto | Auméntala en chats largos solo si el modelo y la memoria lo permiten |
| Máximo de tokens | Limita respuestas largas o auméntalo para generar código y artefactos |
| Penalización por repetición | Súbela ligeramente cuando un modelo entra en bucle |
Cuando un modelo se comporte mal, baja primero la temperatura, reduce después la presión del contexto y prueba finalmente otro modelo.
Decidir cuánto razona un modelo
El control situado junto al nombre del modelo en el editor abre los niveles de razonamiento: desactivado, activado, bajo, medio y alto. La selección pertenece a la conversación, así que sobrevive a una recarga y se aplica a la regeneración; Ajustes > Generación contiene el valor predeterminado de las respuestas nuevas, y el panel de controles del chat muestra el mismo valor.
Si lo dejas sin definir, no se envía nada, igual que en todas las versiones anteriores. Si lo defines, el servidor traduce el valor para el proveedor que responda: Ollama lo recibe en el cuerpo de la solicitud, los proveedores compatibles con OpenAI reciben un esfuerzo de razonamiento y Anthropic y Gemini reciben un presupuesto de tokens con espacio reservado para la respuesta.
Conviene saber dos cosas. Un modelo que Ollama declara incapaz de razonar nunca recibe el ajuste, así que el control simplemente no aparece. Además, los niveles con nombre solo existen en modelos que los publican, como gpt-oss; en un modelo que razona sin niveles, cualquier nivel con nombre se comporta como activado, de modo que cambiar de modelo dentro de un chat no produce errores. Cuando se define un valor predeterminado global o fijado, el botón del editor muestra el nivel con el que realmente se ejecutará la siguiente respuesta, y la entrada «Predeterminado» indica a qué valor se resuelve actualmente.
Vigilar la ventana de contexto
El anillo junto al nombre del modelo se llena conforme crece la conversación. Pasa el cursor por encima para ver cuánto se ha llenado, los tokens usados y la ventana respecto a la cual se miden. Se vuelve ámbar al superar cuatro quintas partes y rojo al alcanzar el límite; si se desconoce la ventana de un modelo, muestra un anillo discontinuo en lugar de uno vacío.
El recuento cubre lo que enviará realmente la siguiente solicitud: el historial compactado
y las ramas abandonadas no cuestan nada. Parte de la medición del proveedor para la
última respuesta, si existe, y añade una estimación de cuatro caracteres por token para
lo añadido desde entonces, marcada con ~ cuando aún no hay medición. Si una ventana está
limitada por debajo de la longitud de entrenamiento del modelo, se indica: el medidor
mide la ventana real de la solicitud, que es OLLAMA_MAX_CONTEXT (32,768 de forma
predeterminada), no la longitud completa de entrenamiento. Aumenta esa variable y tanto
la ventana real como el medidor cambiarán con ella.
Los modelos de proveedores solo muestran una ventana cuando su catálogo publica una. Si no, el medidor sigue contando tokens, pero no tiene ningún valor entre el que dividirlos.
Permitir que los chats largos se compacten solos
Los administradores pueden activar la compactación del contexto en Ajustes > Generación. Cuando el contexto estimado de una conversación supera el umbral de tokens, el servidor pide a un modelo que resuma los mensajes antiguos y conserva literalmente solo los más recientes. El resumen aparece como una tarjeta en el punto donde se plegó el historial, y los mensajes resumidos se muestran atenuados: siguen siendo legibles, pero ya no se envían al modelo. Con la compactación activada, el número de «mensajes recientes conservados» también es la ventana móvil que envía una conversación, por lo que aumentarlo amplía realmente lo que ve el modelo.
| Ajuste | Qué controla |
|---|---|
| Umbral de tokens | Tamaño estimado del contexto que activa una compactación |
| Mensajes recientes conservados | Cuántos de los mensajes más recientes permanecen siempre literales |
| Modelo de compactación | Modelo que escribe los resúmenes; de forma predeterminada, el de la conversación |
| Prompt de resumen personalizado | Tus instrucciones, con {{PREVIOUS_SUMMARY}} y {{MESSAGES}} |
La compactación está desactivada de forma predeterminada y se aplica a todos los usuarios del servidor, pero cada chat mantiene el control: su panel puede desactivarla para una conversación y cada tarjeta de resumen incluye una opción de deshacer, que reactiva exactamente los mensajes sustituidos por ese resumen, una compactación cada vez. Nunca divide un turno: los mensajes conservados literalmente siempre comienzan por uno tuyo. Cada nueva compactación integra el resumen anterior en el nuevo, por lo que una conversación mantiene un único resumen acumulativo. Si falla el resumidor, la generación continúa con el historial sin compactar en lugar de bloquearse.
Mantener claves de proveedores por usuario
Los plugins de proveedores pueden leer claves del entorno, pero las credenciales por usuario suelen ser más adecuadas para instalaciones compartidas. Añade las claves en Ajustes para que cada usuario controle su propio acceso a los proveedores.
Usa variables de entorno del backend para valores predeterminados de todo el despliegue o instalaciones automatizadas.
Hacer predecible el acceso remoto
Para acceder desde un teléfono o la red local, vincula el servidor de desarrollo a la interfaz de red:
npm run dev:host
Después abre la IP LAN o Tailscale de la máquina en el puerto 8080 desde el otro dispositivo (dev:host sirve el frontend en 8080, no en el puerto predeterminado de Vite). En producción, define explícitamente CORS_ORIGIN y la URL de la API del frontend para que los navegadores no recurran a localhost.
Consultar tu versión sin salir de la aplicación
Ajustes → Acerca de compara tu compilación con la última versión de GitHub:
indica cuándo está al día, enlaza la página de la versión cuando está atrasada y
señala si una compilación -dev se adelanta a la versión fijada. La misma línea incluye
un botón Ver registro de cambios que vuelve a abrir las notas de versión mostradas
tras actualizar. Si Libre WebUI te resulta útil, el enlace Dar una estrella en GitHub
es la forma más sencilla de ayudar a otras personas a encontrarlo.
Mantener sincronizadas la documentación y la interfaz
El producto cambia rápidamente. Prefiere documentos duraderos que describan comportamientos y flujos de trabajo, y deja que la interfaz muestre las listas de modelos actuales de los proveedores. Evita copiar catálogos extensos de proveedores en la documentación salvo que la aplicación genere la lista.