Aller au contenu principal

Conseils avancés

Cette page rassemble des méthodes pratiques qui rendent Libre WebUI plus rapide, plus ordonné et plus fiable au quotidien.

Garder un petit modèle chargé au quotidien

Utilisez un modèle local rapide pour les tâches courantes et ne passez à des modèles plus grands que lorsque la tâche l'exige.

Quelques bons modèles pour un usage quotidien :

  • gemma4:12b pour des conversations courantes rapides
  • qwen3.8:27b pour des tâches générales plus exigeantes
  • gemma4:26b pour l'efficacité du MoE sur du matériel plus puissant
  • gemma4:31b pour la meilleure qualité locale avec un modèle dense
  • nomic-embed-text pour les plongements vectoriels de documents

Ouvrez Modèles pour voir quels modèles sont en cours d'exécution. Déchargez ceux que vous n'utilisez pas lorsque la VRAM vient à manquer.

Utiliser le chat privé pour les conversations à ne pas conserver

Démarrez un chat privé depuis le menu + de la barre d'onglets, la palette de commandes, la page d'accueil ou le bouton fantôme de l'écran d'accueil du chat. Il dispose également d'une URL directe : /chat?incognito=1.

Un chat privé n'est jamais conservé : aucune session n'est créée sur le serveur, aucun message n'est enregistré et il n'apparaît jamais dans la barre latérale ni dans l'historique. Le chat affiche une bannière Mode privé (« Cette conversation ne sera pas enregistrée »). Ouvrir un chat enregistré quitte le mode privé ; recharger un onglet privé démarre un nouveau chat privé vide, ce qui efface les échanges précédents.

Il faut bien comprendre cette limite : le mode privé contrôle la persistance, pas l'exposition aux fournisseurs. Le modèle sélectionné — local ou distant — reçoit toujours la totalité de la conversation, et le contexte documentaire continue de s'appliquer lorsqu'il est activé. Pour une conversation qui ne doit pas quitter votre infrastructure, associez le mode privé à un modèle Ollama local.

Gérer les onglets avec le menu contextuel

Faites un clic droit sur un onglet (ou appuyez sur Shift + F10 lorsqu'il a le focus) pour accéder aux options suivantes :

  • Fermer l'onglet
  • Fermer les autres onglets
  • Fermer les onglets à droite
  • Fermer tous les onglets

L'accueil est toujours le premier onglet et ne peut pas être fermé. Les administrateurs disposent aussi d'entrées directes Gestion des utilisateurs, Système et Utilisation des fournisseurs dans le menu + et peuvent épingler chacune des trois dans le pied de la barre latérale (à côté des paramètres) grâce à l'icône d'épingle du menu de l'avatar, afin de ne plus avoir à passer par ce menu.

Cmd/Ctrl + K ouvre la palette de commandes depuis n'importe où, même lorsque la zone de rédaction a le focus. Elle effectue une recherche approximative parmi les actions de l'application, vos chats et vos tâches Work : les requêtes partielles ou mal orthographiées aboutissent tout de même ; autmtn trouve Automatisations, « images » trouve Imagine et « sombre » trouve le changement de thème. À partir de trois caractères, elle recherche aussi dans le contenu des messages, notes et documents (y compris les notes partagées avec vous) et affiche un extrait pour chaque résultat. Cette recherche s'effectue sur vos propres données déchiffrées en mémoire ; rien n'est indexé en clair sur le disque. Les caractères correspondants sont surlignés, les résultats sont classés par pertinence et, sans requête, vos chats et tâches les plus récents s'affichent. Naviguez avec /, ouvrez avec Enter et fermez avec Esc (ou à nouveau Cmd/Ctrl + K).

Thème par défaut

Les nouvelles installations utilisent le thème sombre, appliqué avant le premier affichage pour éviter tout flash lumineux. Un administrateur peut changer le thème par défaut de l'instance depuis Paramètres > Gestion des utilisateurs > Thème par défaut (Clair, Sombre ou Noir Pur). Ce thème par défaut habille la page de connexion, sert de base à chaque nouveau compte et s'applique dans tout navigateur qui n'a pas choisi son propre thème ; une préférence personnelle enregistrée est toujours respectée. Libre WebUI ne suit pas le réglage de thème du système d'exploitation ; changez-le explicitement avec Cmd/Ctrl + D, le bouton soleil/lune ou dans les paramètres. Le bouton fait défiler Clair, Sombre, Noir Pur et Céleste.

Céleste suit le soleil : la palette et un ciel vivant (le soleil ou la lune sur son arc, les nuages, les étoiles après le crépuscule, une lampe qui suit le pointeur la nuit) évoluent minute par minute, tandis que le lever et le coucher du soleil se déplacent au fil de l'année. Choisissez-le dans Paramètres > Apparence ; un curseur y prévisualise n'importe quelle minute de la journée, et Suivre l'horloge ramène à l'heure réelle. Sans position, le thème suppose une journée de latitude moyenne ; partagez votre position (ou saisissez des coordonnées) et le lever et le coucher du soleil sont calculés pour votre ciel réel. La position est arrondie à environ un kilomètre, conservée uniquement dans ce navigateur et jamais envoyée au serveur. Avec une position, vous pouvez aussi activer Suivre la météo : les conditions actuelles arrivent directement d'Open-Meteo dans votre navigateur, et les nuages, la pluie, la neige, le brouillard et le vent façonnent le ciel.

Garder les tâches Work bien ciblées

Utilisez une tâche Work distincte pour chaque projet ou objectif indépendant. Chaque tâche possède sa propre conversation, une identité de conteneur gérée et des fichiers persistants. Le conteneur lui-même peut s'arrêter ou être recréé sans que son volume nommé disparaisse ; réutiliser la même tâche conserve donc le contexte utile, tandis qu'une nouvelle tâche crée une séparation nette.

Une bonne instruction initiale fournit au modèle :

  • Le résultat souhaité.
  • Les contraintes techniques ou de conception importantes.
  • La commande ou le comportement permettant de vérifier l'achèvement.
  • Les fichiers ou interfaces qui doivent rester inchangés.

Suivez la progression dans Activité, puis inspectez et testez le résultat dans Fichiers, Git, Terminal et Aperçu. L'éditeur de fichiers prend en charge la coloration syntaxique avec les thèmes clair et sombre, les brouillons non enregistrés conservés dans le navigateur et le formatage pour les types de fichiers pris en charge. Utilisez Cmd/Ctrl + S pour enregistrer et Shift + Alt + F pour mettre en forme.

Utilisez un modèle Ollama installé capable d'employer des outils si vous souhaitez que le trafic du modèle reste sur votre infrastructure Ollama configurée. Un modèle distant ou cloud peut réduire la pression sur la mémoire d'inférence locale, mais il peut effectuer plusieurs appels facturés et reçoit les résultats d'outils demandés, lesquels peuvent contenir des données de l'espace de travail.

L'arrêt d'une exécution ou d'un aperçu conserve l'espace de travail. La suppression d'une tâche Work supprime son espace de travail définitivement ; copiez donc au préalable tout ce dont vous avez besoin.

Utiliser les personas pour les tâches répétitives

Créez des personas pour les méthodes de travail que vous répétez :

  • Un réviseur de code concis avec une faible température.
  • Un assistant de rédaction doté d'un guide de style clair.
  • Un assistant de recherche avec la recherche documentaire activée.
  • Un assistant d'assistance avec un ton et une structure de réponse fixes.

Les personas enregistrent le modèle sélectionné, le message système, les paramètres de génération, l'avatar ou l'arrière-plan, ainsi que les réglages facultatifs de mémoire et de mutation. Ils peuvent également être exportés et importés au format JSON.

Conserver des notes durables à côté de votre travail

Ouvrez Notes depuis le menu de création lorsque des informations doivent rester indépendantes d'un chat ou d'une tâche Work. Les notes prennent en charge l'aperçu Markdown, la modification explicite, la recherche et l'enregistrement automatique. L'aperçu affiche aussi le SVG intégré et le HTML de base incorporés à une note, après nettoyage afin que les scripts, gestionnaires d'événements et URL dangereuses ne s'exécutent jamais. Le tiroir d'outils des notes ajoute un historique des révisions avec restauration, des pièces jointes, l'épinglage, le partage par utilisateur (lecture ou modification), l'exportation Markdown et un volet latéral de modification par l'IA qui présente chaque proposition sous forme de diff avant son application. Comme l'application crée d'abord un instantané de la version précédente, toute modification par l'IA peut être annulée. Les notes appartiennent au compte et sont incluses dans l'archive utilisateur complète ; l'historique des révisions et les pièces jointes restent sur l'instance et ne font pas partie de l'archive.

Rendre les artefacts plus fiables

Libre WebUI détecte les balises d'artefacts explicites, les blocs de code délimités, les documents HTML autonomes et les ensembles HTML multifichiers courants. Pour obtenir les meilleurs artefacts d'un modèle, demandez-lui :

Create one complete self-contained HTML file.
Inline the CSS and JavaScript.
Do not rely on external files unless they are CDN URLs.

Si vous souhaitez des blocs séparés, nommez-les clairement :

```html filename="index.html"
...
```

```css filename="style.css"
...
```

```js filename="app.js"
...
```

Libre WebUI tentera de regrouper les blocs CSS et JavaScript locaux dans l’aperçu HTML.

Mettre des prompts en file d’attente pendant la diffusion d’une réponse

L’envoi pendant une génération place le prompt dans une file d’attente au lieu de l’abandonner : les prompts en attente apparaissent au-dessus de la zone de rédaction, peuvent être modifiés, réorganisés et supprimés, puis sont envoyés un par un à mesure que chaque réponse se termine. La file est stockée avec le chat, de sorte qu’elle subsiste après un rechargement ou une reconnexion.

Créer une branche de conversation

Le bouton de branchement d’un message copie la conversation jusqu’à cet endroit dans un nouveau chat, variantes comprises, et enregistre son origine. La conversation d’origine reste intacte, afin que les explorations n’encombrent jamais le fil principal.

Comparer plusieurs modèles en un seul tour

Le bouton des colonnes situé à côté du sélecteur d’outils envoie votre prochain prompt à un maximum de trois modèles supplémentaires. Chaque réponse constitue une génération distincte, avec son propre libellé de modèle, ses statistiques et sa commande d’annulation. Un modèle lent ou défaillant ne bloque donc jamais les autres.

Utiliser le chat documentaire à bon escient

Le chat documentaire accepte les fichiers PDF, Office (DOCX/PPTX/XLSX), Markdown, HTML, de code et CSV jusqu’à 10 MB. La recherche fonctionne selon deux modes :

  • La recherche par mots-clés (BM25) est toujours disponible.
  • La recherche hybride fusionne les classements sémantique et lexical lorsque les plongements sont activés dans les paramètres et qu’un modèle de plongement est disponible.

Installez nomic-embed-text si vous souhaitez un modèle de plongement local simple :

ollama pull nomic-embed-text

Pour de meilleurs résultats, téléversez des documents bien ciblés dans chaque chat plutôt qu'un immense ensemble hétérogène.

Ajuster les paramètres de génération

ParamètreUtilisation pratique
TempératureRéduisez-la pour la précision, augmentez-la pour l'exploration créative
Top P / Top KGardez les valeurs par défaut sauf si vous réglez délibérément l'échantillonnage
Fenêtre de contexteAugmentez-la pour les longs chats uniquement si le modèle et la mémoire le permettent
Nombre maximal de jetonsLimitez les longues réponses ou augmentez-le pour la génération de code ou d'artefacts
Pénalité de répétitionAugmentez-la légèrement lorsqu'un modèle tourne en boucle

Lorsqu'un modèle se comporte mal, réduisez d'abord la température, puis la pression sur le contexte, avant d'essayer un autre modèle.

Choisir l'intensité de raisonnement d'un modèle

La commande à côté du nom du modèle dans la zone de rédaction ouvre les niveaux de raisonnement : désactivé, activé, faible, moyen et élevé. Ce choix appartient à la conversation : il persiste après un rechargement et s'applique à une régénération. Paramètres > Génération contient la valeur par défaut des nouvelles réponses, et le panneau de commandes du chat affiche la même valeur.

Si vous ne la définissez pas, rien n'est envoyé, comme dans toutes les versions précédentes. Lorsque vous la définissez, le serveur traduit cette valeur unique pour le fournisseur qui répond : Ollama la reçoit dans le corps de la requête, les fournisseurs de type OpenAI reçoivent un effort de raisonnement, et Anthropic et Gemini reçoivent un budget de jetons qui réserve de la place à la réponse.

Deux points sont à retenir. Un modèle qu'Ollama déclare incapable de raisonner ne reçoit jamais ce réglage ; la commande est donc tout simplement absente. Par ailleurs, les niveaux nommés n'existent que sur les modèles qui les publient, comme gpt-oss ; sur un modèle qui raisonne sans niveaux, un niveau nommé se comporte simplement comme activé, de sorte qu'un chat passant d'un modèle à l'autre ne génère jamais d'erreur. Lorsqu'une valeur par défaut globale ou épinglée est définie, le bouton de la zone de rédaction affiche le niveau réellement employé par la prochaine réponse, et l'entrée « Par défaut » précise la valeur à laquelle elle correspond actuellement.

Surveiller la fenêtre de contexte

L'anneau à côté du nom du modèle se remplit au fil de la conversation. Survolez-le pour connaître le taux de remplissage de la fenêtre, le nombre de jetons utilisés et la fenêtre de référence. Il devient orange au-delà de quatre cinquièmes, puis rouge à la limite ; lorsque la fenêtre d'un modèle est inconnue, l'anneau est en pointillés au lieu de paraître vide.

Le décompte correspond à ce que la prochaine requête enverra réellement : l'historique compacté et les branches abandonnées ne coûtent rien. Il part de la mesure fournie par le fournisseur pour la dernière réponse, le cas échéant, puis ajoute une estimation de quatre caractères par jeton pour ce qui a été ajouté à la conversation depuis ; un ~ s'affiche quand aucune mesure n'existe encore. Si une fenêtre est limitée en dessous de la longueur d'entraînement du modèle, cela est indiqué : l'indicateur mesure la fenêtre réellement utilisée par la requête, à savoir OLLAMA_MAX_CONTEXT (32,768 par défaut), et non la longueur d'entraînement complète du modèle. Augmentez cette variable pour que la fenêtre réelle et l'indicateur évoluent ensemble.

Les modèles de fournisseurs affichent une fenêtre uniquement lorsque leur liste de modèles en publie une. Dans le cas contraire, l'indicateur continue de compter les jetons, mais ne dispose simplement d'aucune valeur par laquelle les diviser.

Laisser les longues conversations se compacter automatiquement

Les administrateurs peuvent activer la compaction du contexte dans Paramètres > Génération. Une fois que le contexte estimé d'une conversation dépasse le seuil de jetons, le serveur demande à un modèle de résumer les anciens messages et ne conserve intégralement que les plus récents. Le résumé apparaît sous forme de carte à l'endroit de la conversation où l'historique a été replié, et les messages résumés sont affichés en grisé : ils restent lisibles, mais ne sont plus envoyés au modèle. Lorsque la compaction est activée, le nombre de « messages récents conservés » correspond aussi à la fenêtre glissante envoyée par une conversation ; l'augmenter élargit donc réellement ce que voit le modèle.

ParamètreFonction
Seuil de jetonsTaille estimée du contexte qui déclenche une compaction
Messages récents conservésNombre de messages les plus récents toujours conservés intégralement
Modèle de compactionModèle qui rédige les résumés ; par défaut, celui de la conversation
Invite de résumé personnaliséeVos propres instructions, avec {{PREVIOUS_SUMMARY}} et {{MESSAGES}}

La compaction est désactivée par défaut et s'applique à tous les utilisateurs du serveur, mais chaque chat garde le dernier mot : le panneau de commandes du chat peut la désactiver pour une conversation, et chaque carte de résumé propose une annulation, qui réactive exactement les messages remplacés par ce résumé, une compaction à la fois. Elle ne scinde jamais un tour : les messages conservés intégralement commencent toujours par l'un des vôtres. Chaque nouvelle compaction intègre le résumé précédent au nouveau, de sorte qu'une conversation ne comporte qu'un seul résumé évolutif. Si le modèle de résumé échoue, la génération se poursuit avec l'historique non compacté au lieu d'être bloquée.

Conserver des clés de fournisseurs propres à chaque utilisateur

Les extensions de fournisseurs peuvent lire les clés d'environnement, mais les identifiants propres aux utilisateurs sont généralement plus adaptés aux installations partagées. Ajoutez les clés dans les paramètres afin que chaque utilisateur contrôle ses propres accès aux fournisseurs.

Utilisez les variables d'environnement du serveur pour les valeurs par défaut à l'échelle du déploiement ou les installations automatisées.

Rendre l'accès distant prévisible

Pour un accès depuis un téléphone ou le réseau local, liez le serveur de développement à l'interface réseau :

npm run dev:host

Ouvrez ensuite l'adresse IP locale ou Tailscale de la machine sur le port 8080 depuis l'autre appareil (dev:host sert l'interface sur le port 8080, et non sur le port Vite par défaut). En production, définissez explicitement CORS_ORIGIN et l'URL de l'API de l'interface afin que les navigateurs ne se rabattent pas sur localhost.

Vérifier votre version sans quitter l'application

Paramètres → À propos compare votre version à la dernière publication GitHub : la page indique si elle est à jour, fournit un lien vers la publication si elle est en retard et signale lorsqu'une version -dev est en avance sur la publication épinglée. La même ligne comprend un bouton Voir le journal des modifications qui rouvre les notes de version affichées après la mise à niveau. Si Libre WebUI vous est utile, le lien Ajouter une étoile sur GitHub est le moyen le plus simple d'aider d'autres personnes à le découvrir.

Maintenir la documentation et l'interface synchronisées

Le produit évolue rapidement. Privilégiez une documentation pérenne qui décrit les comportements et les méthodes de travail, et laissez l'interface afficher les listes de modèles des fournisseurs en direct. Évitez de recopier de longs catalogues de fournisseurs dans la documentation, sauf si la liste est générée par l'application.

Documentation connexe