Aller au contenu principal

Travailler avec les modèles d’IA

Libre WebUI peut utiliser des modèles Ollama locaux et des modèles cloud fournis par des plugins dans le même espace de travail. Le gestionnaire de modèles affiche les modèles Ollama installés, les modèles en cours d’exécution, les résultats en direct de la bibliothèque Ollama, les entrées GGUF de Hugging Face et, lorsqu’elles sont disponibles, les entrées d’Ollama Cloud.

Choisir un premier modèle

Utilisez les modèles suivants comme points de départ, puis changez-en selon votre matériel et votre tâche :

ModèleAdapté àConfiguration typique
gemma4:12bChat général rapide16 GB RAM ou 8 GB VRAM
qwen3.8:27bChat général, codage, usage multilingue32 GB RAM ou 16-24 GB VRAM
gemma4:26bChat performant avec l’efficacité MoE24 GB RAM ou 16 GB VRAM
gemma4:31bChat local dense de la meilleure qualité32 GB RAM ou 24 GB VRAM
nomic-embed-textEmbeddings de documentsPetit modèle d’embedding local

Les grands modèles comme les modèles 30B, 70B et MoE peuvent être excellents, mais exigent beaucoup plus de mémoire. En cas de doute, commencez petit et augmentez la taille une fois que le modèle fonctionne sans difficulté.

Gestionnaire de modèles

Ouvrez Paramètres → Modèles pour :

  • Récupérer des modèles Ollama par leur nom.
  • Effectuer une recherche en direct dans la bibliothèque Ollama au lieu de dépendre d’une liste statique.
  • Afficher les modèles installés et en cours d’exécution.
  • Mettre à jour tous les modèles Ollama installés en une seule opération.
  • Arrêter ou décharger les modèles en cours d’exécution.
  • Supprimer les modèles dont vous n’avez plus besoin.
  • Récupérer les modèles GGUF de Hugging Face via Ollama lorsqu’ils sont compatibles.
  • Récupérer les modèles Ollama Cloud depuis le filtre cloud.

Pour les résultats d’Ollama Cloud, l’interface normalise les noms des modèles cloud avant de les récupérer. Si un modèle cloud exige le suffixe :cloud ou -cloud, Libre WebUI l’applique pour vous dans le flux des modèles cloud.

Catalogue et visibilité des modèles

Le catalogue de modèles, dans Paramètres → Valeurs par défaut, répertorie tous les modèles de chat sélectionnables, qu’ils soient locaux ou fournis par un fournisseur, avec un badge de fournisseur et une zone de recherche. Choisissez le modèle par défaut au-dessus du catalogue pour définir avec quel modèle les nouveaux chats commenceront.

Les administrateurs peuvent ajouter une étoile à un modèle pour l’épingler en haut du catalogue et du menu du modèle par défaut. Si plusieurs modèles sont étoilés, le plus récemment étoilé apparaît en premier ; retirer l’étoile rend au modèle sa position manuelle ou celle de son fournisseur.

Les administrateurs disposent d’une commande supplémentaire sur chaque ligne : un bouton en forme d’œil qui masque le modèle dans les sélecteurs de tous les autres utilisateurs. Ce masquage permet de réduire les longs catalogues aux modèles que le serveur souhaite réellement proposer. Il affine la liste, mais ne constitue pas un contrôle d’autorisation ; considérez-le donc comme un outil de sélection, et non comme une frontière de sécurité. Les administrateurs voient toujours la liste complète, où les modèles masqués sont signalés.

Modèles locaux ou cloud

ModeAvantagesCompromis
Ollama localPrivé, hors ligne après téléchargement, coût prévisibleDépend de votre CPU, GPU et RAM
Ollama CloudFlux Ollama familier sans limites matérielles localesExige un accès au cloud et au réseau
Plugins de fournisseursAccès aux modèles gérés de plusieurs fournisseursLes clés d’API, tarifs et politiques de confidentialité du fournisseur s’appliquent

Vous pouvez conserver les modèles locaux pour les travaux privés et activer des plugins de fournisseurs pour les tâches qui exigent des modèles hébergés plus grands.

Modèle de vision par défaut

Vous pouvez discuter avec un modèle de texte rapide tout en lui envoyant des images. Choisissez un modèle de vision sous Paramètres → Valeurs par défaut → Modèles spécialisés → Modèle de vision. Dès que le contexte de chat sortant contient des images — nouvelle pièce jointe, image antérieure dans la session ou historique d’un chat incognito — ce tour est acheminé vers le modèle de vision configuré à la place du modèle de la session. Les tours ne contenant que du texte conservent le modèle de la session.

Le réglage est propre à chaque utilisateur, et le routage s’effectue automatiquement et sans avertissement. Laisser la sélection sur Utiliser le modèle du chat actuel le désactive. Notez que la vérification porte sur la présence d’images, et non sur les capacités du modèle de la session : lorsqu’un modèle de vision est configuré, chaque tour contenant une image l’utilise, même si le modèle de la session pourrait lui-même traiter des images.

La sélection enregistre l’identité exacte du fournisseur (Ollama ou un plugin précis) avec le nom du modèle, afin qu’un fournisseur ne puisse pas s’approprier un modèle de même nom. Si la sélection enregistrée perd cette identité — par exemple parce que le modèle ou le fournisseur n’est plus disponible — un tour contenant une image échoue. Sélectionnez de nouveau le modèle sous Paramètres → Valeurs par défaut → Modèles spécialisés → Modèle de vision pour rétablir la situation. Cet échec explicite est délibéré : Libre WebUI ne substitue jamais silencieusement un autre fournisseur.

Modèles pour Work

Work exige un modèle de chat capable d’appeler des outils. Il peut utiliser :

  • Un modèle Ollama installé qui annonce la capacité tools.
  • Un modèle Ollama Cloud disponible via le point de terminaison Ollama configuré.
  • Un modèle répertorié par un plugin de chat ou de complétion actif, dont les identifiants sont configurés pour l’administrateur actuel.

Les exécutions Work reposant sur un plugin utilisent l’adaptateur de fournisseur adapté au plugin configuré : compatible avec OpenAI, Anthropic ou Gemini. Libre WebUI conserve le type exact de fournisseur et l’identifiant du plugin avec la tâche et chaque exécution, afin qu’un plugin ne puisse pas s’approprier un modèle Ollama portant le même nom. Si le modèle ou le fournisseur sélectionné refuse les appels d’outils, l’exécution échoue au lieu de basculer silencieusement vers un autre fournisseur.

Avec Ollama local, les requêtes adressées au modèle restent sur l’infrastructure Ollama configurée. Avec un modèle distant, le fournisseur configuré reçoit l’invite système Work, la conversation, les définitions des outils et leurs résultats. Ces résultats peuvent inclure du texte source, une sortie de commande ou des listes de répertoires demandées par le modèle. Les volumes des espaces de travail et les identifiants des fournisseurs restent sur l’hôte du backend, mais le contenu d’un fichier peut quitter cet hôte lorsqu’il figure dans le résultat d’un outil.

Une seule exécution Work autonome peut effectuer plusieurs appels au modèle. Consultez les politiques de tarification, de conservation et d’entraînement du fournisseur distant avant d’utiliser des projets sensibles. Libre WebUI affiche dans Work une notification relative au fournisseur distant, que chaque utilisateur peut masquer.

Guide du matériel

SystèmePlage de modèles pratiqueRemarques
CPU uniquement, 8-16 GB RAM1B-4BAdapté au chat léger et aux tests
8 GB VRAM4B-8B quantifiésBon point de départ
12-16 GB VRAM8B-14B quantifiésBonne plage pour un usage quotidien
24 GB VRAM14B-32B quantifiésPoste de travail local performant
48 GB+ VRAM ou grande mémoire unifiée32B-70B quantifiésExpérimentation sur de grands modèles

Les modèles quantifiés utilisent moins de mémoire. Les quantifications Q4 sont généralement le choix pratique par défaut ; Q8 consomme davantage de mémoire pour une meilleure qualité.

Recommandations par tâche

TâcheOrientation du modèle
Chat rapidegemma4:12b et autres petits modèles actuels
CodageQwen Coder, Codestral, modèles de codage de fournisseurs
RaisonnementGrands modèles Qwen et Gemma, modèles de raisonnement de fournisseurs
VisionModèles multimodaux tels que LLaVA, Qwen VL ou modèles de vision de fournisseurs
Recherche documentairenomic-embed-text ou autre modèle d’embedding
Synthèse vocalePlugins TTS tels que Qwen3-TTS ou Kyutai TTS

Les noms de modèles des fournisseurs changent fréquemment. Dans Libre WebUI, utilisez la découverte des modèles du fournisseur lorsqu’elle est disponible, ou collez l’identifiant exact affiché dans son tableau de bord.

Invites et réglages

  • Les commandes de génération, comme la température, les limites de jetons, la longueur du contexte et les pénalités, sont regroupées sous Réglages de génération avancés et restent fermées par défaut.
  • Utilisez une température basse (0.1-0.3) pour des réponses factuelles et reproductibles.
  • Utilisez une température moyenne (0.5-0.7) pour le travail habituel d’un assistant.
  • Utilisez une température élevée (0.8+) pour les séances d’idéation et l’écriture créative.
  • Conservez une longueur de contexte raisonnable lorsque vous approchez des limites de mémoire.
  • Utilisez des personas si vous souhaitez des paramètres de modèle persistants et une invite système réutilisable.

Dépannage

Échec de la récupération

  • Vérifiez qu’Ollama est en cours d’exécution : ollama list.
  • Essayez la même récupération dans un terminal pour afficher l’erreur brute d’Ollama.
  • Vérifiez l’espace disque avant de récupérer de grands modèles.
  • Si vous utilisez le filtre cloud du gestionnaire de modèles, laissez Libre WebUI gérer les suffixes cloud.

Réponses lentes

  • Essayez un modèle plus petit ou une quantification inférieure.
  • Consultez les éléments chargés avec ollama ps.
  • Fermez les autres applications qui sollicitent fortement le GPU.
  • Réduisez la longueur du contexte.

Mémoire insuffisante

  • Passez de Q8 à Q4.
  • Utilisez un modèle 8B au lieu d’un modèle 14B.
  • Ne conservez chargé que le modèle dont vous avez besoin.
  • Avec Docker, vérifiez que le conteneur peut accéder au GPU ou à l’instance Ollama de l’hôte.

Documentation connexe