Accéder au contenu principal

Guide du débutant LLaMA-Factory WebUI : affinez des LLM

Apprenez à affiner des LLM sur des jeux de données personnalisés, à évaluer les performances, puis à exporter et servir les modèles en toute fluidité grâce au framework low/no-code de LLaMA-Factory.
Actualisé 19 sept. 2026  · 12 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Dans ce tutoriel, nous allons affiner le modèle Llama 3 8B avec LLaMA-Factory WebUI sur le jeu de données Wikipedia Q&A. Nous commencerons par présenter LLaMA-Factory WebUI, puis nous verrons comment le configurer dans l'environnement Google Colab. Une fois la configuration effectuée, nous parcourrons l'ensemble du processus d'affinage du modèle Llama 3 8B sur le jeu de données, puis nous évaluerons ses performances via l'interface de chat.

Au fil des étapes, vous apprendrez également à charger des jeux de données personnalisés, à fusionner des modèles et à les exporter vers Hugging Face. Enfin, nous verrons comment déployer le modèle affiné et le rendre accessible via l'API OpenAI.

Pour aller plus loin sur des sujets IA incontournables comme ChatGPT, les grands modèles de langage, l'IA générative et bien plus, suivez le parcours AI Fundamentals

Image de couverture : affiner des LLM avec LLaMA-Factory WebUI

Image par l’auteur | Canva

Qu’est-ce que LLaMA-Factory ?

hiyouga/LLaMA-Factory est un projet open source qui permet d’affiner plus de 100 grands modèles de langage (LLM) via une interface WebUI. Il fournit un ensemble complet d’outils et de scripts pour l’affinage, le chatbot, le serving et le benchmarking des LLM. 

LLaMA-Factory est conçu pour les débutants et les professionnels non techniques qui souhaitent affiner des LLM open source sur leurs propres jeux de données sans maîtriser des concepts d’IA complexes. Il suffit de choisir un modèle, d’ajouter son jeu de données et d’ajuster quelques paramètres pour lancer l’entraînement. 

Une fois l’entraînement terminé, la même application web permet de tester le modèle, puis de l’exporter vers Hugging Face ou de le sauvegarder en local. C’est un moyen rapide et efficace d’affiner des LLM en local.

Développer des applications d'IA

Apprenez à créer des applications d'IA à l'aide de l'API OpenAI.
Commencez À Upskiller Gratuitement

Premiers pas avec LLaMA-Factory WebUI

Dans cette section, nous allons voir comment installer et lancer LLaMA-Factory WebUI dans Google Colab et sous Microsoft Windows. 

Google Colab met à disposition des GPU gratuits. Si votre ordinateur portable n’en a pas ou n’a pas CUDA installé, nous vous recommandons de démarrer avec un notebook Colab. 

  1. Lancez un notebook Google Colab avec le type d’exécution « T4 GPU ». 
  2. Dans une cellule de code, tapez la commande suivante pour cloner le dépôt GitHub LLaMA-Factory et installer tous les paquets Python nécessaires. 
%cd /content/
%rm -rf LLaMA-Factory
!git clone https://github.com/hiyouga/LLaMA-Factory.git
%cd LLaMA-Factory
%ls
%pip install -e .[torch,bitsandbytes]
  1. Pour accéder aux modèles et jeux de données, vous devez vous connecter au CLI de Hugging Face. Pour cela, générez un nouveau jeton d’accès dans les paramètres Hugging Face, onglet « Access Tokens », puis créez un nouveau jeton pour Google Colab.

Générer un nouveau jeton d’accès Hugging Face

  1. Créez la variable d’environnement Hugging Face avec la fonctionnalité « Secrets » de Colab, qui permet de définir des variables d’environnement accessibles de manière sécurisée depuis le notebook.

Définir la variable d’environnement dans Google Colab via Secrets.

  1. Connectez-vous au Hub Hugging Face à l’aide du jeton d’accès Hugging Face. 
from huggingface_hub import login
from google.colab import userdata
hf_token = userdata.get("HUGGINGFACE_TOKEN")
login(token = hf_token)
  1. Lancez LLaMA-Factory WebUI avec llamafactory-cli. Nous définissons GRADIO_SHARE=1 afin de générer un lien public pour accéder à l’application web. 
%cd /content/LLaMA-Factory/
!GRADIO_SHARE=1 llamafactory-cli webui
  1. Cliquez sur l’URL publique pour ouvrir le WebUI dans un nouvel onglet. 

URL publique du WebUI LLaMA-Factory

L’interface LLaMA-Factory WebUI est simple mais propose de nombreuses options et onglets. Nous les explorerons dans la section suivante. 

LLaMA-Factory WebUI exécuté sur Google Colab

Si vous rencontrez des difficultés pour lancer votre propre LLaMA-Factory WebUI, consultez le notebook Google Colab.

Exécuter LLaMA-Factory WebUI sous Windows

Pour exécuter LLaMA-Factory WebUI en local sous Windows, vous devez installer une version précompilée de la bibliothèque bitsandbytes. Elle prend en charge CUDA 11.1 à 12.2 : choisissez donc la bonne version en fonction de votre version de CUDA.

  1. Ouvrez le terminal Windows et exécutez la commande Git pour cloner le dépôt GitHub LLaMA-Factory.
  2. Installez tous les paquets Python nécessaires.
  3. Installez la bibliothèque bitsandbytes pour Windows.
$ git clone https://github.com/hiyouga/LLaMA-Factory.git

$ cd LLaMA-Factory

$ pip install -e .[torch,bitsandbytes]

$ pip install https://github.com/jllllll/bitsandbytes-windows-webui/releases/download/wheels/bitsandbytes-0.41.2.post2-py3-none-win_amd64.whl
  1. Lancez LLaMA-Factory WebUI.
$ llamafactory-cli webui
  1. N’oubliez pas de vous connecter à Hugging Face via le CLI en fournissant votre jeton d’accès. 
$ huggingface-cli login

Affiner LLaMA-3 8B Chat avec LLaMA-Factory WebUI

Aucun code dans cette section. Nous allons sélectionner le modèle et le jeu de données à affiner, modifier quelques paramètres, puis cliquer sur quelques boutons pour un entraînement rapide. 

Pour comprendre la théorie de l’affinage des grands modèles de langage, consultez ce guide complet : Fine-Tuning Large Language Models.

Sélectionner le jeu de données et le modèle

Nous allons affiner le modèle unsloth/llama-3-8b-bnb-4bit sur le jeu de données Microsoft/wiki_qa. Ce jeu de données contient plusieurs colonnes (voir ci-dessous), mais nous utiliserons uniquement les colonnes « question » et « answer » pour l’affinage. 

Dépôt du jeu de données Wiki_QA sur Hugging Face Hub.

Source : microsoft/wiki_qa | Corpus Wiki Question Answering de Microsoft

Nous ne pouvons pas charger le modèle d’instruction LLaMA-3-8B complet dans la version gratuite de Google Colab. À la place, nous chargerons la version quantifiée en 4 bits du même modèle proposée par Unsloth. 

Pour ce faire, sélectionnez « Custom » comme nom de modèle et collez le lien du dépôt « unsloth/llama-3-8b-bnb-4bit » dans le chemin du modèle.

Paramétrage du modèle et du jeu de données dans LLaMA-Factory WebUI

Vous pouvez sélectionner plusieurs jeux de données pour affiner votre modèle. Toutefois, pour ce tutoriel, nous n’utiliserons que le jeu de données « Wikiqa », que vous pouvez facilement choisir parmi les jeux prédéfinis comme ci-dessus. 

Ajuster les paramètres d’entraînement 

Ajustez les paramètres d’entraînement en faisant défiler la page. Nous allons définir :

  • Le learning rate à 4e-5
  • Le nombre d’epochs à 1,0
  • Max samples à 1000 pour accélérer l’entraînement

Nous laissons les autres paramètres à leurs valeurs par défaut. Vous pourrez les modifier pour ajuster le comportement du modèle affiné. 

Définition des paramètres d’entraînement dans LLaMA-Factory WebUI

Vous pouvez aussi modifier le rang LoRA et d’autres configurations associées. Pour ce tutoriel, nous gardons toutes les autres options par défaut.

Paramétrage de LoRA dans LLaMA-Factory WebUI

Lancer l’entraînement

Faites défiler plus bas pour accéder à la configuration d’entraînement. Renseignez le répertoire de sortie et le chemin de configuration, puis cliquez sur le bouton « Start ». Le graphique de loss mettra un moment à s’afficher, car LLaMA-Factory commence par télécharger le modèle et le jeu de données, puis à les charger, ce qui peut prendre au moins 5 minutes.

Lancement de l’entraînement dans LLaMA-Factory WebUI

Une fois le modèle chargé et l’entraînement démarré, vous verrez les visualisations apparaître sur le graphique de loss. Comme on l’observe, la loss décroît progressivement au fil des étapes, ce qui est bon signe.

Mi-parcours de l’entraînement du modèle dans LLaMA-Factory WebUI

À la fin de l’entraînement, un message « finish » apparaît en bas à gauche. Comme on le voit, la loss a diminué progressivement puis s’est stabilisée après 45 étapes.

Affinage du modèle terminé dans LLaMA-Factory WebUI

Si vous êtes data scientist ou développeur, vous trouverez facile d’affiner votre modèle en Python. 

Nous proposons un guide détaillé pour les profils techniques souhaitant entraîner LLaMA‑3 ici : Fine-Tuning Llama 3 and Using It Locally: A Step-by-Step Guide.

Évaluer le modèle affiné

Pour évaluer le modèle affiné, passez du menu « Train » à « Chat ». Puis, dans « Checkpoint path », chargez l’adapter affiné enregistré. 

Définir le Checkpoint path dans LLaMA-Factory WebUI

Cliquez ensuite sur « Load model » et patientez quelques secondes jusqu’au chargement complet du modèle. 

Chargement du modèle affiné enregistré

Faites défiler pour afficher le champ de saisie du chat et posez une question générale sur une chaîne de montagnes. 

Saisir une question simple dans la boîte de dialogue.

Vous obtiendrez une réponse simple et directe, proche de ce que propose le jeu de données « wiki_qa ».

Réponse générée par le modèle Llama‑3 affiné

Posons une autre question. On constate que le modèle s’en sort très bien. En 30 minutes, nous avons affiné le modèle, ce qui aurait pris plus de 4 heures avec la bibliothèque Transformers. Impressionnant. 

Réponse générée par le modèle Llama‑3 affiné

Parfois, l’affinage ne résout pas tous les problèmes d’un LLM. C’est pourquoi nous vous recommandons de lire RAG vs Fine-Tuning : un tutoriel complet avec des exemples pratiques pour identifier la meilleure approche selon vos besoins.

Fonctionnalités complémentaires de LLaMA-Factory WebUI

Au-delà de l’affinage et des tests, l’écosystème LLaMA-Factory propose des fonctionnalités clés : utilisation de données personnalisées pour l’affinage, fusion et export de modèles, et déploiement des modèles affinés avec VLLM. 

Jeu de données personnalisé

Pour ajouter un jeu de données personnalisé, modifiez simplement le fichier data/dataset_info.json. Il sera alors accessible dans LLaMA-Factory WebUI. 

Pour plus de détails sur le format attendu des fichiers de jeu de données et la manière de modifier le fichier dataset_info.json, reportez-vous à la documentation data/README.md

Vous pouvez utiliser des jeux de données issus des hubs Hugging Face ou ModelScope, ou charger un jeu de données depuis votre disque local.

Fichier dataset_info.json ouvert dans Google Colab.

Aperçu du fichier data/dataset_info.json

Fusion et export du modèle 

Vous pouvez facilement fusionner l’adapter LoRA affiné avec le modèle complet et l’exporter vers Hugging Face Hub en cliquant sur l’onglet « Export ». 

Ajustez la taille maximale des shards, définissez le chemin du répertoire d’export, puis indiquez l’ID du dépôt sur Hugging Face Hub et l’appareil d’export. La fusion et le téléversement de tous les fichiers sur Hugging Face Hub prennent quelques minutes.

Remarque : la version gratuite de Colab offre 12 Go de RAM, alors que la fusion du LoRA d’un modèle de 8 milliards de paramètres nécessite au moins 16 Go. Cette opération n’est donc pas possible dans la version gratuite.

Fusion et export du modèle vers Hugging Face Hub

Fusion et export du modèle affiné vers Hugging Face Hub

Déployer avec une API au format OpenAI et vLLM

LLaMA-Factory intègre le framework vLLM pour le serving et le déploiement. Avec la commande suivante, nous pouvons servir le modèle Llama-3-8B-Instruct et y accéder via l’API Python OpenAI ou en RestAPI. 

$ API_PORT=8000 llamafactory-cli api examples/inference/llama3_vllm.yaml

Vous pouvez modifier ce fichier ou créer votre propre fichier .yaml pour servir votre modèle affiné en production. Il suffit d’indiquer le chemin vers le dossier du modèle en local ou sur Hugging Face Hub. 

Contenu du fichier llama3_vllm.yaml.

Source : hiyouga/LLaMA-Factory (github.com)

Si vous cherchez une solution low-code similaire pour affiner des LLM, notamment le modèle propriétaire GPT-4o, nous avons un guide complet à votre disposition. Suivez notre tutoriel pas à pas ici : Fine-Tuning OpenAI's GPT-4: A Step-by-Step Guide.

Conclusion

LLaMA-Factory WebUI simplifie la vie des débutants comme des experts. Il suffit d’ajuster quelques paramètres pour affiner un modèle sur un jeu de données personnalisé. Avec la même interface, vous pouvez tester le modèle, l’exporter vers Hugging Face ou le sauvegarder en local. Vous pourrez ensuite le déployer en production avec la commande api du CLI LLaMA-Factory. C’est aussi simple que cela. 

Plutôt que d’écrire des centaines de lignes de code et de déboguer des problèmes d’affinage, vous obtenez des résultats similaires en quelques clics.

Dans ce tutoriel, nous avons découvert LLaMA-Factory WebUI et appris à affiner le modèle LLaMA‑3‑8B‑Instruct sur un jeu de données Wikipedia Q&A à l’aide de ce framework. Nous avons également testé le modèle affiné via le menu chatbot intégré et exploré les fonctionnalités supplémentaires proposées par LLaMA-Factory.

Apprenez à affiner des LLM en Python en vous inscrivant gratuitement au prochain webinar Fine-Tuning Your Own Llama 3 Model.

Obtenez une certification de haut niveau en matière d'IA

Démontrez que vous pouvez utiliser l'IA de manière efficace et responsable.

Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

En tant que data scientist certifié, je suis passionné par l'utilisation des technologies de pointe pour créer des applications innovantes d'apprentissage automatique. Avec une solide expérience en reconnaissance vocale, en analyse de données et en reporting, en MLOps, en IA conversationnelle et en NLP, j'ai affiné mes compétences dans le développement de systèmes intelligents qui peuvent avoir un impact réel. En plus de mon expertise technique, je suis également un communicateur compétent, doué pour distiller des concepts complexes dans un langage clair et concis. En conséquence, je suis devenu un blogueur recherché dans le domaine de la science des données, partageant mes idées et mes expériences avec une communauté grandissante de professionnels des données. Actuellement, je me concentre sur la création et l'édition de contenu, en travaillant avec de grands modèles linguistiques pour développer un contenu puissant et attrayant qui peut aider les entreprises et les particuliers à tirer le meilleur parti de leurs données.

Sujets
Intelligence artificielle
Grands modèles linguistiques

Les meilleurs cours DataCamp sur les LLM

Cours

Développement d'applications LLM avec LangChain

3 h
50.6K
Découvrez comment créer des applications alimentées par l'IA en utilisant des LLM, des invites, des chaînes et des agents dans LangChain.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow