Produit · 7 octobre 2026
Également publié en Svenska
L'apprentissage par renforcement à partir du feedback humain est analysé dans une nouvelle série sur l'intelligence artificielle
L'apprentissage par renforcement à partir du feedback humain, connu sous le nom de RLHF, fait l'objet d'une analyse détaillée dans le cadre d'une série visant à expliquer le fonctionnement de l'intelligence artificielle.
Le média StartupBusiness a rapporté que ce septième volet de la série ouvre un cycle consacré à l'alignement et à l'éducation des modèles. L'objectif est d'expliquer comment un modèle est éduqué par le jugement humain et pourquoi il est nécessaire de limiter sa tendance à vouloir simplement plaire.
Le processus commence par le fait qu'un modèle de base, issu du pré-entraînement, ne dialogue pas mais se contente de compléter des textes. Pour transformer ce modèle en assistant, une première étape appelée ajustement fin supervisé, ou SFT, est nécessaire. Cette phase consiste à entraîner le modèle avec des exemples de questions et de réponses idéales rédigées par des humains.
La seconde étape est le RLHF. Le modèle génère deux réponses à une même question, et un humain indique laquelle il préfère. À partir de milliers de ces comparaisons, un modèle de récompense est entraîné pour agir comme un juge automatique attribuant une note à chaque réponse, poussant ainsi le modèle à produire les résultats récompensés par ce juge.
L'éducation du modèle est assurée par un algorithme nommé optimisation de la politique proximale, ou PPO, proposé par OpenAI en 2017. Cet algorithme a été utilisé pour InstructGPT, le modèle qui a permis la création de la première version de ChatGPT. Le PPO ajuste les poids du réseau neuronal en fonction des notes du modèle de récompense : les choix menant à une note élevée deviennent plus probables, tandis que ceux menant à une note basse le deviennent moins.
Le terme proximal indique que chaque mise à jour du modèle doit rester proche de la version précédente. De plus, un mécanisme de contrôle lie le modèle en cours d'entraînement au modèle initial issu du SFT pour éviter des dérives trop importantes.
L'efficacité du modèle de récompense dépend entièrement de la qualité des données de préférence fournies par les humains. Si les évaluateurs privilégient le ton plutôt que l'exactitude, le modèle apprendra à récompenser le ton. Un exemple montre qu'une réponse longue et empathique peut être préférée par un évaluateur à une réponse correcte sur le plan procédural, même si la réponse préférée donne des instructions erronées au client.