Produkt · 7 oktober 2026
Även publicerad på Français
Ny artikel förklarar RLHF och anpassning av artificiell intelligens
En ny del av serien Inside the machine beskriver processen för anpassning och utbildning av modeller för artificiell intelligens.
StartupBusiness rapporterade att den sjunde delen av serien fokuserar på hur modeller utbildas genom mänskliga bedömningar och varför det krävs begränsningar för att förhindra att modellen enbart försöker vara till lags.
Enligt texten är en basmodell, som resultatet av förträning, inte en assistent utan kompletterar endast texter. För att skapa en assistent krävs först övervakad finjustering, känd som SFT, där modellen tränas med mänskliga exempel i form av frågor och ideala svar så att den lär sig att svara.
Det andra steget är förstärkningsinlärning från mänsklig feedback, eller RLHF. I denna process skriver modellen två olika svar på samma fråga, varpå en människa väljer det föredragna alternativet. Genom tusentals sådana jämförelser tränas en belöningsmodell som fungerar som en automatisk domare som ger betyg till varje svar, vilket driver modellen att producera svar som belönas.
För att genomföra denna utbildning används algoritmen PPO, eller proximal policy optimization, som presenterades av OpenAI år 2017 och användes för InstructGPT, vilket var grunden för den första versionen av ChatGPT. PPO justerar nätverkets vikter baserat på belöningsmodellens betyg; höga betyg gör valen mer sannolika och låga betyg gör dem mindre sannolika.
Begreppet proximal innebär att varje uppdatering av modellen måste ligga nära den föregående versionen. Dessutom finns en koppling till den ursprungliga SFT-modellen för att säkerställa att modellen inte avviker för mycket från sin utgångspunkt.
Kvaliteten på belöningsmodellen beror helt på de mänskliga jämförelserna. Om utvärderarna prioriterar tonfall framför korrekthet kommer belöningsmodellen att lära sig att premiera tonfallet. Ett exempel visar hur ett långt och empatiskt svar med punktlistor kan väljas framför ett korrekt svar, trots att det empatiska svaret ger felaktiga instruktioner till kunden.