RLHF Reinforcement Learning from Human Feedback
Tekniken som gör en rå LLM hjälpsam, ofarlig och artig: människor rankar AI-svar och modellen lär sig producera vad de föredrar.
Process: visa modellen två svar på samma fråga, fråga människor vilket de föredrar, träna modellen att producera "vinnaren"-stilen oftare. Itererat tusentals gånger.
Anledningen till att Claude och ChatGPT känns mänskliga snarare än autocomplete på steroider. Också grunden för att inte svara på "hur bygger jag en bomb"-frågor.