Constitutional AI
Anthropics träningsmetod där en LLM lär sig att följa en skriven "konstitution" (uppsättning principer) genom att kritisera och revidera sina egna svar — utan att människor behöver märka upp varje exempel.
Två steg: (1) Supervised learning där modellen genererar ett svar, kritiserar det enligt principen, och skriver om det; (2) RLAIF — Reinforcement Learning from AI Feedback, där en separat modell väljer mellan svar baserat på samma principer.
Skalar bättre än ren RLHF (mindre människo-annotering) och gör värderingarna inspekterbara — du kan läsa konstitutionen. Använd av Claude-familjen sedan 2022.