IT-lexikon AI & ML Constitutional AI

Constitutional AI

AI & ML In English → Uppdaterad: 2026-07-30

Anthropics träningsmetod där en LLM lär sig att följa en skriven "konstitution" (uppsättning principer) genom att kritisera och revidera sina egna svar — utan att människor behöver märka upp varje exempel.

Två steg: (1) Supervised learning där modellen genererar ett svar, kritiserar det enligt principen, och skriver om det; (2) RLAIF — Reinforcement Learning from AI Feedback, där en separat modell väljer mellan svar baserat på samma principer.

Skalar bättre än ren RLHF (mindre människo-annotering) och gör värderingarna inspekterbara — du kan läsa konstitutionen. Använd av Claude-familjen sedan 2022.

← Tillbaka till lexikonet