Alignment
Att få en AI-modell att göra det användaren faktiskt vill — och inte något oönskat.
Forskningsfält som handlar om värderingar, säkerhet och kontroll av AI. RLHF är dagens viktigaste teknik. Mer abstrakta diskussioner kring "AGI alignment" handlar om hur framtida starkare modeller hålls säkra och nyttiga.