RAG (Retrieval-Augmented Generation)
Tekniken att hämta relevanta dokument från en kunskapsbas och stoppa in dem i en LLM:s kontext innan den svarar — så att svaret grundas i faktiska källor i stället för bara modellens träningsdata. Standardsättet att ge en LLM aktuell, privat eller verifierbar kunskap.
Mekanik: användarens fråga görs om till en embedding, en vektorsökning hämtar de mest relevanta textbitarna (chunks) ur en databas, och dessa klistras in i prompten som kontext. Modellen svarar utifrån det hämtade materialet och kan citera källor. Vinst: minskad hallucination, färska/privata fakta utan omträning, spårbarhet. Problem: kvaliteten hänger helt på hämtningen ("garbage in, garbage out"), chunking-strategi, och att rätt material faktiskt rankas högt. Förbättringar: reranking, hybrid search, query expansion, semantic chunking. Myntades i ett Meta/FAIR-paper 2020 och blev den dominerande arkitekturen för LLM-appar med egen data. Hör ihop med chunking och hybrid search.