Continuous batching
En LLM-inferensteknik som dynamiskt fyller på nya förfrågningar i en pågående batch så fort en plats blir ledig — i stället för att vänta tills hela batchen är klar. Maximerar GPU-utnyttjandet och genomströmningen i en LLM-serveringsmotor.
Problem med vanlig (statisk) batching: olika förfrågningar genererar olika många tokens, så de blir klara vid olika tidpunkter; en statisk batch måste vänta på den längsta → GPU:n står delvis sysslolös. Continuous batching (även "in-flight" eller "dynamic batching") behandlar varje genereringssteg som en möjlighet att plocka in nya väntande förfrågningar i de luckor som uppstår när andra blir klara → GPU:n hålls mättad. Vinst: dramatiskt högre genomströmning (flera gångers) i serveringssystem. Populariserades av vLLM (tillsammans med PagedAttention) och finns nu i TGI, TensorRT-LLM m.fl. En kärnteknik bakom effektiv LLM-servering i stor skala. Hör ihop med PagedAttention och KV-cache.