IT-lexikon AI & ML Continuous batching

Continuous batching

AI & ML In English → Uppdaterad: 2026-07-30

En LLM-inferensteknik som dynamiskt fyller på nya förfrågningar i en pågående batch så fort en plats blir ledig — i stället för att vänta tills hela batchen är klar. Maximerar GPU-utnyttjandet och genomströmningen i en LLM-serveringsmotor.

Problem med vanlig (statisk) batching: olika förfrågningar genererar olika många tokens, så de blir klara vid olika tidpunkter; en statisk batch måste vänta på den längsta → GPU:n står delvis sysslolös. Continuous batching (även "in-flight" eller "dynamic batching") behandlar varje genereringssteg som en möjlighet att plocka in nya väntande förfrågningar i de luckor som uppstår när andra blir klara → GPU:n hålls mättad. Vinst: dramatiskt högre genomströmning (flera gångers) i serveringssystem. Populariserades av vLLM (tillsammans med PagedAttention) och finns nu i TGI, TensorRT-LLM m.fl. En kärnteknik bakom effektiv LLM-servering i stor skala. Hör ihop med PagedAttention och KV-cache.

← Tillbaka till lexikonet