IT-lexikon AI & ML vLLM

vLLM

AI & ML In English → Uppdaterad: 2026-05-23
Mer info
Skapad av
UC Berkeley Sky Lab
År
Ägare
PyTorch Foundation
Typ
LLM inference-server
Licens
Apache 2.0
Officiell sajt
Källkod
github.com/vllm-project/vllm

High-throughput inference-server för LLM:er — kärninnovation är PagedAttention, som hanterar KV-cache som virtuellt minne istället för en sammanhängande buffert.

Från UC Berkeley (2023). PagedAttention delar upp KV-cachen i fasta block och refererar till dem via en lookup-tabell — gör continuous batching och prefix-sharing möjliga utan att slösa GPU-minne på paddning. Resultat: 2–10× högre throughput än HuggingFace TGI på samma hårdvara.

Stöder de flesta öppna modeller (Llama, Mistral, Qwen, DeepSeek), tensor parallelism över flera GPU:er, kvantisering (AWQ, GPTQ, FP8) och speculative decoding. OpenAI-kompatibel API. Default-valet för on-prem LLM-serving 2025.

← Tillbaka till lexikonet