vLLM
Mer info
- Skapad av
- UC Berkeley Sky Lab
- År
- Ägare
- PyTorch Foundation
- Typ
- LLM inference-server
- Licens
- Apache 2.0
- Officiell sajt
- docs.vllm.ai
- Källkod
- github.com/vllm-project/vllm
High-throughput inference-server för LLM:er — kärninnovation är PagedAttention, som hanterar KV-cache som virtuellt minne istället för en sammanhängande buffert.
Från UC Berkeley (2023). PagedAttention delar upp KV-cachen i fasta block och refererar till dem via en lookup-tabell — gör continuous batching och prefix-sharing möjliga utan att slösa GPU-minne på paddning. Resultat: 2–10× högre throughput än HuggingFace TGI på samma hårdvara.
Stöder de flesta öppna modeller (Llama, Mistral, Qwen, DeepSeek), tensor parallelism över flera GPU:er, kvantisering (AWQ, GPTQ, FP8) och speculative decoding. OpenAI-kompatibel API. Default-valet för on-prem LLM-serving 2025.