CUDA
NVIDIA:s parallell-computing-plattform och programmeringsmodell — lanserad 2006. Den moat som gjort NVIDIA till världens mest värdefulla företag.
C/C++-extension (__global__ void kernel(...)), executerar på GPU-cores. Hierarki: thread → warp (32 threads) → block → grid. Compilerar till PTX (NVIDIA:s intermediate representation) → SASS (specifikt för GPU-generation). Libraries ovanpå: cuBLAS, cuDNN, NCCL, TensorRT.
PyTorch, TensorFlow, JAX, llama.cpp använder CUDA via dessa libs. Konkurrent: AMD ROCm (försöker komma ifatt), Intel oneAPI/SYCL, Apple Metal, OpenCL (förlorat). Mojo och Triton försöker abstrahera CUDA bort.