The Local LLM Index / Quantization & Formats / #75
mudler/vllm.cpp
by mudler · Quantization & Formats · updated today
a community oriented 1:1, vLLM-alike (Continuous batching, paged KV) engine in C++ with additional features (GGUF, RadixAttention, Cache-aware scheduling, ...)
66
momentum
396
stars
53
forks
#75
rank
continous-batchingcpp20llmmlxpaged-attentionradixattentionvllm
View on GitHub →