The Local LLM Index / Quantization & Formats / #75

mudler/vllm.cpp

by mudler · Quantization & Formats · updated today

a community oriented 1:1, vLLM-alike (Continuous batching, paged KV) engine in C++ with additional features (GGUF, RadixAttention, Cache-aware scheduling, ...)

66
momentum
396
stars
53
forks
#75
rank
continous-batchingcpp20llmmlxpaged-attentionradixattentionvllm
View on GitHub →