The Local LLM Index / Quantization & Formats / #47

patchy631/time-to-first-token

by patchy631 · Quantization & Formats · updated 28d ago

A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking.

69
momentum
942
stars
106
forks
#47
rank
learning-resourcesllmllm-inferencemlopsroadmapsglangvllm
View on GitHub →