Sheared LLaMA: Accelerating Language Model Pre-Training via Structured Pruningxiamengzhou.github.io 3jmorgan2ydiscuss
Ollama for Linux – Run LLMs on Linux with GPU Accelerationgithub.com/jmorganca 173jmorgan2y54 comments
Efficient Memory Management for Large Language Model Serving with PagedAttentionarxiv.org 102jmorgan2y16 comments