vLLM PagedAttention 推理加速AI vLLM:PagedAttention不够用了之后先说背景:我们团队去年要做个企业级问答系统,模型用的 Qwen2-72B。 醉月思📁 技术实践📅 2024-05-11
模型部署 TorchServe vLLM GPU优化AI模型部署:推理不够用了之后先说个最实在的:项目背景是个多模态问答系统,推理环境是 4 张 A100 80GB,PyTorch 2.1.1,CUDA 12.1。 醉月思📁 技术实践📅 2024-03-11