模型部署 TorchServe vLLM GPU优化AI模型部署:推理不够用了之后先说个最实在的:项目背景是个多模态问答系统,推理环境是 4 张 A100 80GB,PyTorch 2.1.1,CUDA 12.1。 醉月思📁 技术实践📅 2024-03-11
大模型微调 LoRA Q-LoRA 机器学习大模型微调折腾手记结果光显存这块就踩了一堆坑:先是用全参数微调直接 OOM,换 LoRA 还是顶不住,最后上 Q-LoRA 才勉强在 24G 显存上跑起来。 醉月思📁 技术实践📅 2024-02-07