指尖魔法屋
  • 文章
  • 分类
  • 标签
  • 时间轴
  • 关于
  • 联系
  • 🔍

VLLM

LLM 缓存策略 Redis vLLM 推理优化
AI模型缓存:推理不够用了之后
前阵子接了个私活,帮一家创业公司搞AI客服。
醉月思 醉月思
📁 技术实践
📅 2024-10-01
vLLM PagedAttention 推理加速
AI vLLM:PagedAttention不够用了之后
先说背景:我们团队去年要做个企业级问答系统,模型用的 Qwen2-72B。
醉月思 醉月思
📁 技术实践
📅 2024-05-11
模型部署 TorchServe vLLM GPU优化
AI模型部署:推理不够用了之后
先说个最实在的:项目背景是个多模态问答系统,推理环境是 4 张 A100 80GB,PyTorch 2.1.1,CUDA 12.1。
醉月思 醉月思
📁 技术实践
📅 2024-03-11
Copyright © 2017-2026 指尖魔法屋. All rights reserved POWERED BY thinkBlog · v6.1.0 关于 · 联系 · 隐私政策 · Cookie 政策 本站已顽强运行:加载中...
粤ICP备17055617号