llama.cpp 模型部署8 张 2080Ti 上的两种切法:张量并行生成快,预填充却慢同一套卡、同一个模型,llama.cpp 的 --split-mode 从 layer 换成 tensor,token 生成变快了、预填充却慢了好几下。这篇文章把 layer split(流水线)和 tensor split(张量并行)到底切了什么、通信差在哪讲清楚,再用一套 8×2080 Ti 的实测数据,解释为什么这个差异会在生成和预填充两个方向上被放大。 醉月思📁 技术实践📅 2026-08-31