昇腾 大模型微调 LoRA FSDP昇腾 910B 微调 Qwen3.8-27B:从 OOM 到 4096 上下文 LoRA记录一次 8 张昇腾 910B 上的 Qwen3.8-27B LoRA 实验:从短序列测试的误区、FLA 的 NPU 接入,到冻结层梯度检查点与 FSDP2 配合,最后以 4096 上下文完成 2475 步训练,并复盘验证集上的过拟合。 醉月思📁 技术实践📅 2026-09-07