Transformer Attention机制 Self-Attention Cross-Attention把Self-Attention换到Cross时踩过的坑在调试过程中,我发现模型收敛速度比预期的慢,注意力权重分布也很奇怪——几乎所有head的注意力都集中在序列开头… 醉月思📁 技术实践📅 2023-05-23