Transformer 注意力机制深入拆解 Transformer:从注意力到完整架构很多 Transformer 教程从完整架构图和 Q/K/V 公式开讲,初学者每个词都认识,连起来却看不懂。这篇文章跟着“我爱猫”的翻译过程,从 token 怎样交换信息,一步步拼出 Encoder、Decoder、训练与推理。 醉月思📁 学习笔记📅 2026-08-03
Transformer CNN ResNet ViT BERT GPT MLM神经网络架构演进:从CNN到Transformer从LeNet到Transformer,从CNN到ViT,系统梳理神经网络架构的演进与实践 醉月思📁 技术实践📅 2026-02-14
Attention机制 Cross-Attention Transformer注意力机制:Self与Cross-Attention在调试过程中,我发现模型收敛速度比预期的慢,注意力权重分布也很奇怪——几乎所有head的注意力都集中在序列开头… 醉月思📁 技术实践📅 2023-05-23