Transformer Attention BERTAI_Transformer实践笔记在我的实际项目中,具体遇到了这些问题: 1. **长文档分类**:需要对500-1000字的技术文档进行分类,RNN经常记不住文档的主题 2.… 醉月思📁 技术实践📅 2024-10-27
注意力机制 Attention Transformer从全局走到重点:AI注意力机制笔记测试时我们发现:当关键信息出现在 token 序列的前 20% 时,准确率会比出现在后 20% 低 15 个百分点。 醉月思📁 技术实践📅 2024-10-23
Transformer Attention机制 深度学习AI注意力即一切实践笔记当时我在做一个机器翻译的项目,用的还是基于 LSTM 的 seq2seq 模型,那个下午训练曲线又震荡得厉害,我盯着屏幕看了二十分钟,想的是:这… 醉月思📁 学习笔记📅 2024-08-17
位置编码 RoPE ALiBi Transformer 深度学习从位置走到信息:AI位置编码笔记之前用绝对位置编码,生成到1000+token时效果明显变差。 醉月思📁 学习笔记📅 2024-08-12
Transformer Attention机制 深度学习 模型训练 性能优化关于Transformer 架构的几点记录后来硬着头皮从头实现了一遍 Transformer,过程中踩了不少坑,也算是对这个架构有了些实际体会。 醉月思📁 学习笔记📅 2024-06-10
深度学习 神经网络 Transformer从LeNet走到Transformer:神经网络架构设计笔记后来发现 Transformer 更通用,但迁移过程踩了不少坑。 醉月思📁 技术实践📅 2023-05-28
Transformer Attention机制 Self-Attention Cross-Attention把Self-Attention换到Cross时踩过的坑在调试过程中,我发现模型收敛速度比预期的慢,注意力权重分布也很奇怪——几乎所有head的注意力都集中在序列开头… 醉月思📁 技术实践📅 2023-05-23