指尖魔法屋
  • 文章
  • 分类
  • 标签
  • 时间轴
  • 关于
  • 联系
  • 🔍

Attention机制

Transformer Attention机制 深度学习
AI注意力即一切实践笔记
当时我在做一个机器翻译的项目,用的还是基于 LSTM 的 seq2seq 模型,那个下午训练曲线又震荡得厉害,我盯着屏幕看了二十分钟,想的是:这…
醉月思 醉月思
📁 学习笔记
📅 2024-08-17
Transformer Attention机制 深度学习 模型训练 性能优化
关于Transformer 架构的几点记录
后来硬着头皮从头实现了一遍 Transformer,过程中踩了不少坑,也算是对这个架构有了些实际体会。
醉月思 醉月思
📁 学习笔记
📅 2024-06-10
Transformer Attention机制 Self-Attention Cross-Attention
把Self-Attention换到Cross时踩过的坑
在调试过程中,我发现模型收敛速度比预期的慢,注意力权重分布也很奇怪——几乎所有head的注意力都集中在序列开头…
醉月思 醉月思
📁 技术实践
📅 2023-05-23
Copyright © 2017-2026 指尖魔法屋. All rights reserved POWERED BY thinkBlog · v6.1.0 关于 · 联系 · 隐私政策 · Cookie 政策 本站已顽强运行:加载中...
粤ICP备17055617号