指尖魔法屋
  • 文章
  • 分类
  • 标签
  • 时间轴
  • 关于
  • 联系
  • 🔍

Transformer

Transformer Attention BERT
AI_Transformer实践笔记
在我的实际项目中,具体遇到了这些问题: 1. **长文档分类**:需要对500-1000字的技术文档进行分类,RNN经常记不住文档的主题 2.…
醉月思 醉月思
📁 技术实践
📅 2024-10-27
注意力机制 Attention Transformer
从全局走到重点:AI注意力机制笔记
测试时我们发现:当关键信息出现在 token 序列的前 20% 时,准确率会比出现在后 20% 低 15 个百分点。
醉月思 醉月思
📁 技术实践
📅 2024-10-23
Transformer Attention机制 深度学习
AI注意力即一切实践笔记
当时我在做一个机器翻译的项目,用的还是基于 LSTM 的 seq2seq 模型,那个下午训练曲线又震荡得厉害,我盯着屏幕看了二十分钟,想的是:这…
醉月思 醉月思
📁 学习笔记
📅 2024-08-17
位置编码 RoPE ALiBi Transformer 深度学习
从位置走到信息:AI位置编码笔记
之前用绝对位置编码,生成到1000+token时效果明显变差。
醉月思 醉月思
📁 学习笔记
📅 2024-08-12
Transformer Attention机制 深度学习 模型训练 性能优化
关于Transformer 架构的几点记录
后来硬着头皮从头实现了一遍 Transformer,过程中踩了不少坑,也算是对这个架构有了些实际体会。
醉月思 醉月思
📁 学习笔记
📅 2024-06-10
深度学习 神经网络 Transformer
从LeNet走到Transformer:神经网络架构设计笔记
后来发现 Transformer 更通用,但迁移过程踩了不少坑。
醉月思 醉月思
📁 技术实践
📅 2023-05-28
Transformer Attention机制 Self-Attention Cross-Attention
把Self-Attention换到Cross时踩过的坑
在调试过程中,我发现模型收敛速度比预期的慢,注意力权重分布也很奇怪——几乎所有head的注意力都集中在序列开头…
醉月思 醉月思
📁 技术实践
📅 2023-05-23
Copyright © 2017-2026 指尖魔法屋. All rights reserved POWERED BY thinkBlog · v6.1.0 关于 · 联系 · 隐私政策 · Cookie 政策 本站已顽强运行:加载中...
粤ICP备17055617号