Advertisement

深度学习|Transformer的核心内容

阅读量:

目录

    • 选择Transformer的原因是什么?
  • 注意力机制的核心要素是什么?

    • Q矩阵的定义是什么?
    • 计算流程如何实现?
      • 自注意力机制的具体运作原理是怎样的?
      • 多头注意力机理如何展开?
  • 3种Transformer架构设计

    • 3.1位置编码机制

      • 3.2模型训练阶段
      • 3.3带遮罩的自注意力
      • 3.4输出层设计
    • 4 Transformer 的细节

      • 4.1 Add & Norm
      • 4.2 留个坑

前言:

本博客旨在为初学者分享一些学习心得与思路,请广大网友包涵包谅!
在进入实验室后的首次学习汇报中涉及了 Transformer 模型的相关内容,在后续的研究工作中逐渐转向其他领域后便逐渐遗忘了这一细节。
不幸的是,在近期的校内夏令营面试中被要求回答相关问题后意识到仍需进一步加强专业知识储备。

参考博客:

1 为什么使用

全部评论 (0)

还没有任何评论哟~