Reading papers: Attention is all you need.
发布时间
阅读量:
阅读量
最近课堂上Transformer之前的DL基础知识储备差不多了,但学校里一般讲到Transformer课程也接近了尾声;之前参与的一些科研打杂训练了我阅读论文的能力和阅读源码的能力,也让我有能力有兴趣对最最源头的论文一探究竟;我最近也想按照论文梳理一下LLM是如何一路发展而来的,所以决定阅读经典论文。本文是这个系列的第一篇。
最近课堂上,在Transformer之前的深度学习基础课程已基本掌握;但学校课程中提到的Transformer相关内容已基本覆盖;通过参与科研辅助工作提升了自身在阅读学术论文和理解代码方面的能力;这使我具备了一探学术前沿论文的兴趣;近期计划深入研究大语言模型的发展脉络;本文是这个系列的第一篇。
这篇文章引入了一种简洁而高效的架构设计——注意力机制(Attention),其核心技术基础正是Transformer模型。作为大语言模型(LLM)的关键技术之一,在最初应用于机器翻译领域后迅速拓展了其应用范围。具体来说,在此之前的机器翻译技术中采用的是Encoder-Decoder(端到端)模式,在这一方案中Encoder和Decoder均为循环神经网络结合注意力机制搭建而成。值得注意的是,在这项研究中作者提出了一种创新性思路——完全摒弃了传统 recurrent neural networks(RNNs),整个端到端架构完全是基于注意力机制构建的。
图解整
全部评论 (0)
还没有任何评论哟~
