Transformer:抛弃循环与卷积的序列建模
本文是对 Attention Is All You Need 的精读笔记。本文按照论文的结构,依次梳理其研究动机,模型架构中的Encoder-Decoder、Self-Attention、Multi-Head Attention、三种 attention、前馈网络与位置编码、残差连接等、Self-Attention 优势论证,训练配置与实验结果,搭配了案例理解原理。
本文是对 Attention Is All You Need 的精读笔记。本文按照论文的结构,依次梳理其研究动机,模型架构中的Encoder-Decoder、Self-Attention、Multi-Head Attention、三种 attention、前馈网络与位置编码、残差连接等、Self-Attention 优势论证,训练配置与实验结果,搭配了案例理解原理。
八月初启,暑色未收,秋意已在风里。许多新的问题也像尚未翻开的书页一样,安静地等在前面。此刻并不急着知道它们最终会通向哪里,只愿在一次次阅读、推演与尝试之间,渐渐看清一些东西,也渐渐发现更多值得追问的方向。山长水阔,且从这一卷开始。