Transformer架构解析

分词

位置编码

自注意力机制
注意力机制(Attention Mechanisnt)是深度学习中的一种重要技术,它允许模型在处理信息时聚焦于最重要的部分,同时忽略那些不太相关的信息。这种机制模仿了人类在处理信息时的选择性注意过程,从而提高了模型的性能和效率。
QKV (query Key Value)
用你的问题(Query),去和文章中每句话的标签(Key)进行匹配,看看哪个最相关。哪个Key匹配度高,就说明它对应的信息(Value)更重要,我们就给它更高的关注度(权重),然后把这些重要的信息整合起来,形成最终的答案。
多头自注意力机制


带掩码的多头注意力机制

Add & Norm
残差连接:多头注意力计算后的+计算前的向量:目的:解决深层网络训练中的梯度消失问题,同时保留原始输入信息,提高模型的训练稳定性和表达能力。
2. 层归一化:Layer Norm,对每一层(每个样本)进行归一化(标准化处理:均值为0、方差为1)目的:加速训练并提升模型泛化能力
有些模型Add & Norm不一定在注意力机制和前置神经网络的后面,有可能会在之前。
FFN:Feed Foward 前置神经网络

解码器-嵌入层

解码器-自回归生成

Decoder-only
Encoder-Decoder:编码器+解码器
Decoder-only:只保留解码器(主流架构)
Encoder-only:只保留编码器
Transformer可视化
https://poloclub.github.io/transformer-explainer/

注:词表中的内容可以是偏旁部首,这样就可以减少总词表内的数量,比如:只保留 氵之后去拼接一下字,比如 少 (沙)






Top-k:k设置为5 从前5中选择概率输出
Top-p:p:0.5 前面概率加起来不超过0.5 但是有的时候会超出一点点 sum=0.56(防止一个也取不到)
1 本文章标题: Transformer架构解析
2 本文章地址: https://www.yf2029.com/articles/transformer%E6%9E%B6%E6%9E%84%E8%A7%A3%E6%9E%90
3 本站文章内容仅供学习、交流与界面验证参考,如有版权或引用问题,请联系站点维护者处理。
4 本站不对文中外部链接、第三方资源或读者据此操作产生的结果承担保证责任。
评论
登录后即可发表评论和回复。