前端工程发布于 2026年7月9日

Transformer架构解析

Transformer架构解析 分词 位置编码 自注意力机制 注意力机制(Attention Mechanisnt)是深度学习中的一种重要技术,它允许模型在处理信息时聚焦于最重要的部分,同时忽略那些不太相关的信息。这种机制模仿了人类在处理信...

站点作者3 次阅读最后更新 2026年7月27日
返回首页·Markdown 正文渲染

Transformer架构解析

image\.png

分词

ChatGPT Image 2026年5月15日 19\_05\_27\.png

位置编码

ChatGPT Image 2026年5月15日 19\_08\_01\.png

自注意力机制

注意力机制(Attention Mechanisnt)是深度学习中的一种重要技术,它允许模型在处理信息时聚焦于最重要的部分,同时忽略那些不太相关的信息。这种机制模仿了人类在处理信息时的选择性注意过程,从而提高了模型的性能和效率。

QKV (query Key Value)

用你的问题(Query),去和文章中每句话的标签(Key)进行匹配,看看哪个最相关。哪个Key匹配度高,就说明它对应的信息(Value)更重要,我们就给它更高的关注度(权重),然后把这些重要的信息整合起来,形成最终的答案。

多头自注意力机制

ChatGPT Image 2026年5月15日 19\_25\_53\.pngimage\.png

带掩码的多头注意力机制

image\.png

Add & Norm

  1. 残差连接:多头注意力计算后的+计算前的向量:目的:解决深层网络训练中的梯度消失问题,同时保留原始输入信息,提高模型的训练稳定性和表达能力。

2. 层归一化:Layer Norm,对每一层(每个样本)进行归一化(标准化处理:均值为0、方差为1)目的:加速训练并提升模型泛化能力

有些模型Add & Norm不一定在注意力机制和前置神经网络的后面,有可能会在之前。

FFN:Feed Foward 前置神经网络

ChatGPT Image 2026年5月15日 21\_57\_12\.png

解码器-嵌入层

ChatGPT Image 2026年5月15日 22\_07\_28\.png

解码器-自回归生成

ChatGPT Image 2026年5月15日 22\_09\_16\.png

Decoder-only

Encoder-Decoder:编码器+解码器

Decoder-only:只保留解码器(主流架构)

Encoder-only:只保留编码器

Transformer可视化

https://poloclub.github.io/transformer-explainer/

image\.png

注:词表中的内容可以是偏旁部首,这样就可以减少总词表内的数量,比如:只保留 氵之后去拼接一下字,比如 少 (沙)

image\.pngimage\.pngimage\.pngimage\.pngimage\.pngimage\.png

Top-k:k设置为5 从前5中选择概率输出

Top-p:p:0.5 前面概率加起来不超过0.5 但是有的时候会超出一点点 sum=0.56(防止一个也取不到)

版权声明

1 本文章标题: Transformer架构解析

2 本文章地址: https://www.yf2029.com/articles/transformer%E6%9E%B6%E6%9E%84%E8%A7%A3%E6%9E%90

3 本站文章内容仅供学习、交流与界面验证参考,如有版权或引用问题,请联系站点维护者处理。

4 本站不对文中外部链接、第三方资源或读者据此操作产生的结果承担保证责任。

上一篇

Prompt提示词工程

React

下一篇

GPT和TransFormer架构 大模型工作原理

AI

评论

登录后即可发表评论和回复。

0 条
评分
0/1000
还没有评论,来说两句吧

AI Knowledge Blog

记录代码与设计实践

分享开发经验、项目思考与持续成长的过程

站点反馈

如果你在浏览或使用过程中有建议,欢迎告诉我们。