GPT和TransFormer架构 大模型工作原理
CPT和ChatGPT
G:代表“生成式”,这意味着模型能够生成文本,根据给定的起始词或句子,预测文字出现的先后概率生成一段连续的文本,最终形成输出。Generative
P:代表“预训练”,在模型被用于特定任务之前,先通过大规模的文本数据进行预训练,学习语言的基础知识,如语法、拼写以及一些常识。Pre-trained
T:代表 "Transformer",一种特定的深度学习模型结构,通过引入“自注意力”机制使得模型在处理文本时能够理解更复杂的句子结构和语义。Transformer
TransFormer架构
Transformer 架构(Transformer Architecture) 是现代深度学习中非常重要的一种模型结构,尤其在自然语言处理(NLP)领域几乎是“标准配置”。像 OpenAI 的 GPT 系列、Google 的 BERT 等模型,都是基于 Transformer 架构构建的。
一、核心思想:Attention(注意力机制)
Transformer 的核心是一个概念:
👉 “让模型自动关注最重要的信息”
传统模型(RNN、LSTM)是按顺序处理数据,但 Transformer 直接通过“注意力”机制,一次性看到整个输入序列,并计算每个词之间的关系。
句子:
“The animal didn’t cross the street because it was tired.”
Transformer 能通过 attention 理解:
👉 “it” 指的是 “animal”,而不是 “street”
二、Transformer 的整体结构
1️⃣ Encoder(编码器)
负责理解输入文本
通常由多个相同层叠加
每层包括:
Multi-Head Attention(多头注意力)
Feed Forward(前馈网络)
👉 比如:BERT 使用的就是 Encoder
2️⃣ Decoder(解码器)
用于生成输出(例如翻译、生成文本)
除了 Encoder 的结构,还多了:
Masked Attention(防止“偷看未来”)
👉 比如:GPT 使用的是 Decoder
三、关键组件
✅ 1. Multi-Head Attention
同时从多个“角度”理解句子
每个 head 学习不同关系(语法、语义等)
✅ 2. Positional Encoding(位置编码)
Transformer 本身不按顺序处理数据,所以需要人为加入“位置信息”。
👉 否则模型会分不清:
“猫追狗”
“狗追猫”
✅ 3. Feed Forward Network
每个 token 单独通过一个小神经网络
提升表达能力
Transformer优势
并行计算:Transformer可以充分利用现代计算硬件进行并行计算,大大提高了训练速度。
捕捉长距离依赖:自注意力机制使得每个位置的输入可以与序列中其他位置的所有信息进行交互,这大大增强了模型捕捉长距离依赖的能力。
可扩展性:Transformer架构更容易扩展到更大的模型和更多的数据,也更容易提升模型的表达能力。
灵活性和效果:Transformer不仅能高效地处理长序列,还能够在多种NLP任务中取得良好的效果。无论是机器翻译、文本生成、语义理解,Transformer都能展现出色的性能。
大模型工作的原理
分词:大模型中最基本的处理单元 — Token
一条语句由诸多单词/字(Word)所组成,大模型在进行处理前需要先将语句拆解成一个个的基础单元(token):
中文:“长沙的雨”一[“长沙”,“的”,“雨”](3个 Token)
英文:“Rain in Changsha” 一[“Rain”,“in"“Changsha” ](3 个Token)
句子“长沙明天暴雨,记得带伞”-[“长沙”,“明天”,“暴雨”,“记得”,“带伞”]
大模型的注意力机制
词嵌入 Token转换成词向量
可以想象大模型内部仓库有5万个格子(词表大小)每个格子放一个"词积木",每个积木有512个特征小标签(嵌入维度) 它无法区分一词多义
嵌入是动态的过程,不是静态的
初始嵌入(取仓库里的积木) - > 静态的 - > + 位置信息(站第几个) - > 自注意力修改(开会交流) 动态! - > 前馈网络修改(自我反思) 动态! - > 下一层继续修改..(多层深度交流) - > 最终表示 (完全动态,依赖整个句子)
大模型训练流程
模型训练,通常包括3大阶段:(大型语言模型如DeepSeek、ChatGPT等)
1. 预训练(PreTraining)
让模型学习通用知识,使用海量无标注文本(如书籍、网页、代码等),通过自监督学习训练模型.
2. 监督微调 (Supervised FineTuning, SFT)
这一阶段则是对基座模型进行微调,让模型能够适应特定任务,最终得到一个有偏好的模型
3. 强化学习 (Reinforcement Learning)
这一阶段通过引入人类反馈(或者基于人类反馈训练的奖励模型)进一步优化模型的生成质量,使
其生成的回答更符合用户的期望和人类的价值观
1 本文章标题: GPT和TransFormer架构 大模型工作原理
3 本站文章内容仅供学习、交流与界面验证参考,如有版权或引用问题,请联系站点维护者处理。
4 本站不对文中外部链接、第三方资源或读者据此操作产生的结果承担保证责任。
评论
登录后即可发表评论和回复。