GPT 如何基于 Transformer 演化
GPT 从原始 Transformer 中只保留了 Decoder,并引入 Mask 机制实现自回归式的“下一个 token 预测”,从而演化为强大的文字续写模型。本文清晰拆解了 GPT 的核心架构、Attention 原理、Causal Mask 的作用,并深入讲解 KV Cache、Flash Attention 等关键推理优化技术,帮助你真正理解 GPT 为什么能“思考”、为什么生成变慢,以及 DeepSeek 为何更便宜。
Tag Archive
当前标签下展示的是围绕同一主题聚合的公开文章,用于快速回看相关知识点。