Tag Archive

# 工程实践

当前标签下展示的是围绕同一主题聚合的公开文章,用于快速回看相关知识点。

Posts

标签文章

返回首页
Slug
engineering-practice
文章数
3
创建时间
2026年7月10日
Self-Attention 本质
2026年7月13日浏览 25AI

Self-Attention 本质

Self-Attention 的本质是让每个 token 根据与上下文中其他 token 的“相关性”动态调整自身向量表示。本文从 QKV 生成、点积相似度计算到 Softmax 加权融合,用具体例子和手算步骤清晰拆解了注意力机制的全流程,帮助读者真正理解 Transformer 为何能实现上下文感知的语义表示。

GPT 如何基于 Transformer 演化
2026年7月10日浏览 7Vue

GPT 如何基于 Transformer 演化

GPT 从原始 Transformer 中只保留了 Decoder,并引入 Mask 机制实现自回归式的“下一个 token 预测”,从而演化为强大的文字续写模型。本文清晰拆解了 GPT 的核心架构、Attention 原理、Causal Mask 的作用,并深入讲解 KV Cache、Flash Attention 等关键推理优化技术,帮助你真正理解 GPT 为什么能“思考”、为什么生成变慢,以及 DeepSeek 为何更便宜。

GPT和TransFormer架构 大模型工作原理
2026年7月9日浏览 14AI

GPT和TransFormer架构 大模型工作原理

这篇文章详细拆解了GPT与Transformer架构的核心原理,从分词、注意力机制到模型训练流程,清晰解释了“生成式预训练”的含义和Transformer如何通过自注意力实现长距离依赖。无论你是AI初学者还是想深入理解大模型工作机制,都能从中获得扎实的知识基础。

第 1 / 1 页 ,共 3 篇

AI Knowledge Blog

记录代码与设计实践

分享开发经验、项目思考与持续成长的过程

站点反馈

如果你在浏览或使用过程中有建议,欢迎告诉我们。