Self-Attention 本质
Self-Attention 的本质是让每个 token 根据与上下文中其他 token 的“相关性”动态调整自身向量表示。本文从 QKV 生成、点积相似度计算到 Softmax 加权融合,用具体例子和手算步骤清晰拆解了注意力机制的全流程,帮助读者真正理解 Transformer 为何能实现上下文感知的语义表示。
YANG FAN'S DIGITAL GARDEN
代码持续进化,
灵感永不停歇。
专注于阅读、思考与记录,分享工程实践、技术洞见与成长路径。每一次提交,都是向更好自己的靠近。










Latest Posts
当前展示后端公开接口返回内容。
Self-Attention 的本质是让每个 token 根据与上下文中其他 token 的“相关性”动态调整自身向量表示。本文从 QKV 生成、点积相似度计算到 Softmax 加权融合,用具体例子和手算步骤清晰拆解了注意力机制的全流程,帮助读者真正理解 Transformer 为何能实现上下文感知的语义表示。
LCEL链 LCEL也被称为LangChain表达式(LangChain Expression Language),是一种用声 明式的方法来链接LangChain组件。 所有可以被链起来的组件,如大语言模型、输出解析器、检索器、提示词模板一...
模型包装器(Model I/O) 主要包含三部分:提示词,调用模型,输出解析(Parse) Model I/O之模型包装器 LangChain 提供通用接口调用不同类型的语言模型,这个通用接口被称为模型包装器。LangChain支持的模型有...
GPT 从原始 Transformer 中只保留了 Decoder,并引入 Mask 机制实现自回归式的“下一个 token 预测”,从而演化为强大的文字续写模型。本文清晰拆解了 GPT 的核心架构、Attention 原理、Causal Mask 的作用,并深入讲解 KV Cache、Flash Attention 等关键推理优化技术,帮助你真正理解 GPT 为什么能“思考”、为什么生成变慢,以及 DeepSeek 为何更便宜。
这篇文章通俗讲解提示词工程的核心概念、构建原则与典型构成要素,并系统介绍零样本、少样本、思维链等调优技巧及Prompt攻击与防范方法。无论你是AI初学者还是进阶用户,都能从中掌握与大模型高效沟通的实用方法。
Transformer架构解析 分词 位置编码 自注意力机制 注意力机制(Attention Mechanisnt)是深度学习中的一种重要技术,它允许模型在处理信息时聚焦于最重要的部分,同时忽略那些不太相关的信息。这种机制模仿了人类在处理信...
这篇文章详细拆解了GPT与Transformer架构的核心原理,从分词、注意力机制到模型训练流程,清晰解释了“生成式预训练”的含义和Transformer如何通过自注意力实现长距离依赖。无论你是AI初学者还是想深入理解大模型工作机制,都能从中获得扎实的知识基础。
第 1 / 1 页 ,共 9 篇
Featured Feedback
把真正有价值的用户反馈公开展示出来,帮助后续读者快速感知内容质量与站点体验
测试
测试用户视角下,这篇文章对 Transformer 的核心概念解释得比较清楚,适合入门,但图文密度较高、外链图片混入正文,阅读节奏略受影响。测试用户视角下,这篇文章对 Transfor...
你好
测试用户视角下,这篇文章对 Transformer 的核心概念解释得比较清楚,适合入门,但图文密度较高、外链图片混入正文,阅读节奏略受影响。
评论、登录和反馈链路是通的,但当前搜索按钮仍像占位入口,部分文章正文里存在第三方图片链接,功能完成度还有继续收口的空间。