一文彻底搞懂深度学习：注意力机制（Attention Mechanism）

在深度学习中，注意力机制模仿了人类在处理信息时的选择性关注能力，允许模型在处理输入数据时动态地调整其注意力权重，从而突出重要信息并忽略不重要的信息。注意力机制通过计算查询向量（Query）、键向量（Key）之间的相似度来确定注意力权重，然后对值向量（Value）进行加权求和，得到最终的输出。

网络安全学习库

2413人浏览 · 2025-04-26 20:59:53

网络安全学习库 · 2025-04-26 20:59:53 发布

在深度学习中，注意力机制模仿了人类在处理信息时的选择性关注能力，允许模型在处理输入数据时动态地调整其注意力权重，从而突出重要信息并忽略不重要的信息。

注意力机制通过计算查询向量（Query）、键向量（Key）之间的相似度来确定注意力权重，然后对值向量（Value）进行加权求和，得到最终的输出。

一、注意力机制

1、什么是注意力机制（Attention Mechanism）？

注意力机制是一种允许模型在处理信息时专注于关键部分，忽略不相关信息，从而提高处理效率和准确性的机制。它模仿了人类视觉处理信息时选择性关注的特点。

当人类的视觉机制识别一个场景时，通常不会全面扫描整个场景，而是根据兴趣或需求集中关注特定的部分，如在这张图中，我们首先会注意到动物的脸部，正如注意力图所示，颜色更深的区域通常是我们最先注意到的部分，从而初步判断这可能是一只狼。

2、注意力机制解决了什么问题？

在传统的序列处理模型中，如循环神经网络（RNN）和长短时记忆网络（LSTM），捕捉长距离依赖关系是一个难题。因为随着序列长度的增加，模型很容易丢失早期输入的信息。

注意力机制允许模型在序列的不同位置之间建立直接联系，无论这些位置相距多远，都能够有效地捕捉到它们之间的依赖关系。

二、注意力分数

1、注意力分数是什么？

注意力分数用来量化注意力机制中某一部分信息被关注的程度，反映了信息在注意力机制中的重要性。在注意力机制中，模型会根据注意力分数来决定对不同输入信息的关注程度。

在这里插入图片描述

2、如何计算注意力分数？

在注意力机制中，Q（Query）、K（Key）、V（Value）通过映射矩阵得到相应的向量，通过计算Q与K的点积相似度并经过softmax归一化得到权重，最后使用这些权重对V进行加权求和得到输出。

3、Q、K、V计算过程是什么？

对于输入序列的每个单词，通过计算其Query与所有单词Key的点积得到注意力分数，经Softmax归一化后得到注意力权重，再用这些权重对Value向量进行加权求和，以得到包含丰富上下文信息的新单词表示。

生成Q、K、V向量：对于输入序列中的每个单词，都会生成对应的Query（查询）、Key（键）和Value（值）向量。这些向量通常是通过将单词的嵌入向量（Embedding Vector）输入到一个线性变换层得到的。
计算Q、K的点积（注意力分数）：计算Query向量与序列中所有单词的Key向量之间的点积，得到一个分数。这个分数反映了Query向量与每个Key向量之间的相似度，即每个单词与当前位置单词的关联程度。
Softmax函数归一化（注意力权重）：这些分数会经过一个Softmax函数进行归一化，得到每个单词的注意力权重。这些权重表示了在理解当前单词时，应该给予序列中其他单词多大的关注。
注意力权重加权求和（加权和向量）：这些注意力权重与对应的Value向量进行加权求和，得到一个加权和向量。这个加权和向量会被用作当前单词的新表示，包含了更丰富的上下文信息。

一、大模型风口已至：月薪30K+的AI岗正在批量诞生

2025年大模型应用呈现爆发式增长，根据工信部最新数据：

国内大模型相关岗位缺口达47万

初级工程师平均薪资28K（数据来源：BOSS直聘报告）

70%企业存在"能用模型不会调优"的痛点

真实案例：某二本机械专业学员，通过4个月系统学习，成功拿到某AI医疗公司大模型优化岗offer，薪资直接翻3倍！

在这里插入图片描述

如何学习AI大模型？

“最先掌握AI的人，将会比较晚掌握AI的人有竞争优势”。

这句话，放在计算机、互联网、移动互联网的开局时期，都是一样的道理。

相信大家在刚刚开始学习的过程中总会有写摸不着方向，故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程等免费分享出来。

如果你是零基础小白，想快速入门大模型是可以考虑的。

一方面是学习时间相对较短，学习内容更全面更集中。

二方面是可以根据这些资料规划好学习计划和方向。

😝有需要的小伙伴，可以微信扫码领取！

在这里插入图片描述

大模型星球

👉1.大模型入门学习思维导图👈

要学习一门新的技术，作为新手一定要先有一个明确的学习路线，方向不对，努力白费。

对于从来没有接触过AI大模型的同学，我们帮你准备了详细的学习路线图。可以说是最科学最系统的学习路线，大家跟着这个大的方向学习准没问题。（完整路线在公众号内领取）

在这里插入图片描述

大模型学习路线

👉2.大模型配套视频👈

很多朋友都不喜欢晦涩的文字，我也为大家准备了视频教程，每个章节都是当前板块的精华浓缩。(篇幅有限，仅展示部分）

👉3.大模型经典学习电子书👈

随着人工智能技术的飞速发展，AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型，如GPT-3、BERT、XLNet等，以其强大的语言理解和生成能力，正在改变我们对人工智能的认识。那以下这些PDF籍就是非常不错的学习资源。（篇幅有限，仅展示部分，公众号内领取）

电子书

👉4.大模型面试题&答案👈

截至目前大模型已经超过200个，在大模型纵横的时代，不仅大模型技术越来越卷，就连大模型相关的岗位和面试也开始越来越卷了。为了让大家更容易上车大模型算法赛道，我总结了大模型常考的面试题。（篇幅有限，仅展示部分，公众号内领取）

大模型面试

**因篇幅有限，仅展示部分资料，需要的扫描下方二维码领取 **

在这里插入图片描述

技术共进，成长同行——讯飞AI开发者社区

更多推荐

[深度学习]卷积神经网络

本实验基于Python和PyTorch框架比较了LeNet、AlexNet、VGG和ResNet四种经典CNN模型在FashionMNIST数据集上的表现，并重点研究了超参数调整对模型性能的影响。实验结果表明：1）对于所有模型，SGD优化器普遍比Adam表现更好；2）学习率在0.05左右时模型性能最佳；3）增加训练轮数可以提高准确率但会延长训练时间；4）批量大小对模型性能影响相对较小。此外，通过简

讯飞AI开发者社区

华为云Flexus+DeepSeek征文｜基于华为云Flexus云服务的Dify一键部署

讯飞AI开发者社区

基于嵌入式系统的智能宠物行为模式预测模型

这种设计使系统在持续运行72小时后仍保持98%的在线率（Table 1）。数据采集系统整合了六类传感器网络：运动传感器（加速度计+陀螺仪）、环境传感器（温湿度+光照）、生物传感器（心率+皮肤电）、视觉传感器（RGB摄像头）、音频传感器（麦克风阵列）和定位传感器（GPS+蓝牙信标）（Figure 1）。数据预处理采用三级流水线：原始数据经过滑动窗口截断（窗口长度5s）、小波变换去噪（db6小波基）和