🔍 搜索帖子 / 资讯 / 芯片型号…
论坛/开源蜂鸟E203/嵌入式开发之transformer神经网络注意力机制的讲解
嵌入式开发之transformer神经网络注意力机制的讲解
开源蜂鸟E203 作者 CICC2259刘宇轩 发布于 2023-05-31 23:50(1227 天前) 13011 浏览

队伍CICC2259 从容应队

刘宇轩 周嘉琪 冷思远

而transformer模块核心为多头注意力机制,即 Multi-Head Attention,其是由多个注意力机制Attention 组合而成。

Attention 机制实质上就是一个寻址过程,通过给定一个任务相关的查询 Query 向量 Q,通过计算与 Key 的注意力分布并附加在 Value 上,从而计算 Attention Value,这个过程实际上是 Attention 缓解神经网络复杂度的体现,不需要将所有的N个输入都输入到神经网络进行计算,而是选择一些与任务相关的信息输入神经网络,注意力机制的运算示意图如下图所示:

                                                                                                   

其中QKV的生成过程是通过三个线性层完成的,其中WQ,WK和WV是通过神经网络训练得到的权重矩阵

                                        

假设我们使用的是头数为2(Head=2)的多头注意力机制,通过将传入transformer模块的输入矩阵分割成两组数据分别进行attention运算,并将其运算结果进行拼接后输出,得到最终结果相关运算示意图如下图所示

                                                                                                                        

我们还可以在注意力机制部分后面增加线性层以及激活层,还可以增加全连接前馈神经网络,以增加神经网络的复杂程度,提高拟合效果





全部回复 24
M
Mrpp1127 天前 · 16 楼

学习一下


L
LXQRISC-V1129 天前 · 17 楼

1

k
knnkkn1133 天前 · 18 楼

1


z
zzyt1183 天前 · 19 楼

1

h
hello-coded1183 天前 · 20 楼

`

t
tim1111184 天前 · 21 楼

1

_
_G_X_1212 天前 · 22 楼

学习一下

李
李昌昱1226 天前 · 23 楼

1

k
kem-lb1226 天前 · 24 楼

1

💡 请 登录 后参与讨论(微信扫码即登录/注册)