为什么我还是无法理解transformer?

2025-06-24 21:10:11

不要想的太过复杂,就只有随机数生成的三个矩阵,原始输入已经通过矩阵相乘关联在三个随机数矩阵中,再通过一些代数游戏得到每个token对于整体输入序列的注意力权重矩阵,再和另外一个随机数矩阵进行线性的代数变化即可。

反向传播更新的是这三个矩阵的权重,三个矩阵的维度设计也是为了符合线性代数的运算。

总之这个就是一个巧妙的线性代数游戏,没有什么复杂的逻辑问题。

为什么我还是无法理解transformer?
广告位810*200
相关阅读
SpaceX 星舰 36 号火箭静态点火测试爆炸,爆炸的原因是什么?会对星舰发展产生什么影响?

SpaceX 星舰 36 号火箭静态点火测试爆炸,爆炸的原因是什么?会对星舰发展产生什么影响?

我的天,真的爆炸了!而且非常严重!似乎是 从储箱顶部接近载荷...

2025-06-20
怎么通俗的解释路由这个词?

怎么通俗的解释路由这个词?

我是一个孤独的车手,我的主人告诉我:“你可以去一个无比广阔的...

2025-06-20
网络小白如何建立一个网站,供别人下载文件(主要是PDF和MP3)?

网络小白如何建立一个网站,供别人下载文件(主要是PDF和MP3)?

Alwaysdata 有免费服务。 100mb空间 装个cl...

2025-06-20
为什么Mac连个正儿八经的CAD都装不了还敢打着生产力的旗号?

为什么Mac连个正儿八经的CAD都装不了还敢打着生产力的旗号?

方方面面的软件,Mac基本全有,但都是猴版,功能被阉割的一塌...

2025-06-20
rust引入所有权的概念之后,真的可以完全解决内存安全的问题吗?

rust引入所有权的概念之后,真的可以完全解决内存安全的问题吗?

前言 作者利用任意地址读写分别改写modprobe_path...

2025-06-20