Posts
阅读原文
公式演示:AI 里常见的 LaTeX 数学写法
这是一篇专门用来测试和展示 LaTeX 公式效果的博客。
如果你的博客已经启用了数学渲染,那么下面这些公式应该会被漂亮地渲染出来。
Posts
阅读原文
Self-Attention 里的匹配核是什么?从公式理解注意力打分机制
如果你已经知道 Self-Attention 的核心任务,是在一个序列内部判断“谁和谁更相关”,那么接下来最重要的问题就是:
这种“相关性”到底是怎么计算出来的?
很多人在第一次看到 Attention 公式时,都会把重点放在 softmax、矩阵乘法或者最后的加权求和上。但从建模角度来看,真正决定“谁该被关注”的,是前面那一步匹配函数(matching function),也可以理解为注意力里的某种匹配核(match kernel)。
本文会先从直觉解释匹配核,再用点积、缩放和 softmax 这三个层次,把 Self-Attention 的打分机制拆开。