<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Transformer on Cao Kailun</title>
		<link>https://www.caokailun.xyz/tags/transformer/</link>
		<description>Recent content in Transformer on Cao Kailun</description>
		<generator>Hugo</generator>
		<language>zh-cn</language>
		
		
		
		
			<lastBuildDate>Tue, 09 Jun 2026 02:24:01 +0800</lastBuildDate>
		
			<atom:link href="https://www.caokailun.xyz/tags/transformer/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>Self-Attention 里的匹配核是什么？从公式理解注意力打分机制</title>
				<link>https://www.caokailun.xyz/posts/2026-06-09-the-match-kernel-in-self-attention/</link>
				<pubDate>Tue, 09 Jun 2026 02:24:01 +0800</pubDate>
				<guid>https://www.caokailun.xyz/posts/2026-06-09-the-match-kernel-in-self-attention/</guid>
				<description>&lt;p&gt;如果你已经知道 Self-Attention 的核心任务，是在一个序列内部判断“谁和谁更相关”，那么接下来最重要的问题就是：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;这种“相关性”到底是怎么计算出来的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;很多人在第一次看到 Attention 公式时，都会把重点放在 softmax、矩阵乘法或者最后的加权求和上。但从建模角度来看，真正决定“谁该被关注”的，是前面那一步&lt;strong&gt;匹配函数（matching function）&lt;/strong&gt;，也可以理解为注意力里的某种&lt;strong&gt;匹配核（match kernel）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;本文会先从直觉解释匹配核，再用点积、缩放和 softmax 这三个层次，把 Self-Attention 的打分机制拆开。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>什么是 Transformer 和 Self-Attention 机制？一文读懂其核心原理</title>
				<link>https://www.caokailun.xyz/posts/2026-06-09-what-is-transformer-and-self-attention/</link>
				<pubDate>Tue, 09 Jun 2026 02:17:51 +0800</pubDate>
				<guid>https://www.caokailun.xyz/posts/2026-06-09-what-is-transformer-and-self-attention/</guid>
				<description>&lt;p&gt;如果你最近在关注大模型、ChatGPT、文本生成或者多模态 AI，几乎一定会反复看到两个词：&lt;strong&gt;Transformer&lt;/strong&gt; 和 &lt;strong&gt;Self-Attention&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;很多人第一次接触这两个概念时，常常会觉得它们非常“学术”，像是只有论文研究者才需要理解的内容。但实际上，今天几乎所有主流大模型——无论是聊天、写作、翻译、代码生成，还是图像与文本结合的多模态系统——背后都深深建立在这套机制之上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;如果说大模型是今天 AI 爆发的结果，那么 Transformer 和 Self-Attention，就是支撑这场爆发最重要的底层方法之一。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;本文会先从 Transformer 的整体结构讲起，再把 Self-Attention 机制拆开说明，最后解释它为什么能成为现代大模型的核心基础。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
