《Attention Is All You Need》 五个单词改写了机器理解世界的方式,今天的大模型时代,起笔于此
文章目录 15 个章节
2017年,几位研究者试图教机器更好地翻译一句话,却无意间改变了后来整个AI世界。
他们发表了一篇名为 《Attention Is All You Need》 的论文。标题只有五个单词,最初研究的也只是一个看似具体的问题:怎样让机器读懂一种语言,再把它翻译成另一种语言。
但论文提出了一个新的想法:
理解一句话,不一定要从前往后,一个词一个词地传递信息。一个词的意义,也不完全藏在它自己身上,而 存在于它与其他词的关系之中 。
在此基础上,一种名为 Transformer 的模型诞生了,成为现在大模型时代最重要的发动机。
一、一句话,不只是许多个词
先看一句中文长句:
那个总会在下课后陪她慢慢走回宿舍、在她说自己怕黑时故意放慢脚步的人,却在昨天晚上她发出“你睡了吗”之后很久都没有回复,于是她忽然开始怀疑,自己是不是把那些温柔理解成了某种并不存在的喜欢。
你当然还是从前往后读完了这句话。
但你的理解,并没有停留在一个个孤立的字上。
当你读到后面时,前面的词语会被重新照亮:
- “他”连接着“陪她回宿舍”和“故意放慢脚步”;
- “没有回复”连接着“你睡了吗”和“她的怀疑”;
- 而最后出现的“误解”,又重新解释了前面所有的温柔。
真正重要的已经不再是某个单独的词,而是这些词之间构成的关系:
谁在靠近谁? 谁在等待谁? 那些温柔究竟意味着什么? 一次没有得到回复的消息,是否足以否定过去发生的一切?
我们能够理解这句话,不只是因为认识里面的每一个字,更因为我们在脑海里迅速建立了一张关系网。
这与 Transformer 的核心思想很像:
语言的意义,不只存在于词本身,更存在词与词之间的关系里。
二、当每个词都开始看向彼此
在 Transformer 出现以前,机器处理句子,常常更像一场按顺序进行的传话游戏。
第一个词先被处理,再把信息传给第二个词;第二个词加入自己的信息,再继续传给第三个词。
这种方式有两个明显的问题。
| 过去的顺序模型 | 问题 |
|---|---|
| 必须等待前一个位置处理完 | 训练速度较慢,难以充分并行 |
| 信息要经过很多次传递 | 句子太长时,开头的信息可能逐渐模糊 |
Transformer 换了一种方式:
让一句话里的每个位置,都能够直接查看其他位置。
例如,在刚才那句话里,要理解“误解”这个词,就不能只看“误解”本身。
它还需要联系:
- “很久都没有回复”
- “你睡了吗”
- “陪她慢慢走回宿舍”
- “怕黑时故意放慢脚步”
- “她忽然开始怀疑”
这些信息共同决定了,“误解”在这里不是普通的认知错误,而是一种关于感情的动摇:她开始重新判断过去那些行为究竟意味着什么。
这就是 Attention,注意力机制 。
这里的“注意力”,并不是说机器拥有了像人一样的意识。
它只是通过数学计算判断:
对于当前这个词来说,句子里的哪些信息与它关系更密切?
关系越密切,获得的权重通常越高;关系越弱,在这一次计算中的影响就越小。
三、顺序仍然重要
不过,让所有词彼此建立联系,并不意味着词语顺序不重要。
看下面两句话:
狗咬人。
人咬狗。
它们使用的是完全相同的三个词,但因为位置不同,意思截然相反。
所以,Transformer 虽然可以同时处理一句话中的许多位置,却不能把它们当作一把被打乱的词语。
它必须知道:
哪个词在前,哪个词在后; 谁靠近谁,谁修饰谁。
为此,Transformer 会给不同位置加入一种额外的信息,叫作 位置编码 。
可以把它理解成给每个词安排座位号:
你是谁很重要; 但你坐在谁的前面、谁的后面,同样重要。
四、注意力如何成为数学
Transformer 会为每个词生成三组不同的信息:
| 名称 | 通俗理解 |
|---|---|
| Query | 我现在想寻找什么? |
| Key | 我具有什么特征,是否与你的问题相关? |
| Value | 如果你注意到我,我能提供什么信息? |
可以把一句话想象成一个房间,每个词都站在其中。
当模型处理某个词时,它会向整个房间提出问题。
例如,“误解”这个词在问:
我为什么会出现在这里? 她误解了什么? 哪些事情改变了她的判断?
这时,“没有回复”“陪她回宿舍”“故意放慢脚步”等信息,会根据当前语境获得不同的注意力权重。
最后,模型把这些信息按照权重重新汇集起来,形成这个词在当前句子中的新表示。
所以,Attention 不是简单地判断:
哪个词最重要?
而是在判断:
在当前语境中,这个词应该怎样被理解?
同一个词放在不同句子里,可以形成不同的意义。
- “苹果发布了新手机”中的“苹果”
- “我买了两个苹果”中的“苹果”
字面完全相同;但它们与周围词语建立的关系不同,于是模型得到的理解也不同。
一个词不再只有词典中固定的解释。
它会被上下文重新定义。
五、为什么 Transformer 如此强大
Transformer 的厉害,不只是“会注意”,而是它能从多个角度、经过许多层次,反复重组同一句话的信息。
多头注意力:从不同角度看同一句话
同一句话,可以同时交给几位不同的读者。
有人可能更关注语法,有人更关注人物指代,有人更容易发现远距离的联系。
机器中的多个注意力头也有些类似。它们没有被研究者提前规定固定工作,但在训练中,常常会形成不同的关注模式。
最后,这些不同角度的信息被汇集起来。
它就不再只知道:
这里有一个“他”,那里有一个“她”。
而可能逐渐理解:
谁陪谁回宿舍,谁发出了消息,谁没有回复,谁又因此改变了对这段关系的判断。
多层堆叠:理解会被反复重写
Transformer 还会把许多层叠加在一起。
每经过一层,一个词的表示都会吸收更多上下文。
它不再只是原来的那个词,而逐渐携带句法、指代、语义以及整句话的信息。
可以把这个过程想象成反复阅读同一句话:
- 第一次读见人物和动作;
- 第二次读见关系和转折;
- 再往后,才慢慢读出那些没有直接写出的情绪。
也正因为这种结构能够不断扩大,研究者可以增加模型参数、训练数据和计算资源,让 Transformer 处理越来越复杂的语言任务。
今天的大语言模型,基本都延续了这一核心思想。
六、机器为什么会产生“幻觉”
然而,问题也恰恰藏在这里。
大语言模型最基础的训练目标,是根据已经出现的上下文,预测接下来最可能出现什么。
例如:
今天下雨了,出门记得带……
接下来很可能是“伞”。
模型就是这样一步步生成内容:
已有内容 → 预测下一个词或词语片段 → 把它加入上下文 → 再预测下一个
就像是:
一边走,一边铺路。
这种能力让它可以写文章、回答问题、编写代码,也可能带来所谓的“幻觉”。
当模型缺少可靠资料时,它仍然可能根据有限线索,继续生成一段听起来非常完整的答案。
这个答案:
- 语言流畅
- 结构完整
- 包含具体的时间、人物和出处
但它未必真实。
幻觉并不是模型在像人一样故意撒谎。
更准确地说,它原本就擅长根据碎片补全连贯的表达;当可靠依据不足时,这种能力也可能把错误的碎片,补成一个完整的故事。
这时候,它只是找到了一个最像答案的答案,而非真相。
七、一个人心里的权重
人与人之间的关系很多时候也是如此。
比如,当我们喜欢一个人时,也会经历一套相似的过程。
你无法直接看见对方心里的想法。
你看到的,只是一些零碎的信号:
- 他回复得慢了一点;
- 今天的回复比往常短了一点;
- 他没有像以前那样主动找你;
- 见面时依然笑了,却又有些敷衍。
这些本来只是几个孤立的细节。
但一旦你在意一个人,它们便会迅速相互连接。
| 在 Transformer 中 | 在感情中 |
|---|---|
| Query | 他到底在不在乎我? |
| Key | 回复速度、语气、主动程度、眼神 |
| Value | 每个行为真正能够提供的信息 |
| 注意力权重 | 你赋予某个细节的重要程度 |
| Context | 你最终形成的判断:他怎样看待我 |
于是,一条迟来的回复、一句稍短的话、一个没有被回应的晚安,被赋予了不同的权重。
它们彼此连接,最后聚合成一句完整的话:
他好像没有那么喜欢我。
或者:
他其实还是很在意我。
问题是,这个上下文可能是真的,也可能只是你根据有限线索补全出的故事。
你的失落是真的。
难过是真的。
心动也是真的。
但你对这一切的解释,未必是真的。
人也拥有许多个“注意力头”。
同样面对一条没有得到回复的消息:
- 理智说,他可能在忙;
- 期待说,他稍后会认真回复;
- 恐惧说,他正在慢慢疏远你;
- 自卑说,我本来就不值得被喜欢;
- 记忆说,他以前不是这样的。
机器的不同注意力头来自训练得到的参数。
人的不同声音,却来自欲望、经验、自尊和伤痕。
最后,它们共同生成了你此刻相信的那个答案。
八、机器可以计算,人只能猜测
机器的注意力,至少会留下可以计算的权重。
尽管这些数字也未必能够完整解释模型的全部判断,但我们仍然可以看到信息在某种程度上是怎样流动的。
人却不会把自己的权重摆在另一个人面前。
你不知道自己在他的内心世界里究竟占了多少。
你只能通过一些零碎的 token 去猜:
- 一句话;
- 一个眼神;
- 一次沉默;
- 一条隔了很久才回复的消息;
- 一个输入了很久,最后却没有发出的对话框。
而爱最令人不安的地方也许就在这里:
不是你完全得不到答案,而是你总能拼出许多个答案。
每一个答案好像都有证据。
- 他曾经陪你走过很长的路,所以他可能喜欢你;
- 他很久没有回复,所以他可能并不在意;
- 他记得你随口提过的小事,所以他或许一直把你放在心里;
- 他从不主动靠近,所以那些温柔也可能只是普通的善意。
同一组行为,可以被解释成完全不同的故事。
就像一个词必须依靠上下文才能确定含义,一个人也只能通过他所有的靠近、退后、言语和沉默,被另一个人慢慢理解。
九、可是,人明明会说话
机器没有嘴。
它只能根据已经存在的上下文预测下一句话,再把预测结果交给我们。
可人不一样。
人有语言,也有机会直接问:
你到底是怎么想的?
既然如此,我们为什么还要不断猜测?
以前看电影时,我也常常不明白:明明一句话就能解释清楚的误会,为什么剧中的人就是不愿意说出口?
后来长大才慢慢懂得,很多事情并不是“说清楚”那么简单。
有些话一旦说出口,关系就再也回不到从前。
说“我喜欢你”,可能得到一个拥抱,也可能失去原本的靠近; 问“你是不是不在乎我了”,可能得到答案,也可能让那个原本模糊的问题,第一次变得无法回避。
自尊常常将爱拖得曲折。 越害怕失去的人,反而越不敢开口确认。
有些人可以向你走九十九步,却不愿走完最后一步。
因为前面的九十九步都还可以被解释成朋友间的关心,最后一步却必须承认:
我希望你也向我走来。
这或许与东亚文化习惯的克制、含蓄和点到为止有关,也可能只是所有成年人逐渐学会的一种默契:
听懂那些没有说出口的话, 又假装自己没有听懂。
机器无法说出未来,因为未来还没有生成。
人却常常不愿说出未来,因为害怕一旦说出,它就真的发生。
十、一次微妙的照面
所以回头再看《Attention Is All You Need》,它最迷人的地方,已经不只是技术上的突破。
它像是在提醒我们:
语言不是孤立的词,而是关系的网络; 误解也不一定来自无知,而是我们太擅长补全意义。
机器是这样。
人也是这样。
这像是人类与硅基之间一次微妙的照面。
十一、第四次思想革命?
说到这里,我似乎开始理解,为什么许多科学家、哲学家和研究者,会如此期待AI的进步。
因为它不只是一种更先进的工具,也不只是一场关于效率的工业革命。
它当然与人类历史的蒸汽、电力和互联网革命相似:都在扩大人类改造世界的能力。但它又有些不同——过去的机器延伸了人的体力、感官和信息传播,而AI第一次如此接近人类最引以为傲的部分:
智能本身。
它甚至可能成为一种近似新物种的智能存在。
现代科学给人类的自尊带来了三次沉重打击。
第一次来自哥白尼。
日心说告诉我们,地球并不是宇宙的中心,人类也没有居住在万物围绕的位置。
第二次来自达尔文。
进化论告诉我们,人类并不是被单独创造出来的特殊生命,而只是漫长演化树上的一个分支。
第三次来自弗洛伊德。
潜意识理论告诉我们,人甚至不是自己内心绝对的主人。许多选择、欲望和恐惧,早在意识察觉以前,便已经悄然发生。
而AI或许会带来第四次冲击:
智能并不只属于人类,意识与智能也未必是同一件事。
一种存在可能拥有极高的智能,却没有任何主观感受;
一种生物可能智能并不发达,却依然能够感受疼痛与世界;
未来也可能出现某种既拥有强大智能,又具有某种意识的非人存在。
AI已经迫使一些沉睡了几千年的问题,从哲学家的书桌走进实验室和工程现场:
意识究竟是什么? 它从哪里产生? 又需要什么,才会出现?
如果你现在还不到50岁,那么在有生之年,大概率就能见证这些问题出现决定性的证据。
到了那时,我们也许会发现,意识并不是某种被放进肉体中的神秘火焰,而是物质世界在形成足够复杂的结构之后,自然涌现出来的现象。
这不能够证明上帝或造物主是否存在,却会动摇一种古老的想象:
人类拥有一种独立于物质世界、只属于自己的神圣内核。
随着AI不断接近智能的边界,我们或许会像过去理解天体、生命和潜意识那样,一点点逼近意识本身。
这也许才是AI真正令科学家、哲学家和研究者着迷的地方。
它不仅是一种强大的生产力,也不仅会替我们写作、计算和创造。它正在成为人类重新认识自己、认识自然、认识宇宙的一面镜子。
过去三次思想革命,分别把人类从宇宙的中心、生命的顶端和心灵的王座上请了下来。
第四次呢?
它或许会让人类失去最后一种独占的骄傲:智能。
AI最终改变的,不只是世界如何运转,还有人类如何重新理解自己的存在。
参考文献
[1] VASWANI A, SHAZEER N, PARMAR N, et al. Attention Is All You Need[C]//Advances in Neural Information Processing Systems 30. 2017: 5998–6008.
论文中文译名:《注意力就是你所需要的一切》
论文作者:Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan N. Gomez、Łukasz Kaiser、Illia Polosukhin
发表时间:2017年
发表会议:第31届神经信息处理系统大会(NeurIPS 2017,当时称NIPS)
论文内容简介:
这篇论文最初研究的是机器翻译。作者提出了一种名为Transformer的新模型,放弃了此前常用的循环神经网络结构,主要依靠注意力机制处理语言。
它让句子中的每个位置都能直接参考其他位置,并根据相关程度分配不同权重,从而更好地理解词语之间的关系。Transformer更适合并行训练,也更容易扩展到更大的数据和模型规模。今天的大语言模型,包括GPT、Claude、Gemini等,其核心架构都与这篇论文提出的Transformer密切相关。
原文地址:
- arXiv论文页面:查看摘要、作者和版本记录(https://arxiv.org/abs/1706.03762)
- 直接阅读或下载PDF原文(https://arxiv.org/pdf/1706.03762)
- NeurIPS官方收录页面(https://proceedings.neurips.cc/paper_files/paper/2017/hash/3f5ee243547dee91fbd053c1c4a845aa-Abstract.html)
- Google Scholar:查看实时引用量(https://scholar.google.com/scholar_lookup?arxiv_id=1706.03762)
其中,arXiv页面最适合普通读者查看和下载;NeurIPS页面是正式会议收录版本;Google Scholar可以查看这篇论文最新的被引用次数。