← 返回文章

《Attention Is All You Need》 五个单词改写了机器理解世界的方式,今天的大模型时代,起笔于此

文章目录 15 个章节

2017年,几位研究者试图教机器更好地翻译一句话,却无意间改变了后来整个AI世界。

他们发表了一篇名为 《Attention Is All You Need》 的论文。标题只有五个单词,最初研究的也只是一个看似具体的问题:怎样让机器读懂一种语言,再把它翻译成另一种语言。

但论文提出了一个新的想法:

理解一句话,不一定要从前往后,一个词一个词地传递信息。一个词的意义,也不完全藏在它自己身上,而 存在于它与其他词的关系之中 。

在此基础上,一种名为 Transformer 的模型诞生了,成为现在大模型时代最重要的发动机。


一、一句话,不只是许多个词

先看一句中文长句:

那个总会在下课后陪她慢慢走回宿舍、在她说自己怕黑时故意放慢脚步的人,却在昨天晚上她发出“你睡了吗”之后很久都没有回复,于是她忽然开始怀疑,自己是不是把那些温柔理解成了某种并不存在的喜欢。

你当然还是从前往后读完了这句话。

但你的理解,并没有停留在一个个孤立的字上。

当你读到后面时,前面的词语会被重新照亮:

  • “他”连接着“陪她回宿舍”和“故意放慢脚步”;
  • “没有回复”连接着“你睡了吗”和“她的怀疑”;
  • 而最后出现的“误解”,又重新解释了前面所有的温柔。

真正重要的已经不再是某个单独的词,而是这些词之间构成的关系:

谁在靠近谁? 谁在等待谁? 那些温柔究竟意味着什么? 一次没有得到回复的消息,是否足以否定过去发生的一切?

我们能够理解这句话,不只是因为认识里面的每一个字,更因为我们在脑海里迅速建立了一张关系网。

这与 Transformer 的核心思想很像:

语言的意义,不只存在于词本身,更存在词与词之间的关系里。


二、当每个词都开始看向彼此

在 Transformer 出现以前,机器处理句子,常常更像一场按顺序进行的传话游戏。

第一个词先被处理,再把信息传给第二个词;第二个词加入自己的信息,再继续传给第三个词。

这种方式有两个明显的问题。

过去的顺序模型 问题
必须等待前一个位置处理完训练速度较慢,难以充分并行
信息要经过很多次传递句子太长时,开头的信息可能逐渐模糊

Transformer 换了一种方式:

让一句话里的每个位置,都能够直接查看其他位置。

例如,在刚才那句话里,要理解“误解”这个词,就不能只看“误解”本身。

它还需要联系:

  • “很久都没有回复”
  • “你睡了吗”
  • “陪她慢慢走回宿舍”
  • “怕黑时故意放慢脚步”
  • “她忽然开始怀疑”

这些信息共同决定了,“误解”在这里不是普通的认知错误,而是一种关于感情的动摇:她开始重新判断过去那些行为究竟意味着什么。

这就是 Attention,注意力机制 。

这里的“注意力”,并不是说机器拥有了像人一样的意识。

它只是通过数学计算判断:

对于当前这个词来说,句子里的哪些信息与它关系更密切?

关系越密切,获得的权重通常越高;关系越弱,在这一次计算中的影响就越小。


三、顺序仍然重要

不过,让所有词彼此建立联系,并不意味着词语顺序不重要。

看下面两句话:

狗咬人。

人咬狗。

它们使用的是完全相同的三个词,但因为位置不同,意思截然相反。

所以,Transformer 虽然可以同时处理一句话中的许多位置,却不能把它们当作一把被打乱的词语。

它必须知道:

哪个词在前,哪个词在后; 谁靠近谁,谁修饰谁。

为此,Transformer 会给不同位置加入一种额外的信息,叫作 位置编码 。

可以把它理解成给每个词安排座位号:

你是谁很重要; 但你坐在谁的前面、谁的后面,同样重要。


四、注意力如何成为数学

Transformer 会为每个词生成三组不同的信息:

名称 通俗理解
Query 我现在想寻找什么?
Key 我具有什么特征,是否与你的问题相关?
Value 如果你注意到我,我能提供什么信息?

可以把一句话想象成一个房间,每个词都站在其中。

当模型处理某个词时,它会向整个房间提出问题。

例如,“误解”这个词在问:

我为什么会出现在这里? 她误解了什么? 哪些事情改变了她的判断?

这时,“没有回复”“陪她回宿舍”“故意放慢脚步”等信息,会根据当前语境获得不同的注意力权重。

最后,模型把这些信息按照权重重新汇集起来,形成这个词在当前句子中的新表示。

所以,Attention 不是简单地判断:

哪个词最重要?

而是在判断:

在当前语境中,这个词应该怎样被理解?

同一个词放在不同句子里,可以形成不同的意义。

  • “苹果发布了新手机”中的“苹果”
  • “我买了两个苹果”中的“苹果”

字面完全相同;但它们与周围词语建立的关系不同,于是模型得到的理解也不同。

一个词不再只有词典中固定的解释。

它会被上下文重新定义。


五、为什么 Transformer 如此强大

Transformer 的厉害,不只是“会注意”,而是它能从多个角度、经过许多层次,反复重组同一句话的信息。

多头注意力:从不同角度看同一句话

同一句话,可以同时交给几位不同的读者。

有人可能更关注语法,有人更关注人物指代,有人更容易发现远距离的联系。

机器中的多个注意力头也有些类似。它们没有被研究者提前规定固定工作,但在训练中,常常会形成不同的关注模式。

最后,这些不同角度的信息被汇集起来。

它就不再只知道:

这里有一个“他”,那里有一个“她”。

而可能逐渐理解:

谁陪谁回宿舍,谁发出了消息,谁没有回复,谁又因此改变了对这段关系的判断。

多层堆叠:理解会被反复重写

Transformer 还会把许多层叠加在一起。

每经过一层,一个词的表示都会吸收更多上下文。

它不再只是原来的那个词,而逐渐携带句法、指代、语义以及整句话的信息。

可以把这个过程想象成反复阅读同一句话:

  • 第一次读见人物和动作;
  • 第二次读见关系和转折;
  • 再往后,才慢慢读出那些没有直接写出的情绪。

也正因为这种结构能够不断扩大,研究者可以增加模型参数、训练数据和计算资源,让 Transformer 处理越来越复杂的语言任务。

今天的大语言模型,基本都延续了这一核心思想。


六、机器为什么会产生“幻觉”

然而,问题也恰恰藏在这里。

大语言模型最基础的训练目标,是根据已经出现的上下文,预测接下来最可能出现什么。

例如:

今天下雨了,出门记得带……

接下来很可能是“伞”。

模型就是这样一步步生成内容:

已有内容 → 预测下一个词或词语片段 → 把它加入上下文 → 再预测下一个

就像是:

一边走,一边铺路。

这种能力让它可以写文章、回答问题、编写代码,也可能带来所谓的“幻觉”。

当模型缺少可靠资料时,它仍然可能根据有限线索,继续生成一段听起来非常完整的答案。

这个答案:

  • 语言流畅
  • 结构完整
  • 包含具体的时间、人物和出处

但它未必真实。

幻觉并不是模型在像人一样故意撒谎。

更准确地说,它原本就擅长根据碎片补全连贯的表达;当可靠依据不足时,这种能力也可能把错误的碎片,补成一个完整的故事。

这时候,它只是找到了一个最像答案的答案,而非真相。


七、一个人心里的权重

人与人之间的关系很多时候也是如此。

比如,当我们喜欢一个人时,也会经历一套相似的过程。

你无法直接看见对方心里的想法。

你看到的,只是一些零碎的信号:

  • 他回复得慢了一点;
  • 今天的回复比往常短了一点;
  • 他没有像以前那样主动找你;
  • 见面时依然笑了,却又有些敷衍。

这些本来只是几个孤立的细节。

但一旦你在意一个人,它们便会迅速相互连接。

在 Transformer 中 在感情中
Query他到底在不在乎我?
Key回复速度、语气、主动程度、眼神
Value每个行为真正能够提供的信息
注意力权重你赋予某个细节的重要程度
Context你最终形成的判断:他怎样看待我

于是,一条迟来的回复、一句稍短的话、一个没有被回应的晚安,被赋予了不同的权重。

它们彼此连接,最后聚合成一句完整的话:

他好像没有那么喜欢我。

或者:

他其实还是很在意我。

问题是,这个上下文可能是真的,也可能只是你根据有限线索补全出的故事。

你的失落是真的。

难过是真的。

心动也是真的。

但你对这一切的解释,未必是真的。

人也拥有许多个“注意力头”。

同样面对一条没有得到回复的消息:

  • 理智说,他可能在忙;
  • 期待说,他稍后会认真回复;
  • 恐惧说,他正在慢慢疏远你;
  • 自卑说,我本来就不值得被喜欢;
  • 记忆说,他以前不是这样的。

机器的不同注意力头来自训练得到的参数。

人的不同声音,却来自欲望、经验、自尊和伤痕。

最后,它们共同生成了你此刻相信的那个答案。


八、机器可以计算,人只能猜测

机器的注意力,至少会留下可以计算的权重。

尽管这些数字也未必能够完整解释模型的全部判断,但我们仍然可以看到信息在某种程度上是怎样流动的。

人却不会把自己的权重摆在另一个人面前。

你不知道自己在他的内心世界里究竟占了多少。

你只能通过一些零碎的 token 去猜:

  • 一句话;
  • 一个眼神;
  • 一次沉默;
  • 一条隔了很久才回复的消息;
  • 一个输入了很久,最后却没有发出的对话框。

而爱最令人不安的地方也许就在这里:

不是你完全得不到答案,而是你总能拼出许多个答案。

每一个答案好像都有证据。

  • 他曾经陪你走过很长的路,所以他可能喜欢你;
  • 他很久没有回复,所以他可能并不在意;
  • 他记得你随口提过的小事,所以他或许一直把你放在心里;
  • 他从不主动靠近,所以那些温柔也可能只是普通的善意。

同一组行为,可以被解释成完全不同的故事。

就像一个词必须依靠上下文才能确定含义,一个人也只能通过他所有的靠近、退后、言语和沉默,被另一个人慢慢理解。


九、可是,人明明会说话

机器没有嘴。

它只能根据已经存在的上下文预测下一句话,再把预测结果交给我们。

可人不一样。

人有语言,也有机会直接问:

你到底是怎么想的?

既然如此,我们为什么还要不断猜测?

以前看电影时,我也常常不明白:明明一句话就能解释清楚的误会,为什么剧中的人就是不愿意说出口?

后来长大才慢慢懂得,很多事情并不是“说清楚”那么简单。

有些话一旦说出口,关系就再也回不到从前。

说“我喜欢你”,可能得到一个拥抱,也可能失去原本的靠近; 问“你是不是不在乎我了”,可能得到答案,也可能让那个原本模糊的问题,第一次变得无法回避。

自尊常常将爱拖得曲折。 越害怕失去的人,反而越不敢开口确认。

有些人可以向你走九十九步,却不愿走完最后一步。

因为前面的九十九步都还可以被解释成朋友间的关心,最后一步却必须承认:

我希望你也向我走来。

这或许与东亚文化习惯的克制、含蓄和点到为止有关,也可能只是所有成年人逐渐学会的一种默契:

听懂那些没有说出口的话, 又假装自己没有听懂。

机器无法说出未来,因为未来还没有生成。

人却常常不愿说出未来,因为害怕一旦说出,它就真的发生。


十、一次微妙的照面

所以回头再看《Attention Is All You Need》,它最迷人的地方,已经不只是技术上的突破。

它像是在提醒我们:

语言不是孤立的词,而是关系的网络; 误解也不一定来自无知,而是我们太擅长补全意义。

机器是这样。

人也是这样。

这像是人类与硅基之间一次微妙的照面。


十一、第四次思想革命?

说到这里,我似乎开始理解,为什么许多科学家、哲学家和研究者,会如此期待AI的进步。

因为它不只是一种更先进的工具,也不只是一场关于效率的工业革命。

它当然与人类历史的蒸汽、电力和互联网革命相似:都在扩大人类改造世界的能力。但它又有些不同——过去的机器延伸了人的体力、感官和信息传播,而AI第一次如此接近人类最引以为傲的部分:

智能本身。

它甚至可能成为一种近似新物种的智能存在。

现代科学给人类的自尊带来了三次沉重打击。

第一次来自哥白尼。

日心说告诉我们,地球并不是宇宙的中心,人类也没有居住在万物围绕的位置。

第二次来自达尔文。

进化论告诉我们,人类并不是被单独创造出来的特殊生命,而只是漫长演化树上的一个分支。

第三次来自弗洛伊德。

潜意识理论告诉我们,人甚至不是自己内心绝对的主人。许多选择、欲望和恐惧,早在意识察觉以前,便已经悄然发生。

而AI或许会带来第四次冲击:

智能并不只属于人类,意识与智能也未必是同一件事。

一种存在可能拥有极高的智能,却没有任何主观感受;

一种生物可能智能并不发达,却依然能够感受疼痛与世界;

未来也可能出现某种既拥有强大智能,又具有某种意识的非人存在。

AI已经迫使一些沉睡了几千年的问题,从哲学家的书桌走进实验室和工程现场:

意识究竟是什么? 它从哪里产生? 又需要什么,才会出现?

如果你现在还不到50岁,那么在有生之年,大概率就能见证这些问题出现决定性的证据。

到了那时,我们也许会发现,意识并不是某种被放进肉体中的神秘火焰,而是物质世界在形成足够复杂的结构之后,自然涌现出来的现象。

这不能够证明上帝或造物主是否存在,却会动摇一种古老的想象:

人类拥有一种独立于物质世界、只属于自己的神圣内核。

随着AI不断接近智能的边界,我们或许会像过去理解天体、生命和潜意识那样,一点点逼近意识本身。

这也许才是AI真正令科学家、哲学家和研究者着迷的地方。

它不仅是一种强大的生产力,也不仅会替我们写作、计算和创造。它正在成为人类重新认识自己、认识自然、认识宇宙的一面镜子。

过去三次思想革命,分别把人类从宇宙的中心、生命的顶端和心灵的王座上请了下来。

第四次呢?

它或许会让人类失去最后一种独占的骄傲:智能。

AI最终改变的,不只是世界如何运转,还有人类如何重新理解自己的存在。

参考文献

[1] VASWANI A, SHAZEER N, PARMAR N, et al. Attention Is All You Need[C]//Advances in Neural Information Processing Systems 30. 2017: 5998–6008.

论文中文译名:《注意力就是你所需要的一切》

论文作者:Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan N. Gomez、Łukasz Kaiser、Illia Polosukhin

发表时间:2017年

发表会议:第31届神经信息处理系统大会(NeurIPS 2017,当时称NIPS)

论文内容简介:

这篇论文最初研究的是机器翻译。作者提出了一种名为Transformer的新模型,放弃了此前常用的循环神经网络结构,主要依靠注意力机制处理语言。

它让句子中的每个位置都能直接参考其他位置,并根据相关程度分配不同权重,从而更好地理解词语之间的关系。Transformer更适合并行训练,也更容易扩展到更大的数据和模型规模。今天的大语言模型,包括GPT、Claude、Gemini等,其核心架构都与这篇论文提出的Transformer密切相关。

原文地址:

其中,arXiv页面最适合普通读者查看和下载;NeurIPS页面是正式会议收录版本;Google Scholar可以查看这篇论文最新的被引用次数。