
Transformer 탄생 전야: 구글 8 명의 연구자는 왜 감히 순환 신경망을 완전히 버렸는가?
저자:Robonaissance
번역:TechFlow
TechFlow 편집자 주:2017 년 이전까지 모든 사람은 순환 신경망이 기계 번역에 필수적이며 어텐션 메커니즘은 보조 도구일 뿐이라고 믿었습니다. 구글의 연구자 8 명은 과감한 아이디어에賭했습니다. 지팡이를 버리고 어텐션만 남기자고요. 이 도박의 이론적 근거는 사실 1890 년 윌리엄 제임스가《심리학의 원리》에서 쓴 한 문장이었습니다.
1985 년,Jeffrey Moran 과 Robert Desimone 는 미세 전극을 원숭이의 시각 피질에 삽입한 후 기다렸습니다.
이 원숭이는 단순하면서도 이상한 일을 하도록 훈련받았습니다. 단일 뉴런의 수용 영역 내에 두 개의 자극물이 나타납니다. 하나는 동물이 주의를 기울이도록 유도된 위치에, 다른 하나는 무시하도록指示된 위치에 있습니다. 이 세포는 둘 다 볼 수 있습니다. 문제는 이 세포가 신경 쓰는지 여부입니다.
세포는 매우 신경 썼습니다. 원숭이가 두 자극물 중 하나에 주의를 기울일 때,V4 영역의 뉴런 반응은 마치 다른 자극물이 존재하지 않는 것과 거의 같았습니다. 주의하지 않은 물체에 대한 반응은 저자의 말에 따르면 현저히 감소했습니다. 이전 단계의 striate 피질 세포에서는 이러한 현상이 전혀 나타나지 않았습니다. 어텐션은 동물이 무엇을 생각하는지에 대한 은유가 아닙니다. 그것은 단일 세포에서 측정 가능한 사건이며 그 메커니즘은 뺄셈입니다. 뇌는 중요한 것을 증폭시키는 것이 아닙니다. 다른 모든 것을 억제하고 있습니다.
95 년 전, 미세 전극도 원숭이도 없었지만 윌리엄 제임스는 같은 순서로 같은 말을 했습니다.《심리학의 원리》11 장에서 그는 누구나 어텐션이 무엇인지 안다고 쓴 후 정의를 내렸습니다. 마음이 여러 동시 가능한 대상 중 하나를 점유하는 것. 그리고 가장 중요한 문장이 이어집니다. 제임스는 어텐션이란 다른事物을 효과적으로 처리하기 위해 어떤事物에서 철수하는 것이라고 썼습니다.
철수. 증폭이 아닙니다. 이 분야 가장 오래된 정의와 최초의 단일 세포 기록은 어텐션이란 당신이 빼는 것이라고 일치시킵니다.
이 아이디어를 기억하십시오. 약 2 천 자 후에 다른 기호를 입고 돌아올 것입니다.
모두가 동의한 대가
2016 년까지 기계 번역은 고정되었습니다. 문장을 가져와 순환 신경망을 통해 단어마다 실행하고 지금까지 본 모든 것을 담는 은닉 상태를 축적한 후 그 상태를 사용해 반대쪽에서 단어마다 번역을 생성했습니다. 주류 변형은 LSTM 과 게이트 순환 유닛이었습니다. 효과적이었습니다. 구글은 이미 이를 프로덕션에 투입했습니다.
이 아키텍처에는 분야 내에서 끊임없이 논의되었지만 더 이상 문제로 여기지 않는 특성이 있었습니다. 순환 모델은 위치 t 의 은닉 상태를 위치 t-1 의 은닉 상태의 함수로 계산합니다. 이는 구현 세부사항이 아닙니다. 정의입니다. 위치 5 는 위치 4 가 존재해야 계산할 수 있고 위치 4 는 위치 3 을 기다려야 합니다.
Transformer 논문 자체의 서론 부분은 당연히 겸손해야 할 장임에도 불구하고 이례적으로 직설적으로 결과를 진술합니다. 저자는 이러한 고유한 순차적 성질이 훈련 샘플 내 병렬화를 배제하며 더 긴 시퀀스 길이에서 이 문제가 중요해진다고 썼습니다. 메모리가 이를 보상하기 위해 배치할 수 있는 샘플 수를 제한하기 때문입니다.
방 안의 하드웨어가 GPU 일 때 이것이 무엇을 의미하는지 생각해보십시오. GPU 는几千 가지 일을 동시에 하는 기계입니다. 순환 네트워크는 일을 하나씩 하는 기계입니다. 전자의 후자 실행은 오케스트라를 고용했는데 독주 바이올린을 위한 곡을 주는 것과 같습니다. 모두 왔습니다. 대부분은 기다리고 있습니다.
이 분야는 알고 있었습니다. 수정 방법이 있었습니다. 논문은 인수분해 기법과 조건부 계산을 인용했는데 둘 다 효율성을 높였으며 그중 하나는 품질도 높였습니다. 그리고 이후 모든 것을 설정하는 문장을 제시했습니다. 그러나 순차 계산의 기본 제약은 여전히 존재합니다.
这就是一个领域把成本定价到其世界观中的样子。没人认为循环是免费的。所有人都认为它是必要的。
어텐션의 등장, 조력자로서
어텐션은 2014 년 기계 번역에 진입했으며 복구자로서 진입했습니다.
它修复的问题是具体的,值得精确说明,因为这第一个修复的形态决定了这个领域接下来三年如何思考注意力。在当时的编码器 - 解码器模型中,编码器读取整个源句子并将其压缩成单个固定长度的向量。解码器然后仅从该向量生成翻译。一个四十词句子的每个词都必须存活在一个数字数组中,其大小无论句子多长都不会改变。
당시 브레멘 야콥스 대학의 Dzmitry Bahdanau 는 몬트리올의 Kyunghyun Cho 및 Yoshua Bengio 와 협력하여 이를 병목 현상이라고 명명했습니다. 그들의 제안은 강제 압축을 중단하는 것이었습니다. 인코더가 각 입력 위치 상태를 유지하도록 하고 디코더가 각 출력 단계에서 이 모든 상태의 가중치 세트를 계산하여 가중 합을 취하도록 합니다. 모델은 어디를 볼지 학습합니다. 그들의 제목은 결과 능력을 명확히 진술했습니다. 정렬과 번역의 공동 학습을 통한 신경 기계 번역. 정렬은 통계 번역 시스템이 수동으로 구축해야 했던 기계로 근사하던 것이 학습의 부산물로 네트워크에서脱落했습니다.
이 메커니즘은 효과적이었고 확산되었습니다. 1 년 후 Minh-Thang Luong,Hieu Pham 및 Christopher Manning 은 개선을 발표하여 더 저렴하고 더 일반화되게 만들었습니다. 2016 년까지 어텐션은 거의 모든 경쟁력 있는 번역 시스템의 표준 구성이 되었습니다.
그리고 그러한 모든 시스템에서 그것은 순환 네트워크 위에 앉아 있었습니다.
이것이 전체 이야기 전환의 세부사항이며 Transformer 논문은 서론에서 한 문장으로 이를 표시했습니다. 저자는 어텐션 메커니즘이 시퀀스 모델링의 필수 불가결한 부분이 되어 거리를 고려하지 않고 의존성 모델링을 허용한다고 지적했습니다. 그러나 몇 가지 경우를 제외하고 모든 경우에서 이러한 메커니즘은 순환 네트워크와 결합되어 사용되었습니다.
다시 읽으십시오. 그것이 무엇을 말하지 않는지 주의하십시오. 어텐션이 과소평가되었다고 말하지 않습니다. 3 년 동안 이 분야는 두 위치를 직접 연결하는 메커니즘을 보유했습니다. 한 단계로 완료되며 아무리 멀리 떨어져 있어도 가능합니다. 그러나 그것을恰恰 이를 수행할 수 없는 아키텍처에 묶어두었습니다. 어텐션은 승객입니다. 순환이 차입니다.
아무도 이 차가 하중을 견디는지 묻지 않았습니다.
질문하는 사람
거의没人,어쨌든.
Jakob Uszkoreit 은 언어를 연구할 생각이 없었습니다. 그는 우연히 들어왔습니다. 그의 아버지 Hans Uszkoreit 은 계산 언어학자였습니다. 10 대 시절 소련의 체코슬로바키아 침공에 항의하다가 동독 감옥에서 15 개월을 보냈고 석방 후 서방으로 탈출하여 베를린에서 컴퓨터와 언어학을 공부했고 결국 멘로파크의 인공지능 연구소로 가는 길을 찾았고 그곳에서 아들이 태어났습니다. 온 가족은 독일로 돌아갔습니다. Jakob 은 그곳에서 대학에 다니며 구글 마운틴뷰 사무실에서 인턴십을 했고 번역 그룹에 배치되었습니다. 그는 이를 결국 가업에 들어온 것이라고 묘사했습니다. 그는 박사 학위를 완료하지 않았습니다.
2012 년 그는 검색 페이지에서 직접 질문에 답할 수 있는 시스템을 구축하는 구글 팀에 합류했습니다. 애플은 막 Siri 를 출시했고 구글 리더십은 이것이 비상사태라고 결정했습니다. Uszkoreit 은事后看来这种恐慌是没有根据的。但它在一个致力于可以进行类似对话的机器的团队后面投入了资源,这就是他撞上墙的地方。
순환 네트워크는 장단기 메모리를 추가해도 긴 문단을 연결할 수 없었습니다. 고전적인 데모는 초기 진술된 사실이 후기 진술된 구의 의미를 결정하는 문장입니다. 모델은 왼쪽에서 오른쪽으로 이동하며 후기 구에 도달할 때 여전히 초기 사실을携带해야 합니다.LSTM 은 이를 일반 순환이 허용하는 것보다 더 긴 범위로 가능하게 했습니다. 그러나 Uszkoreit 이 원하는 규모에서는 작동하지 않았습니다. 그는 당시 분야 도구킷에 대한 자기 평가를 그의 말로"기본적으로 반창고"라고 했습니다.
2014 년경 그는 셀프 어텐션이라고 부르는 대안을 개발하기 시작했습니다. 모델이 단어를 번역할 때 단락의 다른 부분을 직접 참조하도록 하고 각 부분이 손에 쥔 단어를 명확히 하는 정도에 따라 가중치를 부여합니다. 그는 두 가지를 의심했습니다. 첫째는 단순히 더 잘 작동할 수 있다는 것이었습니다. 둘째는 덜 분명했지만事实证明更重要。셀프 어텐션은 순서대로 많은 입력을 보는 것이 아니라 동시에 보므로 그 형태가 머신러닝 붐이 대량 생산하는 병렬 처리 칩과 완전히 일치한다는 것입니다. 메커니즘과 하드웨어는 서로를 위해 만들어졌습니다. 아무도 이렇게 설계한 적이 없습니다.
반응은 차가웠습니다. 순환을 포기하는 것은 분야가 수년 동안 다듬은 아키텍처 전체를 버리는 것을 의미했으며 Uszkoreit 의说法是人们对这个建议扬起了眉毛。怀疑者包括他的父亲,用他自己的描述,他与父亲在餐桌上并没有完全看对眼。
그는 몇몇 동료를 설득하여 어쨌든 실험을 했습니다. 결과는 2016 년 짧은 텍스트 범위만 사용하여 소규모로 발표할 만큼 충분히 유망했습니다. 그 논문은 Ankur Parikh,Oscar Täckström,Dipanjan Das 및 Jakob Uszkoreit 의"분해 가능한 어텐션 모델"로 EMNLP 2016 에서 발표되었습니다. 순환 없이 어텐션만으로 자연어 추론을 수행했습니다.
그리고 그의 협력자들은 계속前進했습니다. 기술은 배포할 만큼 충분히 좋았으므로 그들은 구글 검색과 결국 광고에 걸쳐 배포했습니다. 표준 측정 기준으로 이는 성공이었습니다. Uszkoreit 은 작은 실험이 큰 실험을 시사한다고 생각한 유일한 사람이었습니다.
这就是为什么,当"注意力就是你所需要的一切"在一年后出现,其引言承认注意力几乎总是与循环网络结合使用时,附在除少数情况外这个短语上的引用就是那篇 2016 年的论文。规则的例外,坐在参考文献二十七的书目中,是即将打破它的人的工作。
카페, 복도, 커피 머신
Transformer 는 도청된 대화에서 조립되었습니다. 이는 수사가 아닙니다. 참가자들이 묘사한 것입니다.
2016 년 구글 카페에서의 점심시간에 Uszkoreit 은 Illia Polosukhin 이 검색 페이지를 위한 직접 답변 구축 팀이 밀리초 내에 결과를 반환해야 하지만 성공하지 못했다고 불평하는 것을 들었습니다. Uszkoreit 의 제안은 셀프 어텐션이었습니다. Polosukhin 은 때때로 Ashish Vaswani 와 협력했는데后者는 남加州大学 기계 번역 박사 학위 과정에서 Google Brain 으로 와서 큰 문제를 찾고 있었습니다. Vaswani 의 빌딩은 Polosukhin 옆에 있었습니다. 그는 이 아이디어를 듣고 합류했습니다.
그들 세人は 설계 문서를 작성했습니다. 제목의 이름은一开始就选定了,이론은 이 메커니즘이 이를 통과하는 정보를 변환하기 때문이며 또한 Uszkoreit 이 어릴 적 트랜스포머 장난감 두 개를 소유했기 때문입니다. 문서는 산에서 서로 레이저를 쏘는 그들의 6 명 그림으로 끝납니다. 시작 문장은 독자에게 저자들이 훌륭하다고 알립니다.
Niki Parmar 은 구글 검색에서 합류했는데 그곳에서 Uszkoreit 과 함께 모델 변형을 구축하고 있었습니다. Llion Jones 는 동료 Mat Kelcey 로부터 셀프 어텐션을 듣고 합류했습니다. Kelcey 는 나중에 프로젝트 브리핑을 듣고 Jones 에게 그것이 작동할 것이라고 의심했다고 말했는데 이제 이를 그의 인생에서 가장 부정확한 예측이라고 묘사합니다. Łukasz Kaiser 는 언어 모델에 대한 Google Brain 의 별도 노력에서 그의 인턴 Aidan Gomez 와 함께 왔습니다. 학부생인 Gomez 는 대화를 통해 박사 과정 학생에게 예약된职位에 들어갔으며 몇 달 동안 이를 발견하지 못할 것입니다. Kaiser 와 Gomez 는 그들의 프로젝트를 다른 프로젝트에 병합하기로 결정했습니다.
Polosukhin 은 2017 년 초 구글을 떠나 자신의 회사를 설립했으며 이것이 논문의 서명란에 그의 소속이 없는 이유입니다.
그리고 그룹은 벽에 부딪혔습니다. 그들은 셀프 어텐션 번역 모델을 구축했고 표준 벤치마크로 측정했으며 당시 최고의 LSTM 시스템과 대략 동등하다는 것을 발견했습니다. 동등.领先이 아닙니다. 분야가 축적한 사전 지식을 버리고 동등함으로 돌아오는 급진적인 아키텍처는 결과가 아닙니다. 이는 제자리에留在的비싼 방법입니다.
벽은 한 사람이 문을 지나가면서 무너졌습니다.
Noam Shazeer 는 2000 년以来一直在谷歌,并且有追溯到公司早期广告系统的声誉。他在深度学习上花了五年时间,对语言模型产生了兴趣,在他看来,语言模型远未达到他认为可以实现的流畅性。走过 1965 号楼的走廊,他路过 Kaiser 的工作区,无意中听到 Vaswani 和 Parmar 激烈地谈论自注意力。他觉得循环网络很烦人。替换它们的提议在他看来既正确又有趣。
Uszkoreit 이 Shazeer 의 기여에 대한 설명은 분야가 거의 이야기하지 않는 것을 묘사하기 때문에 신중하게 진술할 가치가 있습니다. 이론적으로 타당한 메커니즘은他说,往往需要少数有经验的人非常仔细的实现,才能显示出任何工作迹象。Shazeer 는 팀의 코드를 디버깅하지 않았습니다. 그는 이 아이디어를 읽고 처음부터 자신의 구현을 작성했으며 때때로 Kaiser 와 확인한 후 잠시 사라졌다가 작동하는 버전을 가지고 돌아왔습니다. 그의 동료들은 그가 한 일을 마법과 연금술 같은 단어로 묘사했습니다. Jones 는 단순히 그를 마법사라고 불렀습니다.
Shazeer 가 추가한 구체적인 것은 이 시리즈 다음 세 기사의 주제입니다. 논문의 크레딧 각주는 스케일링 점곱 어텐션, 멀티 헤드 어텐션 및 파라미터 없는 위치 표현을 그에게 할당했습니다. 이들은 2,3,4 부의 앵커 텍스트입니다. 한 사람이 스프린트에서 이 시리즈가 해체하는 네 가지 구성 요소 중 세 가지를 생산했습니다.
도박의 실제 내용
초록은 한 문장으로 입장을 진술합니다. 저자는 어텐션 메커니즘에만 기반한 새로운 단순 네트워크 아키텍처를 제안하며 순환과 컨볼루션을 완전히 포기합니다.
거기서 작용하는 단어는 완전히입니다.
순환 제거
순환을 제거하는 것 자체가 급진적인 부분은 아닙니다. 다른 사람들도 시도했습니다. 논문 2 절은 이를 나열합니다. Extended Neural GPU,ByteNet 및 ConvS2S 는 모두 컨볼루션으로 순환을 대체하여 모든 위치의 표현을 병렬 계산합니다. 저자는 순차 계산을 줄이는 목표 자체가那些工作的基础라고 인정합니다.
그러나 컨볼루션은 병렬성을 위해 대가를 치렀으며 논문은 이 대가에 대해 정확하게 설명합니다. 이러한 모델에서 임의의 두 위치를 연결하는 데 필요한 연산 수는 거리에 따라 증가합니다. ConvS2S 는 선형 증가,ByteNet 은 로그 증가입니다. 여전히 무료가 아닙니다. 긴 문장의 양쪽 끝에 있는 두 단어를 연결하는 것은 여전히 비쌉니다. 논문은 표준 결론을 인용합니다. 더 긴 경로는 장거리 의존성 학습을 더 어렵게 만듭니다.
셀프 어텐션은 이 문제를 상수 수준으로 압축합니다. 임의의 위치에서 임의의 다른 위치까지 한 단계이며 거리가 아무리 멀어도 상관없습니다. 표 1 은 세 가지 레이어 유형을 나란히展示합니다. 중요한 열은 최대 경로 길이입니다. 순환은 n 차수,컨볼루션은 log n 차수,셀프 어텐션은 1 차수입니다.
이것이 그 도박입니다. 어텐션이 유용하다는 것이 아닙니다. 이는业界已经相信。도박은 상수 경로 길이의 가치가 업계가 축적한 다른 모든 구조적 사전 지식을 버리고도 이길 수 있을 만큼 크다는 데 있습니다.
논문은 무엇을 포기했는지 숨기지 않았습니다. 상수 연산량 선언 이후 두 문장 만에 이후 요약에서 거의 보존되지 않는 인정이 있습니다. 상수 비용은 어텐션이 가중 위치를 평균화하기 때문에 유효 해상도를 낮추는 대가입니다. 멀티 헤드 어텐션의 존재는 바로 이를 상쇄하기 위한 것입니다. 논문은 두 번째 페이지에서 핵심 메커니즘이 흐림을 유발하며 가장 찬사를 받는 구성 요소 중 하나가 실제로는 패치라고 알려줍니다. 3 부에서 이 문제로 돌아갈 것입니다.
표 1 에 작성되고 4 절에서 변호된 두 번째 비용이 있습니다. 논문은 이를 합리적인 절충안으로 여기지만 다음 10 년은 이를 AI 인프라의 핵심 문제로 여깁니다. 셀프 어텐션의 레이어당 복잡도는 n 제곱 곱하기 d 입니다. 논문의 변호는 번역의 문장 길이 입력의 경우 n 이 일반적으로 d 보다 작다는 것이며 이는 2017 년에는 사실이었지만 누군가 모델에 책 한 권을 먹이고 싶을 때는 더 이상 성립하지 않는다는 것입니다. 7 부에서 이 계정을 청구할 것입니다.
12 시간
마감일은 12 월 회의를 위한 5 월 19 일이었습니다. 마지막 2 주는 1965 호 건물에서 보냈습니다. 부분적으로는 팀의 일부 사람들이 그곳에 책상이 있었기 때문이며 부분적으로는 그곳의 에스프레소 머신이 1945 호 건물보다 좋았기 때문입니다. 인턴 Gomez 는 지속적인 디버깅 기간을 묘사했습니다. 아무도 많이 자지 않았으며 시스템적으로 구성 요소를 제거하여 모델이 그것 없이도 작동하는지 확인했습니다. 이제 Transformer 라고 불리는 것의 대부분은 그 과정의 잔재입니다. 제거할 수 없었던 부분들입니다.
그리고 숫자가 나왔습니다.
기본 모델은 단일 머신에서 8 개의 NVIDIA P100 GPU 로 10 만 단계 훈련되었습니다. 벽시계 시간 12 시간. 이 모델은 이전에 발표된 모든 영독 모델과 앙상블을 능가했습니다. 대형 모델은 동일한 8 GPU 머신에서 3 일 반 동안 훈련되어 28.4 BLEU 에 도달했으며 이전 최고 결과 (앙상블 포함) 를 정확히 2 점 이상 초과했습니다. Uszkoreit 은 산악 탐험 트럭에 항상 넣어두었던 샴페인 한 병을 열어 축하했습니다.
이제 표 2 를 보십시오. 논문에서 가장 조용하지만 가장 치명적인 표입니다. 이는 부동 소수점 연산 훈련 비용을 나열합니다. 당시 경쟁적인 앙상블 시스템은 1.1×10²¹에서 7.7×10¹⁹ 사이였습니다. Transformer 대형 모델은 2.3×10¹⁹였으며 기본 모델은 이보다 한 자수준 더 낮았습니다. 새로운 최적 결과는 표에서 가장 저렴한 시스템에 의해 창출되었습니다.
수년 동안 규모로 품질을 교환한 분야는 구조로 품질을 교환하는 모델을 보여줬습니다. 그리고 이 구조가 병렬 하드웨어에 깔끔하게 매핑될 수 있기 때문에 같은 아키텍처는 나중에 소비할 가치가 있는 연산력이 있을 때 연산력을 소비하는 이상적인 운반체가 될 것입니다. 2017 년의 결과는 효율성 이야기로 읽힙니다. 뒤돌아보면 이는 효율성 이야기의 외투를 쓴 용량 이야기입니다.
논문 제출 시 약 2 분 남았습니다. Parmar 은 영불 숫자가 제출 약 5 분 전에 도착했다고 말했으며 그녀는 작은 부엌에 앉아 마지막 숫자를 기다렸습니다. 이는 아마도 발표된 논문에서 여전히 존재하는 작은 불일치를 설명할 수 있습니다. 초록과 표 2 는 영불 점수를 41.8 로 보고하는 반면 6.1 절은 41.0 으로 보고합니다. 머신러닝에서 가장 영향력 있는 논문은 본문 작성 완료 후 실험이 완료되었기 때문에 모순된 숫자를 포함합니다.
제목은 마감 몇 밤 전에 정해졌습니다. 웨일스인 Jones 는 팀이 업계의 인정된 관행을 거부하고 단일 기술을 선택했으며 비틀즈가 이미 그들을 위해 그 문장을 써주었다고 지적했습니다. 그는 이 아이디어에 약 5 초가 걸렸으며 누군가 이를 사용할 것이라고 생각하지 못했다고 말했습니다.
그들은 사용했습니다.
원숭이에게로 돌아가기
Transformer 는 각 위치에 대해 소프트맥스에 의해 생성된 가중치를 가진 모든 다른 위치에 대한 가중 합을 계산합니다. 소프트맥스는 정렬만이 아닙니다. 억제합니다. 하나의 점수를 높이면 분포의 다른 모든 점수는 감소합니다. 합계가 1 로 고정되어 있기 때문입니다. 아키텍처 핵심의 이 메커니즘은 경쟁적이며 그 출력은 그것이 0 으로 몰아가는 것과 그것이 높이는 것에 의해 공동으로 정의됩니다.
이것은 정확히 Moran 과 Desimone 이 V4 뉴런에서 발견한 것입니다. 두 물체가 수용 영역에 있을 때. 이것은 정확히 제임스가 다른事物을 효과적으로 처리하기 위해 어떤事物에서 철수한다고 묘사한 것입니다.
2017 년 저자들이 제임스를 구현했다고 주장하는 것은 지나칠 것입니다. 그들은 그러지 않았습니다. 쿼리,키 및 값은 심리학이 아닌 정보 검색에서 왔으며 2 부에서 그 계보를 올바르게 추적할 것입니다. 그러나 그들이 선택한 단어는 우연이 아니며 이 분야는 배후의 개념을 1 세기 동안 다듬었습니다. Anne Treisman 과 Garry Gelade 가 1980 년 특징 통합 이론을 발표했을 때 그들은 특징이 초기에 병렬로 등록되며 어텐션은 이를 물체로 바인딩하는 작업이라고 주장했습니다. 병렬 등록 후 선택적 바인딩. 이는 37 년 전에 인간 시각을 연구한 사람들이 쓴 Transformer 레이어에 대한 설명입니다.
이러한 수렴이 지능에 대한 진정한 사실인지 어휘의 우연인지가 이 시리즈의 마지막 질문입니다. 8 부에서 이에 답하려고 시도할 것입니다.
그러나 2017 년 12 월 회의 포스터 세션에서 발생한 더 좋은 결말이 있습니다. 방은 4 시간 동안 가득 찼습니다. 보안 요원은 결국 퇴장을 해야 했습니다. 그날 밤 어느 시점 한 남자가 포스터 앞에 와서 저자들에게 이 작업에 감명받았다고 말했습니다. 그 사람은 Sepp Hochreiter 였습니다.
Hochreiter 는 장단기 메모리 네트워크를 공동 발명했습니다. 그는 막 그것을 구식하게 만든 사람들을 축하하러 왔습니다.
도박. 순환은 시퀀스 모델링에 필수적이지 않습니다. 순환이나 컨볼루션 레이어 없이 어텐션만으로 완전히 구축된 아키텍처는 최적 수준과 일치하고 능가할 수 있으며 임의의 두 위치 간의 상수 경로 길이는 버려진 모든 구조적 사전 지식보다 더 가치가 있습니다.
보상. 이겼으며 저자들이 예상한 것보다 더 빨랐습니다. 약 2 년 내에 이 아키텍처는 자연어 처리에서 순환 모델을 대체했습니다. 이후 구축된 최전방 언어 모델은 모두 그 자손입니다. 논문은 결론에서 스스로 선언한 야망은 이 방법을 다른 모달리티로 확장하고 생성을 덜 순차적으로 만드는 것입니다. 그것은 산업을 얻었습니다.
상태. 별표와 함께 정산되었습니다. 이 도박은 논문이 명시적으로 만들고 2017 년에 올바르게 가격을 매긴 절충안에서 이겼습니다. 시퀀스 길이의 2 차 비용으로 상수 경로 길이를 교환한 것입니다. 오늘날 AI 의 모든 긴 컨텍스트 문제는 그 절충안의 이자 지급입니다. 7 부에서 이를 청구할 것입니다.
TechFlow 공식 커뮤니티에 오신 것을 환영합니다
Telegram 구독 그룹:https://t.me/TechFlowDaily
트위터 공식 계정:https://x.com/TechFlowPost
트위터 영어 계정:https://x.com/BlockFlow_News













