
Transformer 誕生前夜:Google の 8 名の研究者はなぜあえて循環型ニューラルネットワークを完全に放棄したのか?
TechFlow厳選深潮セレクト

Transformer 誕生前夜:Google の 8 名の研究者はなぜあえて循環型ニューラルネットワークを完全に放棄したのか?
杖を捨て、注意力だけを残す。
著者:Robonaissance
翻訳:TechFlow
TechFlow 編集者注:2017 年之前、誰もが循環型ニューラルネットワークは機械翻訳に不可欠で、アテンション機構は単なる補助ツールだと考えていました。Google の 8 人の研究者はある急進的な考えに賭けました:杖を捨て、アテンションだけを残す。この大博打の理論的基礎は、実は 1890 年にウィリアム・ジェームズが『心理学原理』に記した一言でした。
1985 年、Jeffrey Moran と Robert Desimone は 1 本の微小電極をアカゲザルの視覚皮層に挿入し、そして待ちました。
この猿は、単純で奇妙なことをするように訓練されていました。単一のニューロンの受容野内に 2 つの刺激物が現れます。一つは動物が注意するように指示された位置にあり、もう一つは無視するように指示された位置にあります。この細胞は両方を見ることができます。問題は、この細胞がそれを気にするかどうかです。
それは非常に気にしました。猿が 2 つの刺激物のうち一つに注意を向けたとき、V4 野のニューロンの反応は、もう一つの刺激物がそもそも存在しないかのように振る舞いました。著者の言葉によれば、注意されなかった物体への反応は著しく低下しました。前段階のストライエート皮質の細胞には、このような表現は全く見られませんでした。注意力とは動物が何を考えているかの比喩ではありません。それは単一の細胞内で測定可能な事象であり、そのメカニズムは減算です。脳は重要なものを増幅しているのではありません。他のすべてのものを压低しているのです。
95 年前、微小電極も猿もいませんでしたが、ウィリアム・ジェームズは同じ順序で同じことを言いました。『心理学原理』第 11 章で、彼は誰もが注意力が何かを知っていると書いた後、それでも定義を与えました:心智がいくつかの同時に可能な対象の中から一つを占有すること。そして最も重要なその言葉です。ジェームズは写道、注意力とは、他の物を効果的に処理するために、ある物から撤退することを意味すると。
撤退。増幅ではありません。この分野で最も古い定義と最初の単細胞記録は一致しています。注意力とはあなたが減算するものだ、と。
この考えを覚えておいてください。約 2000 字後に、それは異なる記号をまとって戻ってきます。
誰もが同意した代償
2016 年までに、機械翻訳は定型化されていました。文を取り、循環型ニューラルネットワークを通じて単語ごとに実行し、これまで見たすべてのものを担う隠れ状態を蓄積し、然后その状態を使って他端で単語ごとに翻訳を生成します。主流の変種は LSTM とゲート付き循環ユニットでした。它们は効果的でした。Google はすでにそれを生産に投入していました。
このアーキテクチャには、分野内で議論され続けながらも、もはや問題視されなくなった特性がありました。循環モデルは、位置 t の隠れ状態を位置 t 減 1 の隠れ状態の関数として計算します。これは実装の詳細ではありません。これは定義です。位置 5 は位置 4 が存在して初めて計算でき、位置 4 は位置 3 を待たなければなりません。
Transformer 論文自身の序論部分は、礼儀正しい章としては異例な率直さで結果を陈述しました。著者は写道、この固有の順序性質は訓練サンプル内の並列化を排除し、しかもこの問題はより長い序列長において決定的になる、なぜならメモリがそれを補償するためにバッチ処理できるサンプル数を制限するからです。
部屋にあるハードウェアが GPU のとき、これが何を意味するか考えてみてください。GPU は同時に数千のことをする機械です。循環ネットワークは一件ずつ事をする機械です。前者で後者を動かすことは、オーケストラを雇っても、彼らに独奏バイオリンのために書かれた曲を与えるようなものです。誰もが到着しました。大多数の人は待っています。
この分野は知っていました。修復方法がありました。論文は因数分解テクニックと条件付き計算を引用し、両方とも効率を向上させ、そのうち一つは品質も向上させました。然后それは、その後のすべてを設定する文を与えました:しかしながら、順序計算の基本的な制約は依然存在します。
これが、ある分野がコストをその世界観に価格設定する様子です。誰も循環が無料だとは思っていませんでした。誰もがそれは必要だと考えていました。
アテンション到来、助手として
アテンションは 2014 年に機械翻訳に参入し、それは修復者として参入しました。
それが修復した問題は具体的であり、正確に説明する価値があります。なぜなら、この最初の修復の形態が、この分野が今後 3 年間どのようにアテンションを考えるかを決定したからです。当時のエンコーダー - デコーダーモデルでは、エンコーダーは源文全体を読み取り、それを単一の固定長のベクトルに圧縮しました。デコーダーは然后そのベクトルからのみ翻訳を生成しました。40 語の文の各単語は、文がどれだけ長くてもサイズが変わらない数字の配列の中で生存しなければなりませんでした。
当時ブレーメンのヤコブス大学にいた Dzmitry Bahdanau は、モントリオールの Kyunghyun Cho と Yoshua Bengio と協力し、これをボトルネックと名付けました。彼らの提案は、強制圧縮を止めることでした。エンコーダーに各入力位置の状態を保持させ、デコーダーに各出力ステップでこれらの状態すべての重みのセットを計算し、加重平均を取らせるようにしました。モデルはどこを見るかを学習します。彼らのタイトルは結果として得られた能力を明確に陈述しました:アライメントと翻訳を jointly 学習する神経機械翻訳。アライメントとは、統計的翻訳システムが手動で構築する必要があった機械が、学習の副産物としてネットワークから脱落する近似です。
このメカニズムは効果的であり、広がりました。1 年後、Minh-Thang Luong、Hieu Pham、Christopher Manning は一組の改善を発表し、それをより安く、より汎用的にしました。2016 年までに、アテンションはほぼすべての競争力ある翻訳システムの標準装備になりました。
そして、そのようなすべてのシステムにおいて、それは循環ネットワークの顶部に座っていました。
これは物語全体の転換の詳細であり、Transformer 論文は序論で一言でそれをマークしました。著者は指出、アテンション機構は序列モデリングに不可欠な部分となり、距離を考慮せずに依存関係モデリングを可能にしました。しかしながら、少数の例外を除くすべての場合において、これらの機構は循環ネットワークと組み合わせて使用されていました。
もう一度読み、それが何を言っていないかに注意してください。アテンションが過小評価されていたと言っているのではありません。3 年間、この分野は任意の 2 つの位置を直接関連付けるメカニズムを持っていたと言っているのです。それらがどれだけ離れていても、一歩で完了します。しかし、それをまさにそれができないアーキテクチャに縛り付けていました。アテンションは乗客でした。循環が車でした。
誰もこの車が荷重に耐えられるか問いませんでした。
問う人
ほとんど誰も、とにかく。
Jakob Uszkoreit は言語を研究するつもりはありませんでした。彼は偶然入ってきました。彼の父親 Hans Uszkoreit は計算言語学者であり、10 代の頃にソ連のチェコスロバキア侵攻に抗議したことで東ドイツの獄で 15 ヶ月を過ごし、釈放後に西方へ逃亡し、ベルリンでコンピュータと言語学を学び、最終的にメンロパークの人工知能研究所への道を見つけ、そこで彼の息子が生まれました。家族はドイツに戻りました。Jakob はそこで大学に通い、Google マウンテンビューオフィスでインターンシップをし、翻訳グループに落ち着きました。彼はこれを結局家族の事業に入ったと表現しました。彼は博士号を完了しませんでした。
2012 年、彼は Google のチームに加わり、検索ページで直接質問に答えるシステムを構築しました。Apple はちょうど Siri をリリースし、Google 指導部はこれが緊急事態だと決定しました。Uszkoreit は後から見れば、このパニックは根拠がなかったと言います。しかしそれは、会話のようなことができる機械に専念するチームの背後に資源を投入しました。これが彼が壁にぶつかった場所です。
循環ネットワークは、長短期記憶を足しても、長い段落を一緒に繋ぐことができませんでした。古典的なデモは、早期に陈述された事実が後期に陈述された句の意味を決定する文であり、モデルは左から右へ進み、後期の句に到達したときに早期の事実をまだ携えていなければなりません。LSTM はこれを普通の循環が許すよりも長いスパンで可能にしました。它们は Uszkoreit が望んだ規模でそれを機能させませんでした。当時の分野のツールキットに対する彼の自己評価は、彼が適用した方法は彼の言葉で「基本的に絆創膏」でした。
2014 年頃、彼はセルフアテンションと呼ばれる代替案の開発を始めました:モデルが段落の他のどの部分を直接参照して単語を翻訳し、各部分が手元の単語の明確化程度に基づいて重み付けします。彼はこのことについて 2 つを疑いました。第一に、それは単により良く機能するかもしれないということ。第二に、あまり明らかではありませんでしたが、証明された通りより重要でした。セルフアテンションは順序ではなく多くの入力を同時に查看します。つまり、その形状は機械学習ブームが大量に生産していた並列処理チップと全く同じです。メカニズムとハードウェアは互いのために作られました。誰もこのように設計したことはありませんでした。
反応は冷たかったです。循環を放棄することは、分野全体が多年を費やして洗練させたアーキテクチャを捨てることを意味し、Uszkoreit の说法によると、人々はこの提案に眉をひそめました。懐疑者には彼の父親も含まれており、彼自身の記述によると、彼は父親と食卓で完全に目が合いませんでした。
彼は数人の同僚を説得し、とにかく実験を行いました。結果は 2016 年に小規模で発表するのに十分希望があり、短いテキストスパンのみを使用しました。その論文は Ankur Parikh、Oscar Täckström、Dipanjan Das、Jakob Uszkoreit による「分解可能なアテンションモデル」で、EMNLP 2016 で発表されました。それはアテンションを使用し、循環を全く使用せずに自然言語推論を実行しました。
然后彼の協力者は前進しました。この技術は展開するのに十分良かったので、彼らは展開しました。Google 検索全体に、そして最終的に広告に。標準的な尺度で測れば、これは成功でした。Uszkoreit は小実験が大実験を示唆すると考えた唯一の人でした。
だからこそ、1 年後に「Attention Is All You Need」が登場し、その序論がアテンションがほぼ常に循環ネットワークと組み合わせて使用されると認めたとき、例外を除くこの句に付随した引用はその 2016 年の論文でした。規則の例外は、参考文献 27 の書目の中に座っており、それはそれを破ろうとしていた人々の仕事でした。
カフェ、廊下、コーヒーマシン
Transformer は盗み聞きした会話から組み立てられました。これは修飾ではありません。これは参加者が記述したものです。
2016 年、Google カフェでの昼食時、Uszkoreit は Illia Polosukhin が検索ページのために直接答えを構築するチームについて不満を言うのを聞きました。それはミリ秒以内に結果を返さなければなりませんでしたが、成功していませんでした。Uszkoreit の提案はセルフアテンションでした。Polosukhin は時々 Ashish Vaswani と協力しており、後者は南カリフォルニア大学の機械翻訳博士号から Google Brain に来ており、大きな問題を探していました。Vaswani のビルは Polosukhin の隣でした。彼はこの考えを聞き、参加しました。
彼ら 3 人は設計文書を書きました。タイトル中の名前は一开始から選ばれました。理論としては、このメカニズムはそれを通る情報を変換するため、また Uszkoreit が子供の頃に 2 つの変形金刚おもちゃを持っていたためです。文書は彼ら 6 人が山の中で互いにレーザーを撃つ絵で終わりました。开篇の文は読者に著者たちが素晴らしいことを告げました。
Niki Parmar は Google 検索から参加し、彼女はそこで Uszkoreit とモデル変種を構築していました。Llion Jones は同僚 Mat Kelcey からセルフアテンションを聞き、参加しました。Kelcey は後でプロジェクトブリーフを聞き、Jones にそれが機能すると疑っていると告げ、現在これを彼の人生で最も不正確な予測と記述しています。Łukasz Kaiser は言語モデルに関する Google Brain の別の努力から、彼のインターン Aidan Gomez を連れて来ました。Gomez は学部生であり、会話を通じて博士課程学生のために予約された職位に入り、数ヶ月間それに気づきませんでした。Kaiser と Gomez は彼らのプロジェクトを別のプロジェクトに統合することを決定しました。
Polosukhin は 2017 年初頭に Google を去り、自分の会社を設立しました。これが論文の署名欄に彼の所属がない理由です。
然后グループは壁にぶつかりました。彼らはセルフアテンション翻訳モデルを構築し、標準ベンチマークで測定しました。発見したのは、それが当時の最高の LSTM システムとほぼ同等だったことです。同等。领先していません。分野が蓄積した事前知識を捨て、平价に戻る急進的なアーキテクチャは結果ではありません。それは原地に留まる高価な方法です。
壁が倒れたのは、一人が扉を歩いたからです。
Noam Shazeer は 2000 年以来 Google におり、会社の初期広告システムに遡る評判がありました。彼は深層学習に 5 年間を費やし、言語モデルに興味を持ちました。彼にとって、言語モデルは彼が実現可能だと考えていた流暢さに遠く及びませんでした。1965 号棟の廊下を歩き、彼は Kaiser のワークスペースを通り過ぎ、Vaswani と Parmar がセルフアテンションについて激しく議論しているのを偶然聞きました。彼は循環ネットワークを煩わしいと感じました。它们を置換する提案は彼にとって正しく、興味深いものでした。
Uszkoreit の Shazeer の貢献に対する说法は注意深く陈述する価値があります。なぜならそれは分野があまり語らないものを記述しているからです。理論的に妥当なメカニズムは、他说、任何迹象を示すために、少数の経験豊富な人々による非常に注意深い実装を必要とする傾向があります。Shazeer はチームのコードをデバッグしませんでした。彼はこの考えを読み、最初から自分の実装を書き、時々 Kaiser と確認し、一段时间消え、然后有効なバージョンを持って戻ってきました。彼の同僚は魔法や錬金術のような言葉で彼のしたことを記述しました。Jones は単に彼をウィザードと呼びました。
Shazeer が追加した具体的なものは、このシリーズの次の 3 つの記事の主題です。論文のクレジット脚注は、縮尺付きドット積アテンション、マルチヘッドアテンション、パラメータなし位置表現を彼に割り当てています。これらは第 2、3、4 部のアンカーテキストです。一人が、スプリントの中で、このシリーズが分解する 4 つのコンポーネントのうち 3 つを生み出しました。
賭け的实际是什么
要約は一言で立場を陈述しました。著者は、アテンション機構のみに基づく新しい単純なネットワークアーキテクチャを提案し、循環と畳み込みを完全に放棄しました。
そこで機能する言葉は完全にです。
循環を移除
循環を移除すること自体は急進的な部分ではありません。他の人々も試していました。論文第 2 節は它们を列挙しています:Extended Neural GPU、ByteNet、ConvS2S。它们はすべて循環を畳み込みで置換し、すべての位置の表現を並列計算しました。著者は、順序計算を減らすという目標自体がそれらの仕事の基礎であると認めています。
しかし畳み込みは並列性の代償を払いました。論文はこの代償について正確な記述があります。これらのモデルでは、任意の 2 つの位置を関連付けるために必要な操作数は距離とともに増加します:ConvS2S は線形増加、ByteNet は対数増加です。依然として無料ではありません。長い文の両端の 2 つの単語を接続することは依然として高価です。論文は標準的な結論を引用しました:より長いパスは長距離依存を学習することをより難しくします。
セルフアテンションはこの問題を定数レベルに圧縮しました。任意の位置から任意の他の位置へ、一歩、どれだけ離れていても。表 1 は 3 つの層タイプを並べて展示しています。重要な列は最大パス長です:循環は n 階、畳み込みは log n 階、セルフアテンションは 1 階です。
これがその賭けです。アテンションが有用だと言うことではありません——この点は業界已经信じていました。賭けは、定数パス長の価値が、業界が蓄積した他のすべての構造的先験を拋棄しても、依然として勝利できるほど大きいかどうかでした。
論文は何を放棄したか隠しませんでした。定数操作量声明の後の 2 文目に、後の要約でほとんど保持されていない承認があります:定数コストは有効解像度を低下させる代償を払う、なぜならアテンションは重み付け位置を平均化するからです。マルチヘッドアテンションの存在はこのことを相殺するためです。論文は 2 ページ目で、そのコアメカニズムが曖昧さを引き起こすこと、そして最も称賛されるコンポーネントの一つが実際にはパッチであることをあなたに告げます。第 3 部はこの問題に戻ります。
2 つ目の代償もあり、表 1 に書かれ、第 4 節で弁護されています。論文はこれを合理的なトレードオフと見なし、次の 10 年はこれを AI インフラストラクチャの核心問題と見なしました。セルフアテンションの各層の複雑さは n 二乗掛ける d です。論文の弁護は、翻訳における文長の入力について、n は通常 d より小さい、これは 2017 年には真実だったが、誰かがモデルに本を与えたいときにはもはや成立しない、というものです。第 7 部はこの勘定を徴収します。
12 時間
締切は 5 月 19 日、12 月の会議への投稿のためです。最後の 2 週間は 1965 号棟で過ごされました。一部はチームの何人かがそこに机を持っていたため、一部は那里的エスプレッソマシンが 1945 号棟よりも良かったためです。インターン Gomez は、持続的なデバッグの期間を記述しました。誰もあまり寝ず、モデルがそれなしで機能するかどうかを見るためにコンポーネントを体系的に移除しました。現在 Transformer と呼ばれるものの大部分はそのプロセスの残留物です:移除できなかった部分です。
然后数字が出ました。
基礎モデルは単一のマシンで 8 個の NVIDIA P100 GPU を使用して 10 万ステップ訓練されました。時計時間 12 時間。このモデルはこれまでに発表されたすべての英語からドイツ語モデルと集成を超えました。大モデルは同じ 8 GPU マシンで 3 日半訓練され、28.4 BLEU に達し、以前の最高結果(集成を含む)を整整 2 ポイント以上超えました。Uszkoreit は山岳探検トラックにずっと置いていたシャンパンの瓶を開けて祝いました。
今表 2 を見てください。論文で最も静かで、最も殺傷力のある表です。それは浮動小数点演算の訓練コストを列挙しています。当時の競争的な集成システムは 1.1×10²¹ から 7.7×10¹⁹ の間でした。Transformer 大モデルは 2.3×10¹⁹ です。基礎モデルはこれよりさらに 1 桁低いです。新しい最適結果は表で最も安いシステムによって創造されました。
多年を費やして規模を品質と交換した分野に、構造を品質と交換するモデルが示されました。そしてこの構造は並列ハードウェアに cleanly マップできるため、同じアーキテクチャは後で、費やす価値のある計算力があった一旦、計算力を費やす理想的な载体になります。2017 年の結果は効率物語として読めます。振り返ると、それは効率物語の外衣をまとった容量物語です。
論文提交時、大约还剩两分钟。Parmar は英語からフランス語の数字が提交前約 5 分に到着したと言います。彼女は最後の数字を待つために小さなキッチンに座っていました。これはおそらく発表された論文に至今仍に存在する小さな不一致を説明しています:要約と表 2 は英語からフランス語のスコアを 41.8 と報告し、第 6.1 節は 41.0 と報告しています。現代機械学習で最も影響力のある論文は矛盾する数字を含んでいます。なぜなら実験は本文が写完後に完了したからです。
タイトルは締切の数日前の夜に決まりました。ウェールズ人 Jones は指出、チームは業界公认的慣行を拒否し、単一の技術を選択したが、ビートルズがすでに彼らのためにその言葉を書いてくれていた、と言いました。彼はこの考えは約 5 秒かかり、彼が誰かがそれを使うとは思っていなかったと言いました。
彼らは使いました。
猿に戻る
Transformer が各位置のために計算するのは、すべての他の位置への加重和です。重みは softmax によって生成されます。softmax は排序だけではありません。它は压低します。一つのスコアを上げると、分布内の他のすべてのスコアは低下します。なぜなら合計は 1 に固定されているからです。アーキテクチャコアのこのメカニズムは競争的です。その出力はそれが零に駆り立てるものと、それが提升するものの両方によって定義されます。
これはまさに Moran と Desimone が V4 ニューロンで発見したことです。2 つの物体がその受容野内にあるとき。これはまさにジェームズが記述した、他の物を効果的に処理するためにある物から撤退することです。
2017 年の著者がジェームズを実装したと主張するのは行き過ぎです。彼らはそうではありません。クエリ、キー、および値は情報検索から来ており、心理学からではありません。第 2 部はその系譜を正しく追溯します。しかし彼らが選んだ言葉も偶然ではありません。この分野は背後の概念を 1 世紀研磨してきました。Anne Treisman と Garry Gelade が 1980 年に特徴統合理論を発表したとき、彼らは特徴が早期に並列登録され、注意力はそれらを物体にバインドする操作であると論じました。並列登録、然后選択的バインド。これは Transformer 層の記述です。人間視覚を研究する人々によって 37 年前に書かれました。
この収束が知能に関する真実の事実か、語彙の偶然かは、このシリーズの最後の質問です。第 8 部はそれに答えようとします。
しかし、より良い終わりがあります。2017 年 12 月の会議ポスター展示セッションで起こりました。部屋は 4 時間満員でした。保安は最後に clearing しなければなりませんでした。その日の夜のいつか、一人の男がポスターの前に歩き、著者たちにこの仕事に感銘を受けたと告げました。その人は Sepp Hochreiter でした。
Hochreiter は長短期記憶ネットワークを共同発明しました。彼はちょうどそれを時代遅れにした人々を祝うために来ました。
賭け。循環は序列モデリングに必須ではありません。完全にアテンションのみに基づくアーキテクチャは、循環や畳み込み層を全く持たずに、最適レベルにマッチし、超越することができます。任意の 2 つの位置間の定数パス長は、拋棄されたすべての構造的先験よりも価値があります。
回报。勝ちました。そして著者が予想したよりも速く。約 2 年以内にこのアーキテクチャは自然言語処理で循環モデルを置換しました。此后構築された最先端言語モデルはすべてその子孫です。論文は結論で自ら声明した野心は、この方法を他のモダリティに拡張し、生成をそれほど順序化しないようにすることです。それは一つの産業を手に入れました。
状態。決済済み、アスタリスク付き。この賭けは、論文が明確に行い、2017 年に正しく価格設定したトレードオフで勝ちました:序列長の二次代償と定数パス長を交換。今日の AI におけるすべての長文脈問題はそのトレードオフの利息支払いです。第 7 部はそれを徴収します。
TechFlow公式コミュニティへようこそ
Telegram購読グループ:https://t.me/TechFlowDaily
Twitter公式アカウント:https://x.com/TechFlowPost
Twitter英語アカウント:https://x.com/BlockFlow_News













