在线观看www成人影院-在线观看www日本免费网站-在线观看www视频-在线观看操-欧美18在线-欧美1级

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫(xiě)文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

NLP:谷歌Transformer再升級(jí)

ss ? 來(lái)源:學(xué)術(shù)頭條 ? 作者:學(xué)術(shù)頭條 ? 2020-11-06 17:31 ? 次閱讀

當(dāng)我們?cè)诜g軟件上輸入 “Transformer is a novel neural network architecture based on a self-attention mechanism” 后,計(jì)算機(jī)就可以迅速將它翻譯為 “Transformer 是一種基于自注意力機(jī)制的新型神經(jīng)網(wǎng)絡(luò)架構(gòu)”,神奇的機(jī)器翻譯使得多語(yǔ)種互譯成為可能。

近年來(lái),得益于機(jī)器學(xué)習(xí)的快速發(fā)展,自然語(yǔ)言處理(NLP)技術(shù)不斷突破,在人機(jī)交互、在線翻譯工具等領(lǐng)域的應(yīng)用層出不窮,不同語(yǔ)種的人與人、人與機(jī)器之間的無(wú)障礙自由交流得以實(shí)現(xiàn)。

當(dāng)前的主流機(jī)器翻譯主要是基于神經(jīng)網(wǎng)絡(luò)機(jī)器翻譯,這類方法是一個(gè) “編碼器-解碼器”(encoder-decoder)架構(gòu)的系統(tǒng),編碼器對(duì)源語(yǔ)言序列進(jìn)行編碼,并提取信息,然后通過(guò)解碼器把信息轉(zhuǎn)換為目標(biāo)語(yǔ)言,完成語(yǔ)言翻譯過(guò)程。

自 2017 年問(wèn)世以來(lái),基于“編碼器-解碼器”架構(gòu)設(shè)計(jì)的 Transformer 模型憑借其優(yōu)越的性能,已然成為機(jī)器翻譯領(lǐng)域的主流模型,在深度學(xué)習(xí)領(lǐng)域產(chǎn)生了巨大影響。

然而,Transformer 模型并非完美,模型引入self-attention機(jī)制雖實(shí)現(xiàn)了快速并行的訓(xùn)練,但在長(zhǎng)序列文本的處理問(wèn)題上,卻需要占據(jù)大量計(jì)算資源,導(dǎo)致模型訓(xùn)練成本提高。

近日,由 Google、劍橋大學(xué)、DeepMind 和艾倫·圖靈研究院(Alan Turing Institute)的研究人員組成的團(tuán)隊(duì)基于正交隨機(jī)特征的快速注意力(Fast Attention Via Positive Orthogonal Random Features,F(xiàn)AVOR+)機(jī)制,提出了一種新的 Transformer 模型——Performer。相比于 Transformer 模型,新模型無(wú)需做出過(guò)度調(diào)整就可以變得更加高效和節(jié)能。

Performer 模型的技術(shù)突破

2017 年,谷歌大腦(Google Brain)的 Ashish Vaswani 等人發(fā)表了一篇題為 “Attention Is All You Need” 的論文,首次提出一種基于自注意力機(jī)制的 Transformer 模型。

Transformer 模型顛覆了傳統(tǒng)神經(jīng)網(wǎng)絡(luò)的架構(gòu),彌補(bǔ)了卷積神經(jīng)網(wǎng)絡(luò)(CNN)和遞歸神經(jīng)網(wǎng)絡(luò)(RNN)存在的不足,在語(yǔ)義特征提取、長(zhǎng)距離特征捕獲、任務(wù)綜合特征抽取等自然語(yǔ)言處理方面表現(xiàn)出了更優(yōu)的性能,在自然語(yǔ)言處理、人機(jī)對(duì)話、圖像處理等許多領(lǐng)域都達(dá)到了當(dāng)時(shí)最好的水平(SOTA)。

Transformer 架構(gòu)的核心模塊是自注意力模塊,模型在處理每個(gè)單詞(輸入序列中的每個(gè)位置)時(shí),自注意力模塊通過(guò)計(jì)算輸入序列中所有位置對(duì)的相似度分?jǐn)?shù),來(lái)尋找能夠幫助更好地編碼該單詞的線索。

然而,隨著輸入序列長(zhǎng)度的增加,模型需要二次方的計(jì)算時(shí)間來(lái)產(chǎn)生所有相似度分?jǐn)?shù),所需計(jì)算內(nèi)存也隨之增加,注意力機(jī)制面臨的效率問(wèn)題也越來(lái)越突出。

針對(duì)那些需要長(zhǎng)距離關(guān)注的應(yīng)用,在 Transformer 基礎(chǔ)上已經(jīng)有一些研究者提出了幾種快速的、空間利用率高的改進(jìn)方法,但是大部分常見(jiàn)方法都依賴于稀疏注意力機(jī)制。

然而,稀疏注意力機(jī)制仍存在一定的局限性。

(1)它們需要高效的稀疏矩陣乘法運(yùn)算,而這些運(yùn)算并不是在所有加速器上都能實(shí)現(xiàn)的;(2)它們通常不能為其表示能力提供嚴(yán)格的理論保證;(3)它們主要針對(duì) Transformer 模型和生成式預(yù)訓(xùn)練進(jìn)行優(yōu)化;(4)它們通常會(huì)疊加更多的注意力層來(lái)補(bǔ)償稀疏表示,這使得它們很難與其他預(yù)訓(xùn)練模型一起使用,因此需要重新訓(xùn)練并消耗大量能量。

此外,稀疏注意機(jī)制通常仍然不足以解決常規(guī)注意方法應(yīng)用的全部問(wèn)題,如指針網(wǎng)絡(luò)。還有一些運(yùn)算不能被稀疏化,如在工業(yè)級(jí)推薦系統(tǒng)中被大量應(yīng)用的 softmax 運(yùn)算。

Performer 使用了一個(gè)高效的(線性)廣義注意力框架,能夠?qū)ΤR?guī)(softmax)全階注意力進(jìn)行可證明的、準(zhǔn)確的、實(shí)用的估計(jì),不依賴于任何稀疏性或低階等先驗(yàn)條件,從而實(shí)現(xiàn)更快的訓(xùn)練速度,同時(shí)允許模型處理更長(zhǎng)的序列,這一特性恰恰滿足了 ImageNet64 圖像數(shù)據(jù)集和PG-19文本數(shù)據(jù)集的要求。

Performer 模型通過(guò)正交隨機(jī)特征(FAVOR+)算法實(shí)現(xiàn)快速注意力機(jī)制,并改用 Positive Orthogonal Random Features 估計(jì) softmax 和高斯核函數(shù),以實(shí)現(xiàn)在 FAVOR+ 機(jī)制中對(duì)常規(guī) softmax 注意力進(jìn)行魯棒且無(wú)偏的估計(jì)。

研究人員表示:“Performer 是第一個(gè)通過(guò)微調(diào)可以與常規(guī) Transformers 進(jìn)行完全兼容的線性架構(gòu)”。

左圖 | 原點(diǎn)對(duì)稱的通用函數(shù) r(定義為建立在:三角隨機(jī)特征和正隨機(jī)特征上的估計(jì)器的均方誤差(MSEs)的比值)是輸入特征向量與其長(zhǎng)度l之間的角度 φ(以弧度為單位)的函數(shù), 函數(shù)的數(shù)值越大表示正隨機(jī)特征性能越好的(φ,l)空間區(qū)域;

右圖 | 當(dāng)l為定值 1 時(shí),與變化的角度 φ 構(gòu)成的函數(shù) r 為正切函數(shù);右上角 | 比較低 softmax 內(nèi)核值區(qū)域中兩個(gè)估算器的 MSE。

作者通過(guò)比較發(fā)現(xiàn),對(duì)于 φ 足夠大的臨界區(qū)域,該方法所使用的正交隨機(jī)特征比任意的三角隨機(jī)特征更精確。

圖| 我們將原始的經(jīng)過(guò)預(yù)訓(xùn)練的 Transformer 的權(quán)重轉(zhuǎn)移到 Performer 中,Performer 產(chǎn)的精度達(dá)到 0.07 (橙色虛線),但在原來(lái)的梯度步數(shù)的一小部分中,很快就恢復(fù)了精度。然而在 PG-19 上,三角法(TRIG) softmax 逼近變得非常不穩(wěn)定,而正特征(POS)(不重繪)和 Linformer (也是逼近 softmax)即使在重繪投影的情況下,也會(huì)在同樣的復(fù)雜度中趨于平穩(wěn)。具有特征重繪的正 softmax 是匹配 Transformer 的必要條件,SMREG 可實(shí)現(xiàn)更快的收斂。

這篇論文利用詳細(xì)的數(shù)學(xué)定理,證明了與其單純依靠計(jì)算資源來(lái)提升性能,還不如開(kāi)發(fā)出改進(jìn)的、高效的 Transformer 架構(gòu),來(lái)顯著降低能耗。同時(shí),由于 Performers 使用了與 Transformer 相同的訓(xùn)練超參數(shù),也可以有效訓(xùn)練基于 softmax 的線性 Transformer。因此 FAVOR+ 機(jī)制可以作為一個(gè)簡(jiǎn)單的插件,而無(wú)需進(jìn)行過(guò)多的調(diào)整。

Performer 模型應(yīng)用前景廣泛

研究人員表示,Performer 模型的提出,顯著降低了常規(guī) Transformer 的空間和時(shí)間復(fù)雜度,并在 Transformer 的研究以及非稀疏注意機(jī)制的作用方面開(kāi)辟了新的途徑。

該論文利用詳細(xì)的數(shù)學(xué)定理,證明了與其單純依靠計(jì)算資源來(lái)提升性能,還不如開(kāi)發(fā)出改進(jìn)的、高效的 Transformer 架構(gòu),來(lái)顯著降低能耗。同時(shí),由于 Performers 使用了與 Transformer 相同的訓(xùn)練超參數(shù),因此 FAVOR+ 機(jī)制可以作為一個(gè)簡(jiǎn)單的插件,而無(wú)需進(jìn)行過(guò)多的調(diào)整。

該團(tuán)隊(duì)在一系列豐富的場(chǎng)景下測(cè)試了 Performers 的性能,執(zhí)行的任務(wù)包括像素預(yù)測(cè)、蛋白質(zhì)序列建模。在實(shí)驗(yàn)設(shè)置中,一個(gè) Performer 只用 FAVOR+ 機(jī)制取代了常規(guī) Transformer 的注意力組件。

在使用蛋白質(zhì)序列訓(xùn)練一個(gè) 36 層模型的挑戰(zhàn)性任務(wù)上,基于 Performer 的模型(Performer-RELU)的性能優(yōu)于基線 Transformer 模型:Reformer 和 Linformer,后者的準(zhǔn)確率顯著下降。

在標(biāo)準(zhǔn)的 ImageNet64 基準(zhǔn)上,具有 6 層的 Performer 與具有 12 層的 Reformer 的準(zhǔn)確性相當(dāng)。優(yōu)化后,Performer 的速度達(dá)到了 Reformer 的兩倍。

研究人員表示,由于基于 Performer 的可擴(kuò)展 Transformer 架構(gòu)可以處理更長(zhǎng)的序列,而不受注意力機(jī)制結(jié)構(gòu)的限制,同時(shí)保持準(zhǔn)確和魯棒性,相信它們可以在生物信息學(xué)領(lǐng)域帶來(lái)新的突破,如蛋白質(zhì)的語(yǔ)言建模等技術(shù)已經(jīng)顯示出強(qiáng)大的潛力。

責(zé)任編輯:xj

聲明:本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 谷歌
    +關(guān)注

    關(guān)注

    27

    文章

    6203

    瀏覽量

    106094
  • Transformer
    +關(guān)注

    關(guān)注

    0

    文章

    146

    瀏覽量

    6056
  • 自然語(yǔ)言
    +關(guān)注

    關(guān)注

    1

    文章

    291

    瀏覽量

    13407
  • nlp
    nlp
    +關(guān)注

    關(guān)注

    1

    文章

    489

    瀏覽量

    22119
收藏 人收藏

    評(píng)論

    相關(guān)推薦

    如何使用MATLAB構(gòu)建Transformer模型

    LanguageProcessing, NLP)中的序列到序列任務(wù),如機(jī)器翻譯。Transformer 通過(guò)引入自注意力機(jī)制使得處理長(zhǎng)距離依賴關(guān)系時(shí)變得高效。因此 Vaswani 等人的論文強(qiáng)調(diào)“注意力是所需的一切”。
    的頭像 發(fā)表于 02-06 10:21 ?586次閱讀
    如何使用MATLAB構(gòu)建<b class='flag-5'>Transformer</b>模型

    Transformer模型的具體應(yīng)用

    如果想在 AI 領(lǐng)域引領(lǐng)一輪新浪潮,就需要使用到 Transformer。
    的頭像 發(fā)表于 11-20 09:28 ?693次閱讀
    <b class='flag-5'>Transformer</b>模型的具體應(yīng)用

    Transformer模型能夠做什么

    盡管名為 Transformer,但它們不是電視銀幕上的變形金剛,也不是電線桿上垃圾桶大小的變壓器。
    的頭像 發(fā)表于 11-20 09:27 ?468次閱讀
    <b class='flag-5'>Transformer</b>模型能夠做什么

    Snapchat聊天機(jī)器人集成谷歌Gemini技術(shù)

    Snap與谷歌云的戰(zhàn)略合作升級(jí),為Snapchat平臺(tái)注入了新的智能活力。雙方宣布,Snapchat的My AI聊天機(jī)器人將深度集成谷歌Gemini技術(shù),這一創(chuàng)新舉措標(biāo)志著Snapc
    的頭像 發(fā)表于 09-25 14:51 ?337次閱讀

    優(yōu)惠升級(jí),華秋PCB首單最高立減100元,返2000元優(yōu)惠券

    優(yōu)惠升級(jí),華秋PCB首單最高立減100元,返2000元優(yōu)惠券
    的頭像 發(fā)表于 08-30 12:06 ?445次閱讀
    優(yōu)惠<b class='flag-5'>再</b><b class='flag-5'>升級(jí)</b>,華秋PCB首單最高立減100元,<b class='flag-5'>再</b>返2000元優(yōu)惠券

    Transformer能代替圖神經(jīng)網(wǎng)絡(luò)嗎

    Transformer作為一種在處理序列數(shù)據(jù)方面表現(xiàn)出色的深度學(xué)習(xí)模型,自其提出以來(lái),已經(jīng)在自然語(yǔ)言處理(NLP)、時(shí)間序列分析等領(lǐng)域取得了顯著的成果。然而,關(guān)于Transformer是否能完全代替圖神經(jīng)網(wǎng)絡(luò)(GNN)的問(wèn)題,需
    的頭像 發(fā)表于 07-12 14:07 ?547次閱讀

    Transformer語(yǔ)言模型簡(jiǎn)介與實(shí)現(xiàn)過(guò)程

    在自然語(yǔ)言處理(NLP)領(lǐng)域,Transformer模型以其卓越的性能和廣泛的應(yīng)用前景,成為了近年來(lái)最引人注目的技術(shù)之一。Transformer模型由谷歌在2017年提出,并首次應(yīng)用于
    的頭像 發(fā)表于 07-10 11:48 ?2123次閱讀

    Transformer架構(gòu)在自然語(yǔ)言處理中的應(yīng)用

    隨著人工智能技術(shù)的飛速發(fā)展,自然語(yǔ)言處理(NLP)領(lǐng)域取得了顯著的進(jìn)步。其中,Transformer架構(gòu)的提出,為NLP領(lǐng)域帶來(lái)了革命性的變革。本文將深入探討Transformer架構(gòu)
    的頭像 發(fā)表于 07-09 11:42 ?976次閱讀

    nlp邏輯層次模型的特點(diǎn)

    NLP(自然語(yǔ)言處理)邏輯層次模型是一種用于理解和生成自然語(yǔ)言文本的計(jì)算模型。它將自然語(yǔ)言文本分解為不同的層次,以便于計(jì)算機(jī)更好地處理和理解。以下是對(duì)NLP邏輯層次模型特點(diǎn)的分析: 詞匯層次 詞匯
    的頭像 發(fā)表于 07-09 10:39 ?473次閱讀

    nlp神經(jīng)語(yǔ)言和NLP自然語(yǔ)言的區(qū)別和聯(lián)系

    神經(jīng)語(yǔ)言(Neuro-Linguistic Programming,NLP) 神經(jīng)語(yǔ)言是一種心理學(xué)方法,它研究人類思維、語(yǔ)言和行為之間的關(guān)系。NLP的核心理念是,我們可以通過(guò)改變我們的思維方式和語(yǔ)言
    的頭像 發(fā)表于 07-09 10:35 ?868次閱讀

    nlp自然語(yǔ)言處理框架有哪些

    自然語(yǔ)言處理(Natural Language Processing,簡(jiǎn)稱NLP)是計(jì)算機(jī)科學(xué)和人工智能領(lǐng)域的一個(gè)重要分支,它致力于使計(jì)算機(jī)能夠理解和處理人類語(yǔ)言。隨著技術(shù)的發(fā)展,NLP領(lǐng)域出現(xiàn)了
    的頭像 發(fā)表于 07-09 10:28 ?632次閱讀

    什么是自然語(yǔ)言處理 (NLP)

    自然語(yǔ)言處理(Natural Language Processing, NLP)是人工智能領(lǐng)域中的一個(gè)重要分支,它專注于構(gòu)建能夠理解和生成人類語(yǔ)言的計(jì)算機(jī)系統(tǒng)。NLP的目標(biāo)是使計(jì)算機(jī)能夠像人類一樣
    的頭像 發(fā)表于 07-02 18:16 ?1355次閱讀

    使用PyTorch搭建Transformer模型

    Transformer模型自其問(wèn)世以來(lái),在自然語(yǔ)言處理(NLP)領(lǐng)域取得了巨大的成功,并成為了許多先進(jìn)模型(如BERT、GPT等)的基礎(chǔ)。本文將深入解讀如何使用PyTorch框架搭建Transformer模型,包括模型的結(jié)構(gòu)、訓(xùn)
    的頭像 發(fā)表于 07-02 11:41 ?1895次閱讀

    谷歌大型模型終于開(kāi)放源代碼,遲到但重要的開(kāi)源戰(zhàn)略

    在人工智能領(lǐng)域,谷歌可以算是開(kāi)源的鼻祖。今天幾乎所有的大語(yǔ)言模型,都基于谷歌在 2017 年發(fā)布的 Transformer 論文;谷歌的發(fā)布的 BERT、T5,都是最早的一批開(kāi)源 AI
    發(fā)表于 02-22 18:14 ?523次閱讀
    <b class='flag-5'>谷歌</b>大型模型終于開(kāi)放源代碼,遲到但重要的開(kāi)源戰(zhàn)略

    基于Transformer模型的壓縮方法

    基于Transformer架構(gòu)的大型模型在人工智能領(lǐng)域中發(fā)揮著日益重要的作用,特別是在自然語(yǔ)言處理(NLP)和計(jì)算機(jī)視覺(jué)(CV)領(lǐng)域。
    的頭像 發(fā)表于 02-22 16:27 ?731次閱讀
    基于<b class='flag-5'>Transformer</b>模型的壓縮方法
    主站蜘蛛池模板: 午夜毛片免费看 | 亚洲欧美精品成人久久91 | 国产高清a | 午夜伦y4480影院中文字幕 | 欧美一区二区三区男人的天堂 | 久久国产精品免费 | 黑人影院 | 欧美性猛交xxxx免费 | 欧美天堂在线视频 | 成年人色网站 | 欧美人成网站免费大全 | 成 人 黄 色视频免费播放 | 午夜寂寞影院视频观看 | 午夜看黄 | 国产怡红院 | 天天摸天天舔天天操 | 中文字幕在线色 | 亚洲人成在线精品不卡网 | 丁香综合网 | 精品一区二区三区免费爱 | 午夜精品久久久久久99热7777 | 欧美激情片网站 | 久久伊人精品青青草原高清 | 亚洲伊人久久在 | 黄色网免费观看 | 日本不卡专区 | 欧美色欧美亚洲高清在线视频 | 2017天天天天做夜夜夜做 | 久久久噜久噜久久综合 | 国产成人教育视频在线观看 | 韩国男女无遮挡高清性视频 | 久久777国产线看观看精品卜 | 五月丁香| 欧洲综合网 | 成人亚洲网站www在线观看 | 国产精品福利视频手机免费观看 | 毛片基地在线 | 一区二区三区视频在线观看 | 91在线网址| 免费男女视频 | 1024成人|