91在线观看视频-91在线观看视频-91在线观看免费视频-91在线观看免费-欧美第二页-欧美第1页

0
  • 聊天消息
  • 系統消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發帖/加入社區
會員中心
創作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

NLP:谷歌Transformer再升級

ss ? 來源:學術頭條 ? 作者:學術頭條 ? 2020-11-06 17:31 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

當我們在翻譯軟件上輸入 “Transformer is a novel neural network architecture based on a self-attention mechanism” 后,計算機就可以迅速將它翻譯為 “Transformer 是一種基于自注意力機制的新型神經網絡架構”,神奇的機器翻譯使得多語種互譯成為可能。

近年來,得益于機器學習的快速發展,自然語言處理(NLP)技術不斷突破,在人機交互、在線翻譯工具等領域的應用層出不窮,不同語種的人與人、人與機器之間的無障礙自由交流得以實現。

當前的主流機器翻譯主要是基于神經網絡機器翻譯,這類方法是一個 “編碼器-解碼器”(encoder-decoder)架構的系統,編碼器對源語言序列進行編碼,并提取信息,然后通過解碼器把信息轉換為目標語言,完成語言翻譯過程。

自 2017 年問世以來,基于“編碼器-解碼器”架構設計的 Transformer 模型憑借其優越的性能,已然成為機器翻譯領域的主流模型,在深度學習領域產生了巨大影響。

然而,Transformer 模型并非完美,模型引入self-attention機制雖實現了快速并行的訓練,但在長序列文本的處理問題上,卻需要占據大量計算資源,導致模型訓練成本提高。

近日,由 Google、劍橋大學、DeepMind 和艾倫·圖靈研究院(Alan Turing Institute)的研究人員組成的團隊基于正交隨機特征的快速注意力(Fast Attention Via Positive Orthogonal Random Features,FAVOR+)機制,提出了一種新的 Transformer 模型——Performer。相比于 Transformer 模型,新模型無需做出過度調整就可以變得更加高效和節能。

Performer 模型的技術突破

2017 年,谷歌大腦(Google Brain)的 Ashish Vaswani 等人發表了一篇題為 “Attention Is All You Need” 的論文,首次提出一種基于自注意力機制的 Transformer 模型。

Transformer 模型顛覆了傳統神經網絡的架構,彌補了卷積神經網絡(CNN)和遞歸神經網絡(RNN)存在的不足,在語義特征提取、長距離特征捕獲、任務綜合特征抽取等自然語言處理方面表現出了更優的性能,在自然語言處理、人機對話、圖像處理等許多領域都達到了當時最好的水平(SOTA)。

Transformer 架構的核心模塊是自注意力模塊,模型在處理每個單詞(輸入序列中的每個位置)時,自注意力模塊通過計算輸入序列中所有位置對的相似度分數,來尋找能夠幫助更好地編碼該單詞的線索。

然而,隨著輸入序列長度的增加,模型需要二次方的計算時間來產生所有相似度分數,所需計算內存也隨之增加,注意力機制面臨的效率問題也越來越突出。

針對那些需要長距離關注的應用,在 Transformer 基礎上已經有一些研究者提出了幾種快速的、空間利用率高的改進方法,但是大部分常見方法都依賴于稀疏注意力機制。

然而,稀疏注意力機制仍存在一定的局限性。

(1)它們需要高效的稀疏矩陣乘法運算,而這些運算并不是在所有加速器上都能實現的;(2)它們通常不能為其表示能力提供嚴格的理論保證;(3)它們主要針對 Transformer 模型和生成式預訓練進行優化;(4)它們通常會疊加更多的注意力層來補償稀疏表示,這使得它們很難與其他預訓練模型一起使用,因此需要重新訓練并消耗大量能量。

此外,稀疏注意機制通常仍然不足以解決常規注意方法應用的全部問題,如指針網絡。還有一些運算不能被稀疏化,如在工業級推薦系統中被大量應用的 softmax 運算。

Performer 使用了一個高效的(線性)廣義注意力框架,能夠對常規(softmax)全階注意力進行可證明的、準確的、實用的估計,不依賴于任何稀疏性或低階等先驗條件,從而實現更快的訓練速度,同時允許模型處理更長的序列,這一特性恰恰滿足了 ImageNet64 圖像數據集和PG-19文本數據集的要求。

Performer 模型通過正交隨機特征(FAVOR+)算法實現快速注意力機制,并改用 Positive Orthogonal Random Features 估計 softmax 和高斯核函數,以實現在 FAVOR+ 機制中對常規 softmax 注意力進行魯棒且無偏的估計。

研究人員表示:“Performer 是第一個通過微調可以與常規 Transformers 進行完全兼容的線性架構”。

左圖 | 原點對稱的通用函數 r(定義為建立在:三角隨機特征和正隨機特征上的估計器的均方誤差(MSEs)的比值)是輸入特征向量與其長度l之間的角度 φ(以弧度為單位)的函數, 函數的數值越大表示正隨機特征性能越好的(φ,l)空間區域;

右圖 | 當l為定值 1 時,與變化的角度 φ 構成的函數 r 為正切函數;右上角 | 比較低 softmax 內核值區域中兩個估算器的 MSE。

作者通過比較發現,對于 φ 足夠大的臨界區域,該方法所使用的正交隨機特征比任意的三角隨機特征更精確。

圖| 我們將原始的經過預訓練的 Transformer 的權重轉移到 Performer 中,Performer 產的精度達到 0.07 (橙色虛線),但在原來的梯度步數的一小部分中,很快就恢復了精度。然而在 PG-19 上,三角法(TRIG) softmax 逼近變得非常不穩定,而正特征(POS)(不重繪)和 Linformer (也是逼近 softmax)即使在重繪投影的情況下,也會在同樣的復雜度中趨于平穩。具有特征重繪的正 softmax 是匹配 Transformer 的必要條件,SMREG 可實現更快的收斂。

這篇論文利用詳細的數學定理,證明了與其單純依靠計算資源來提升性能,還不如開發出改進的、高效的 Transformer 架構,來顯著降低能耗。同時,由于 Performers 使用了與 Transformer 相同的訓練超參數,也可以有效訓練基于 softmax 的線性 Transformer。因此 FAVOR+ 機制可以作為一個簡單的插件,而無需進行過多的調整。

Performer 模型應用前景廣泛

研究人員表示,Performer 模型的提出,顯著降低了常規 Transformer 的空間和時間復雜度,并在 Transformer 的研究以及非稀疏注意機制的作用方面開辟了新的途徑。

該論文利用詳細的數學定理,證明了與其單純依靠計算資源來提升性能,還不如開發出改進的、高效的 Transformer 架構,來顯著降低能耗。同時,由于 Performers 使用了與 Transformer 相同的訓練超參數,因此 FAVOR+ 機制可以作為一個簡單的插件,而無需進行過多的調整。

該團隊在一系列豐富的場景下測試了 Performers 的性能,執行的任務包括像素預測、蛋白質序列建模。在實驗設置中,一個 Performer 只用 FAVOR+ 機制取代了常規 Transformer 的注意力組件。

在使用蛋白質序列訓練一個 36 層模型的挑戰性任務上,基于 Performer 的模型(Performer-RELU)的性能優于基線 Transformer 模型:Reformer 和 Linformer,后者的準確率顯著下降。

在標準的 ImageNet64 基準上,具有 6 層的 Performer 與具有 12 層的 Reformer 的準確性相當。優化后,Performer 的速度達到了 Reformer 的兩倍。

研究人員表示,由于基于 Performer 的可擴展 Transformer 架構可以處理更長的序列,而不受注意力機制結構的限制,同時保持準確和魯棒性,相信它們可以在生物信息學領域帶來新的突破,如蛋白質的語言建模等技術已經顯示出強大的潛力。

責任編輯:xj

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規問題,請聯系本站處理。 舉報投訴
  • 谷歌
    +關注

    關注

    27

    文章

    6231

    瀏覽量

    108170
  • Transformer
    +關注

    關注

    0

    文章

    151

    瀏覽量

    6522
  • 自然語言
    +關注

    關注

    1

    文章

    292

    瀏覽量

    13657
  • nlp
    nlp
    +關注

    關注

    1

    文章

    490

    瀏覽量

    22627
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關推薦
    熱點推薦

    Transformer架構中編碼器的工作流程

    編碼器是Transformer體系結構的基本組件。編碼器的主要功能是將輸入標記轉換為上下文表示。與早期獨立處理token的模型不同,Transformer編碼器根據整個序列捕獲每個token的上下文。
    的頭像 發表于 06-10 14:27 ?303次閱讀
    <b class='flag-5'>Transformer</b>架構中編碼器的工作流程

    Transformer架構概述

    由于Transformer模型的出現和快速發展,深度學習領域正在經歷一場翻天覆地的變化。這些突破性的架構不僅重新定義了自然語言處理(NLP)的標準,而且拓寬了視野,徹底改變了AI的許多方面。
    的頭像 發表于 06-10 14:24 ?348次閱讀
    <b class='flag-5'>Transformer</b>架構概述

    【性能強者升級】迅為RK3588開發板16GB+128GB高配3588核心板發布!

    【性能強者升級】迅為RK3588開發板16GB+128GB高配3588核心板發布!
    的頭像 發表于 02-20 15:22 ?1110次閱讀
    【性能強者<b class='flag-5'>再</b><b class='flag-5'>升級</b>】迅為RK3588開發板16GB+128GB高配3588核心板發布!

    如何使用MATLAB構建Transformer模型

    LanguageProcessing, NLP)中的序列到序列任務,如機器翻譯。Transformer 通過引入自注意力機制使得處理長距離依賴關系時變得高效。因此 Vaswani 等人的論文強調“注意力是所需的一切”。
    的頭像 發表于 02-06 10:21 ?4057次閱讀
    如何使用MATLAB構建<b class='flag-5'>Transformer</b>模型

    谷歌投10億美元于Anthropic,加強AI領域布局

    近日,Alphabet Inc.旗下的谷歌公司宣布,將向人工智能(AI)開發商Anthropic進一步投資10億美元。這一舉動表明,谷歌正在加大對這家頗具潛力的AI公司的支持力度,旨在提升其在新興AI領域的競爭力,以與業界巨頭OpenAI相抗衡。
    的頭像 發表于 01-23 15:20 ?557次閱讀

    谷歌投10億美元于人工智能公司Anthropic

    近日,Alphabet Inc.旗下的谷歌再度出手,向人工智能開發商Anthropic追加了10億美元的投資,進一步提升了其在這家潛力無限、有望與OpenAI展開競爭的公司中的持股比例。 據一位
    的頭像 發表于 01-23 10:57 ?638次閱讀

    transformer專用ASIC芯片Sohu說明

    2022年,我們打賭說transformer會統治世界。 我們花了兩年時間打造Sohu,這是世界上第一個用于transformer(ChatGPT中的“T”)的專用芯片。 將transformer
    的頭像 發表于 01-06 09:13 ?1160次閱讀
    <b class='flag-5'>transformer</b>專用ASIC芯片Sohu說明

    Transformer模型的具體應用

    如果想在 AI 領域引領一輪新浪潮,就需要使用到 Transformer
    的頭像 發表于 11-20 09:28 ?1572次閱讀
    <b class='flag-5'>Transformer</b>模型的具體應用

    Transformer模型能夠做什么

    盡管名為 Transformer,但它們不是電視銀幕上的變形金剛,也不是電線桿上垃圾桶大小的變壓器。
    的頭像 發表于 11-20 09:27 ?1020次閱讀
    <b class='flag-5'>Transformer</b>模型能夠做什么

    NLP技術在聊天機器人中的作用

    聊天機器人,也稱為聊天AI,是一種通過文本或語音與人類進行交流的軟件。它們廣泛應用于客戶服務、在線購物、個人助理等領域。NLP技術是實現聊天機器人智能對話能力的關鍵。 1. 理解用戶意圖 NLP技術
    的頭像 發表于 11-11 10:33 ?1036次閱讀

    自動駕駛中一直說的BEV+Transformer到底是個啥?

    在很多車企的自動駕駛介紹中,都會聽到一個關鍵技術,那就是BEV+Transformer,那BEV+Transformer到底是個啥?為什么很多車企在自動駕駛技術中都十分追捧這項技術?其實“BEV
    的頭像 發表于 11-07 11:19 ?1393次閱讀
    自動駕駛中一直說的BEV+<b class='flag-5'>Transformer</b>到底是個啥?

    谷歌開始推送Android 15穩定版

    近日,谷歌正式向Pixel系列設備推送了Android 15穩定版操作系統。目前,已有部分Pixel設備率先完成了系統升級,預計本周晚些時候,更大規模的更新推送將全面展開。
    的頭像 發表于 10-17 16:12 ?2062次閱讀

    Snapchat聊天機器人集成谷歌Gemini技術

    Snap與谷歌云的戰略合作升級,為Snapchat平臺注入了新的智能活力。雙方宣布,Snapchat的My AI聊天機器人將深度集成谷歌Gemini技術,這一創新舉措標志著Snapc
    的頭像 發表于 09-25 14:51 ?603次閱讀

    谷歌Gemini 1.5 Flash模型升級,AI聊天速度飆升50%

    谷歌近期對其Gemini AI系列進行了重大更新,推出了Gemini 1.5 Flash模型。此次升級的核心亮點在于顯著提升了AI聊天的響應速度,官方宣稱最高可達50%的增速,為用戶帶來前所未有的流暢體驗。
    的頭像 發表于 09-06 18:06 ?1264次閱讀

    優惠升級,華秋PCB首單最高立減100元,返2000元優惠券

    優惠升級,華秋PCB首單最高立減100元,返2000元優惠券
    的頭像 發表于 08-30 12:06 ?737次閱讀
    優惠<b class='flag-5'>再</b><b class='flag-5'>升級</b>,華秋PCB首單最高立減100元,<b class='flag-5'>再</b>返2000元優惠券
    主站蜘蛛池模板: 五月天精品在线 | 宅男噜噜噜66 | 欧美一卡二卡3卡4卡无卡六卡七卡科普 | 不卡精品国产_亚洲人成在线 | 天天操国产 | 天天色影 | 天天躁日日2018躁狠狠躁 | 深爱开心激情网 | 一级毛片真人免费播放视频 | 看全色黄大色大片免费 | 久操天堂| 久操视频免费观看 | 天堂在线最新版资源www | 天天在线天天在线天天影视 | 精品福利| 四虎永久免费在线 | 国产一级做a爰片久久毛片男 | 啪啪福利视频 | 色综合天天综合网看在线影院 | 交在线观看网站视频 | 黄色大片在线视频 | 极品色天使在线婷婷天堂亚洲 | 福利视频自拍偷拍 | 97人人做人人添人人爱 | 日韩欧美伦理 | 免费免播放器在线视频观看 | 午夜精品久久久久久99热7777 | 免费观看的黄色网址 | 国产裸露片段精华合集链接 | 国内视频一区二区 | 久久天天躁狠狠躁夜夜躁综合 | 国产色片| 色播欧美| 奇米欧美成人综合影院 | 中文字幕欧美成人免费 | 免费观看国产网址你懂的 | 鸥美毛片 | 色屋网 | 91网站在线播放 | 在线视频图片小说 | 天天碰视频 |