在线观看www成人影院-在线观看www日本免费网站-在线观看www视频-在线观看操-欧美18在线-欧美1级

0
  • 聊天消息
  • 系統消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發帖/加入社區
會員中心
創作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

人工智能的強化學習要點

汽車玩家 ? 來源:今日頭條 ? 作者:聞數起舞 ? 2020-05-04 18:14 ? 次閱讀

了解強化學習的要點!

強化學習(RL)是現代人工智能領域中最熱門的研究主題之一,其普及度還在不斷增長。 讓我們看一下開始學習RL需要了解的5件事。

1.什么是強化學習? 與其他機器學習技術相比有何不同?

強化學習(RL)是一種機器學習技術,使代理能夠使用自身行為和經驗的反饋,通過反復試驗,在交互式環境中學習。

人工智能的強化學習要點

盡管監督學習和強化學習都使用輸入和輸出之間的映射,但不同于監督學習,后者提供給代理的反饋是執行任務的正確動作集,而強化學習則將獎懲作為正面和負面行為的信號

與無監督學習相比,強化學習在目標方面有所不同。 無監督學習的目標是發現數據點之間的相似點和差異,而在強化學習的情況下,目標是找到合適的行為模型,以最大化代理的總累積獎勵。 下圖說明了通用RL模型的動作獎勵反饋回路。

人工智能的強化學習要點

2.如何制定基本的強化學習問題?

描述RL問題基本要素的一些關鍵術語是:

環境-代理在其中運行的物理世界

狀態—代理的現狀

獎勵-來自環境的反饋

策略-將代理狀態映射到操作的方法

價值-代理在特定狀態下采取的行動將獲得的未來獎勵

RL問題可以通過游戲來最好地解釋。 讓我們以吃豆人的游戲為例,代理人(PacMan)的目標是在網格中吃食物,同時避免途中出現鬼魂。 在這種情況下,網格世界是代理所作用的交互式環境。 如果特工被幽靈殺死(輸掉了游戲),代理會得到食物和懲罰的獎勵。 狀態是代理在網格世界中的位置,總累積獎勵是贏得比賽的代理。

人工智能的強化學習要點

為了建立最佳政策,代理面臨探索新狀態的困境,同時又要最大化其整體回報。 這稱為"探索與利用"的權衡。 為了平衡兩者,最佳的整體策略可能涉及短期犧牲。 因此,代理應收集足夠的信息,以便將來做出最佳的總體決策。

馬爾可夫決策過程(MDP)是描述RL環境的數學框架,幾乎所有RL問題都可以使用MDP來表述。 一個MDP由一組有限的環境狀態S,在每個狀態下的一組可能的動作A,一個實值獎勵函數R和一個過渡模型P(s',s | a)組成。 但是,現實環境更可能缺少任何有關環境動力學的先驗知識。 在這種情況下,無模型RL方法非常方便。

Q學習是一種常用的無模型方法,可用于構建自播放的PacMan代理。 它圍繞更新Q值的概念展開,Q值表示在狀態s中執行動作a的值。 以下值更新規則是Q學習算法的核心。

人工智能的強化學習要點

3.什么是最常用的強化學習算法?

Q學習和SARSA(狀態行動-獎勵狀態行動)是兩種常用的無模型RL算法。 它們的探索策略不同,而利用策略卻相似。 Q學習是一種非策略方法,其中代理根據從另一個策略得出的操作a *學習值,而SARSA是一種策略上方法,在其中根據其當前操作a從當前策略得出的值來學習值。 政策。 這兩種方法易于實現,但缺乏通用性,因為它們無法估計未見狀態的值。

可以通過更高級的算法(例如使用神經網絡來估計Q值的深度Q網絡(DQN))來克服這一問題。 但是DQN只能處理離散的低維動作空間。

深度確定性策略梯度(DDPG)是一種無模型,脫離策略,對執行者敏感的算法,它通過在高維連續動作空間中學習策略來解決此問題。 下圖是評論體系結構的表示。

人工智能的強化學習要點

4.強化學習的實際應用是什么?

由于RL需要大量數據,因此最適用于容易獲得模擬數據(例如游戲性,機器人技術)的領域。

RL被廣泛用于構建用于玩計算機游戲的AI。 AlphaGo Zero是第一個在古代中國的圍棋游戲中擊敗世界冠軍的計算機程序。 其他包括ATARI游戲,西洋雙陸棋等

在機器人技術和工業自動化中,RL用于使機器人能夠為其自身創建高效的自適應控制系統,該系統可以從自身的經驗和行為中學習。 DeepMind的"通過異步策略更新進行機器人操縱的深度強化學習"就是一個很好的例子。 觀看這個有趣的演示視頻

RL的其他應用包括抽象文本摘要引擎,對話代理(文本,語音),這些代理可以從用戶的交互中學習并隨著時間的流逝而改善,學習醫療保健中的最佳治療策略,以及用于在線股票交易的基于RL的代理。

5.我如何開始進行強化學習?

為了理解RL的基本概念,可以參考以下資源。

《強化學習-入門》,是強化學習之父的一本書-理查德·薩頓(Richard Sutton)和他的博士生導師安德魯·巴托(Andrew Barto)。 這本書的在線草稿可以在這里找到。

David Silver的教學材料(包括視頻講座)是有關RL的入門課程。

Pieter Abbeel和John Schulman(開放式AI /伯克利AI研究實驗室)的另一本有關RL的技術教程

對于開始構建和測試RL代理,以下資源可能會有所幫助。

博客介紹了如何使用來自原始像素的Policy Gradients訓練神經網絡ATARI Pong代理,Andrej Karpathy將幫助您在130行Python代碼中啟動并運行您的第一個Deep Reinforcement Learning代理。

·DeepMind Lab是一個類似于開放源代碼的3D游戲平臺,用于具有豐富模擬環境的基于代理的AI研究。

馬爾默項目是另一個支持AI基礎研究的AI實驗平臺。

OpenAI Gym是用于構建和比較強化學習算法的工具包。

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規問題,請聯系本站處理。 舉報投訴
  • 人工智能
    +關注

    關注

    1804

    文章

    48449

    瀏覽量

    245078
  • 強化學習
    +關注

    關注

    4

    文章

    269

    瀏覽量

    11477
收藏 人收藏

    評論

    相關推薦

    人工智能和機器學習以及Edge AI的概念與應用

    人工智能相關各種技術的概念介紹,以及先進的Edge AI(邊緣人工智能)的最新發展與相關應用。 人工智能和機器學習是現代科技的核心技術 人工智能
    的頭像 發表于 01-25 17:37 ?699次閱讀
    <b class='flag-5'>人工智能</b>和機器<b class='flag-5'>學習</b>以及Edge AI的概念與應用

    嵌入式和人工智能究竟是什么關系?

    領域,如工業控制、智能家居、醫療設備等。 人工智能是計算機科學的一個分支,它研究如何使計算機具備像人類一樣思考、學習、推理和決策的能力。人工智能的發展歷程可以追溯到上世紀50年代,經
    發表于 11-14 16:39

    如何使用 PyTorch 進行強化學習

    的計算圖和自動微分功能,非常適合實現復雜的強化學習算法。 1. 環境(Environment) 在強化學習中,環境是一個抽象的概念,它定義了智能體(agent)可以執行的動作(actions)、觀察到
    的頭像 發表于 11-05 17:34 ?767次閱讀

    人工智能、機器學習和深度學習存在什么區別

    人工智能指的是在某種程度上顯示出類似人類智能的設備。AI有很多技術,但其中一個很大的子集是機器學習——讓算法從數據中學習
    發表于 10-24 17:22 ?2677次閱讀
    <b class='flag-5'>人工智能</b>、機器<b class='flag-5'>學習</b>和深度<b class='flag-5'>學習</b>存在什么區別

    《AI for Science:人工智能驅動科學創新》第6章人AI與能源科學讀后感

    、優化等方面的應用有了更清晰的認識。特別是書中提到的基于大數據和機器學習的能源管理系統,通過實時監測和分析能源數據,實現了能源的高效利用和智能化管理。 其次,第6章通過多個案例展示了人工智能在能源科學中
    發表于 10-14 09:27

    《AI for Science:人工智能驅動科學創新》第一章人工智能驅動的科學創新學習心得

    ,無疑為讀者鋪設了一條探索人工智能(AI)如何深刻影響并推動科學創新的道路。在閱讀這一章后,我深刻感受到了人工智能技術在科學領域的廣泛應用潛力以及其帶來的革命性變化,以下是我個人的學習心得: 1.
    發表于 10-14 09:12

    risc-v在人工智能圖像處理應用前景分析

    人工智能推薦系統中強大的圖形處理器(GPU)一爭高下。其獨特的設計使得該處理器在功耗受限的條件下仍能實現高性能的圖像處理任務。 Ceremorphic公司 :該公司開發的分層學習處理器結合了
    發表于 09-28 11:00

    人工智能ai4s試讀申請

    目前人工智能在繪畫對話等大模型領域應用廣闊,ai4s也是方興未艾。但是如何有效利用ai4s工具助力科研是個需要研究的課題,本書對ai4s基本原理和原則,方法進行描訴,有利于總結經驗,擬按照要求準備相關體會材料。看能否有助于入門和提高ss
    發表于 09-09 15:36

    名單公布!【書籍評測活動NO.44】AI for Science:人工智能驅動科學創新

    ! 《AI for Science:人工智能驅動科學創新》 這本書便將為讀者徐徐展開AI for Science的美麗圖景,與大家一起去了解: 人工智能究竟幫科學家做了什么? 人工智能將如何改變我們所生
    發表于 09-09 13:54

    人工智能如何強化智能家居設備的功能

    ,以配合用戶的生活習慣與作息。本文將為您介紹人工智能將如何強化智能家居設備的功能,以及由芯科科技(Silicon Labs)所推出的解決方案,將如何增進智能家居設備的功能性與安全性。
    的頭像 發表于 08-27 10:46 ?1211次閱讀
    <b class='flag-5'>人工智能</b>如何<b class='flag-5'>強化</b><b class='flag-5'>智能</b>家居設備的功能

    報名開啟!深圳(國際)通用人工智能大會將啟幕,國內外大咖齊聚話AI

    8月28日至30日,2024深圳(國際)通用人工智能大會暨深圳(國際)通用人工智能產業博覽會將在深圳國際會展中心(寶安)舉辦。大會以“魅力AI·無限未來”為主題,致力于打造全球通用人工智能領域集產品
    發表于 08-22 15:00

    FPGA在人工智能中的應用有哪些?

    FPGA(現場可編程門陣列)在人工智能領域的應用非常廣泛,主要體現在以下幾個方面: 一、深度學習加速 訓練和推理過程加速:FPGA可以用來加速深度學習的訓練和推理過程。由于其高并行性和低延遲特性
    發表于 07-29 17:05

    人工智能、機器學習和深度學習是什么

    在科技日新月異的今天,人工智能(Artificial Intelligence, AI)、機器學習(Machine Learning, ML)和深度學習(Deep Learning, DL)已成為
    的頭像 發表于 07-03 18:22 ?2240次閱讀

    通過強化學習策略進行特征選擇

    更快更好地學習。我們的想法是找到最優數量的特征和最有意義的特征。在本文中,我們將介紹并實現一種新的通過強化學習策略的特征選擇。我們先討論強化學習,尤其是馬爾可夫決策
    的頭像 發表于 06-05 08:27 ?549次閱讀
    通過<b class='flag-5'>強化學習</b>策略進行特征選擇

    5G智能物聯網課程之Aidlux下人工智能開發(SC171開發套件V2)

    https://t.elecfans.com/v/25653.html 人工智能 初學者完整學習流程實現手寫數字識別案例_Part1 13分59秒 https://t.elecfans.com/v
    發表于 05-10 16:46
    主站蜘蛛池模板: 国产手机看片 | 精品久久看| 亚洲成在线 | 久久精品男人的天堂 | 免费观看成人毛片 | 国产人成午夜免视频网站 | 中国一级特黄aa毛片大片 | 免费观看在线永久免费xx视频 | 免费看片免费播放 | 午夜影院网站 | 国产免费高清视频在线观看不卡 | 日韩 ed2k| 夜色福利久久久久久777777 | 国产一区中文字幕在线观看 | a成人在线 | 五月婷婷丁香综合 | 国模娜娜扒开嫩木耳 | 午夜性影院 | 国产成人综合自拍 | 一级一黄在线观看视频免费 | 久久综合久久精品 | 性感美女福利视频 | 男男h啪肉np文总受 男男h全肉耽污 | 国内a级毛片免费··· | 亚洲欧美视频网站 | 99热国内精品 | 国产色爽女 | 午夜国产高清精品一区免费 | 免费人成网站线观看合集 | 一本大道一卡二卡 | 国产精品视频网站你懂得 | 三级视频网站 | 久久夜靖品| 天天色色网 | 亚洲免费成人 | 狠狠色丁香久久婷婷综 | 深夜视频在线免费 | 色婷婷六月桃花综合影院 | 三级视频网站在线观看 | 黄色大片在线免费观看 | 末发育娇小性色xxxxx视频 |