在线观看www成人影院-在线观看www日本免费网站-在线观看www视频-在线观看操-欧美18在线-欧美1级

0
  • 聊天消息
  • 系統消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發帖/加入社區
會員中心
創作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

大模型微調樣本構造的trick

深度學習自然語言處理 ? 來源:包包算法筆記 ? 2023-07-10 11:32 ? 次閱讀

開局一道面試題。

面試官:大模型微調如何組織訓練樣本?

你:大模型訓練一問一答,一指令一輸出,問題和指令可以作為prompt輸入,答案作為輸出,計算loss的部分要屏蔽掉pad token。

面試官:多輪對話如何組織訓練樣本呢?

你:假設多輪為Q1A1/Q2A2/Q3A3,那么可以轉化成 Q1—>A1, Q1A1Q2->A2, Q1A1Q2A2Q3->A3三條訓練樣本。

面試官:這樣的話一個session變成了三條數據,并且上文有依次重復的情況,這樣會不會有啥問題?

你:數據中大部分都是pad token,訓練數據利用效率低下。另外會有數據重復膨脹的問題,訓練數據重復膨脹為 session數量*平均輪次數,且上文有重復部分,訓練效率也會低下。

面試官:你也意識到了,有什么改進的方法嗎?

你:有沒有辦法能一次性構造一個session作為訓練樣本呢?(思索)

面試官:提示你下,限制在decoder-only系列的模型上,利用模型特性,改進樣本組織形式。

對于這個問題,我們思考下decoder-only模型有啥特點,第一點很關鍵的是其attention形式是casual的,casual簡單理解就是三角陣,單個token只能看到其上文的信息。

如圖所示:

c57439aa-1ece-11ee-962d-dac502259ad0.png

其二是postion_id是只有token次序含義而無需特定指代信息,(區別于GLM模型需要postion_id來標識生成span的位置等特殊的要求)。

有了這兩點我們就可以設想,如果構造多輪對話樣本的input為 Q1 A1 Q2 A2 Q3 A3 ,在計算loss的時候,只需要計算 A1 A2 和 A3 部分,豈不是就可以進行session級別的訓練了?

嗯為什么原來的chatglm不能用這種形式呢,雖然prefix attention可以推廣為適應多輪訓練的prefix attention形式,如圖:

c58d526e-1ece-11ee-962d-dac502259ad0.jpg

但是由于其postition id 無法簡單按次序推廣,故不能高效訓練,這也是chatglm初代的很大的一個問題,導致后續微調的效果都比較一般。

現在chatglm2的代碼針對這兩個問題已經進行了改善,可以認為他就是典型的decoder-only模型了,具體表現為推斷時候attention 是casual attention的形式,position id也退化為token次序增長。

那么好了,萬事具備,只欠東風。我們據此實現了chatglm2-6b的代碼微調。其核心代碼邏輯為處理樣本組織的邏輯,其他的就是大模型微調,大同小異了。

conversation=''
input_ids = []
labels = []
eos_id = tokenizer.eos_token_id
turn_idx = 0
for sentence in examples[prompt_column][i]:
    sentence_from = sentence["from"].lower()
    sentence_value = '[Round {}]

問:'.format(turn_idx) + sentence["value"] + '

答:' if sentence_from == 'human' else sentence["value"]+'

'
    conversation += sentence_value
    sentence_ids = tokenizer.encode(sentence_value, add_special_tokens=False)  
    label = copy.deepcopy(sentence_ids) if sentence_from != 'human' else [-100] * len(sentence_ids)               
    input_ids += sentence_ids 
    labels += label
    if sentence_from != 'human':
        input_ids += [eos_id]
        labels += [eos_id]
        turn_idx += 1
input_ids=tokenizer.encode('')+input_ids#addgmaskbos
labels =  [-100] * 2 + labels# #add padding
pad_len = max_seq_length - len(input_ids)
input_ids = input_ids + [eos_id] * pad_len 
labels = labels + [-100] * pad_len

其中有幾個關鍵的地方,就是在開頭要加上 bos和gmask,遵循模型原來的邏輯。問答提示詞和輪次prompt,還有兩個 保持和原模型保持一致,最后屏蔽掉pad部分的loss計算。

實測訓練效果如下:

c5c0e598-1ece-11ee-962d-dac502259ad0.jpg

同樣的數據在chatglm1上 train loss只能降到2.x左右,同時評估測試集結果,在同樣的數據上rouge等指標都有不小的提升。

我們再仔細回顧下,對話session級別訓練和拆開訓練從原理上有啥區別?

1.session級別訓練,效果之一為等價batchsize變大(1個batch可以塞下更多樣本),且同一通對話產生的樣本在一個bs內。

2. session級別的不同輪次產生的梯度是求平均的,拆開輪次構造訓練是求和的,這樣除了等價于lr會變大,還會影響不同輪次token權重的分配,另外還會影響norm的計算。

我們用一個簡化地例子定量分析下,我們假設兩條訓練樣本分為 1.問:A 答:xx 2.問: A答:xx 問: B答:xx問: C答:xx 則session級別訓練影響梯度為 (Ga+(Ga +Gb + Gc)/3)/2。對 A,B,C影響的權重分別為,2/3 1/6 1/6。 拆開訓練為(Ga+Ga+ (Ga+Gb)/2+(Ga+Gb+ Gc)/3)/4。對 A,B,C影響的權重分別為,17/24 5/24 1/12。 從上面的權重分布來看,session級別靠后的輪次影響權重要比拆開更大。這也是更合理的,因為大部分場景下,開場白都是趨同和重復的。 一點小福利,以上面試題對應的ChatGLM2-6B微調完整的代碼地址為: https://github.com/SpongebBob/Finetune-ChatGLM2-6B

實現了對于 ChatGLM2-6B 模型的全參數微調,主要改進點在多輪對話的交互組織方面,使用了更高效的session級別高效訓練,訓練效果相比原版ChatGLM-6B有較大提升。

這可能是目前全網效果最好的ChatGLM2-6B全參數微調代碼。

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規問題,請聯系本站處理。 舉報投訴
  • 數據
    +關注

    關注

    8

    文章

    7237

    瀏覽量

    90934
  • 代碼
    +關注

    關注

    30

    文章

    4886

    瀏覽量

    70206
  • 大模型
    +關注

    關注

    2

    文章

    3002

    瀏覽量

    3774

原文標題:大模型微調樣本構造的trick

文章出處:【微信號:zenRRan,微信公眾號:深度學習自然語言處理】歡迎添加關注!文章轉載請注明出處。

收藏 人收藏

    評論

    相關推薦
    熱點推薦

    西門子伺服電機簡明樣本

    西門子伺服電機簡明樣本
    發表于 04-14 15:36 ?0次下載

    請問是否有任何OpenVINO?樣本可以推斷批次大小大于1的檢測模型?

    是否有任何OpenVINO?樣本可以推斷批次大小大于 1 的檢測模型?
    發表于 03-06 07:19

    使用OpenVINO?訓練擴展對水平文本檢測模型進行微調,收到錯誤信息是怎么回事?

    已針對水平文本檢測模型運行OpenVINO?訓練擴展中的 微調 步驟,并收到錯誤消息: RuntimeError: Failed to find annotation files
    發表于 03-05 06:48

    【「基于大模型的RAG應用開發與優化」閱讀體驗】+大模型微調技術解讀

    今天學習<基于大模型的RAG應用開發與優化>這本書。大模型微調是深度學習領域中的一項關鍵技術,它指的是在已經預訓練好的大型深度學習模型基礎上,使用新的、特定任務相關的數據
    發表于 01-14 16:51

    《具身智能機器人系統》第7-9章閱讀心得之具身智能機器人與大模型

    的應用。MAML算法通過二階優化找到對任務變化敏感的模型參數,實現了快速適應。上下文學習則引入了注意力機制,使模型能夠根據當前場景動態調整行為策略。在預訓練-微調范式中,我們要注意任務表示的重要性:好的表示
    發表于 12-24 15:03

    名單公布!【書籍評測活動NO.52】基于大模型的RAG應用開發與優化

    你需要開發一個在線的自助產品咨詢工具,允許客戶使用自然語言進行交互式的產品問答,比如“請介紹一下您公司這款產品與××產品的不同之處”。為了讓客戶有更好的體驗,你決定使用大模型構造這樣的咨詢功能并將其嵌入
    發表于 12-04 10:50

    一種信息引導的量化后LLM微調新算法IR-QLoRA

    模型應用開卷,連一向保守的蘋果,都已釋放出發展端側大模型的信號。 問題是,大語言模型(LLM)卓越的表現取決于“力大磚飛”,如何在資源有限的環境中部署大模型并保障性能,仍然頗具挑戰。
    的頭像 發表于 11-19 17:16 ?693次閱讀
    一種信息引導的量化后LLM<b class='flag-5'>微調</b>新算法IR-QLoRA

    大語言模型如何開發

    大語言模型的開發是一個復雜且細致的過程,涵蓋了數據準備、模型架構設計、訓練、微調和部署等多個階段。以下是對大語言模型開發步驟的介紹,由AI部落小編整理發布。
    的頭像 發表于 11-04 10:14 ?496次閱讀

    同步與多個FPGA接口的千兆樣本ADC

    電子發燒友網站提供《同步與多個FPGA接口的千兆樣本ADC.pdf》資料免費下載
    發表于 10-10 11:32 ?0次下載
    同步與多個FPGA接口的千兆<b class='flag-5'>樣本</b>ADC

    chatglm2-6b在P40上做LORA微調

    背景: 目前,大模型的技術應用已經遍地開花。最快的應用方式無非是利用自有垂直領域的數據進行模型微調。chatglm2-6b在國內開源的大模型上,效果比較突出。本文章分享的內容是用
    的頭像 發表于 08-13 17:12 ?750次閱讀
    chatglm2-6b在P40上做LORA<b class='flag-5'>微調</b>

    示波器探頭補償微調旋鈕的作用

    示波器探頭補償微調旋鈕是一種用于調整示波器探頭性能的重要組件。 一、示波器探頭補償微調旋鈕的作用 校準探頭性能 示波器探頭補償微調旋鈕的主要作用是校準探頭的性能。由于探頭在生產過程中可能存在一定
    的頭像 發表于 08-09 11:31 ?1135次閱讀

    使用TensorFlow進行神經網絡模型更新

    使用TensorFlow進行神經網絡模型的更新是一個涉及多個步驟的過程,包括模型定義、訓練、評估以及根據新數據或需求進行模型微調(Fine-tuning)或重新訓練。下面我將詳細闡述這
    的頭像 發表于 07-12 11:51 ?727次閱讀

    BP神經網絡樣本的獲取方法

    的訓練樣本是至關重要的。 數據收集 數據收集是構建BP神經網絡模型的第一步。根據研究領域和應用場景的不同,數據來源可以分為以下幾種: 1.1 實驗數據:通過實驗或觀察獲得的數據,如生物實驗、化學實驗等。 1.2 傳感器數據:通過傳感器收集的數據,如溫度、濕度、壓力等。
    的頭像 發表于 07-11 10:50 ?911次閱讀

    模型為什么要微調?大模型微調的原理

    難以達到最佳性能。為了提升模型在特定任務上的表現,微調(Fine-tuning)成為了一個關鍵步驟。本文將詳細探討大模型為什么要進行微調以及微調
    的頭像 發表于 07-10 10:43 ?6798次閱讀

    llm模型和chatGPT的區別

    基于Transformer架構的預訓練語言模型,它可以生成連貫、自然的文本。ChatGPT使用GPT模型作為基礎,通過微調和訓練來實現對話生成和理解。 以下是一
    的頭像 發表于 07-09 09:55 ?1825次閱讀
    主站蜘蛛池模板: 午夜精品国产 | 一级骚片超级骚在线观看 | 最新eeuss影院第256页 | 亚洲国产高清精品线久久 | 九月婷婷综合婷婷 | 三级电影在线观看视频 | 亚洲天天综合网 | 婷婷深爱网 | 91黄色视屏 | 日本黄色小视频网站 | 日韩三级中文 | 狠狠色噜噜狠狠色综合久 | 天天做夜夜做 | 欧美成人性色生活片天天看 | 亚洲 欧美 日韩 综合 | 男人天堂网www | 色视频网站大全免费 | 色天使色护士 在线视频观看 | 啪啪免费看 | 亚洲最新在线观看 | 亚洲午夜一区二区三区 | 亚洲第一区视频在线观看 | 成人综合在线视频 | 国产伦精品一区二区三区女 | 国产伦精品一区二区免费 | 好大好硬好爽免费视频 | 尤物视频黄 | 亚洲性人人天天夜夜摸 | 亚洲色图久久 | 手机看片1024精品日韩 | 欧美日韩一区在线观看 | 永久国产| 亚洲精品中文字幕乱码三区一二 | 日本视频网站在线www色 | 免费黄色网址网站 | 欧美成人全部免费观看1314色 | 一级特黄特黄的大片免费 | 天堂在线链接 | 久久看精品| 亚洲黄色激情网 | 日日操操干干 |