亚洲AV在国产精品在线观看,国产成人香蕉视频,亚洲AⅤ免费看婷婷喷水

開局一道面試題。

面試官：大模型微調(diào)如何組織訓(xùn)練樣本？

你：大模型訓(xùn)練一問一答，一指令一輸出，問題和指令可以作為prompt輸入，答案作為輸出，計(jì)算loss的部分要屏蔽掉pad token。

面試官：多輪對話如何組織訓(xùn)練樣本呢？

你：假設(shè)多輪為Q1A1/Q2A2/Q3A3，那么可以轉(zhuǎn)化成 Q1—>A1, Q1A1Q2->A2, Q1A1Q2A2Q3->A3三條訓(xùn)練樣本。

面試官：這樣的話一個session變成了三條數(shù)據(jù)，并且上文有依次重復(fù)的情況，這樣會不會有啥問題？

你：數(shù)據(jù)中大部分都是pad token，訓(xùn)練數(shù)據(jù)利用效率低下。另外會有數(shù)據(jù)重復(fù)膨脹的問題，訓(xùn)練數(shù)據(jù)重復(fù)膨脹為 session數(shù)量*平均輪次數(shù)，且上文有重復(fù)部分，訓(xùn)練效率也會低下。

面試官：你也意識到了，有什么改進(jìn)的方法嗎？

你：有沒有辦法能一次性構(gòu)造一個session作為訓(xùn)練樣本呢？（思索）

面試官：提示你下，限制在decoder-only系列的模型上，利用模型特性，改進(jìn)樣本組織形式。

對于這個問題，我們思考下decoder-only模型有啥特點(diǎn)，第一點(diǎn)很關(guān)鍵的是其attention形式是casual的，casual簡單理解就是三角陣，單個token只能看到其上文的信息。

如圖所示：

其二是postion_id是只有token次序含義而無需特定指代信息，（區(qū)別于GLM模型需要postion_id來標(biāo)識生成span的位置等特殊的要求）。

有了這兩點(diǎn)我們就可以設(shè)想，如果構(gòu)造多輪對話樣本的input為 Q1 A1 Q2 A2 Q3 A3 ，在計(jì)算loss的時候，只需要計(jì)算 A1 A2 和 A3 部分，豈不是就可以進(jìn)行session級別的訓(xùn)練了？

嗯為什么原來的chatglm不能用這種形式呢，雖然prefix attention可以推廣為適應(yīng)多輪訓(xùn)練的prefix attention形式，如圖：

但是由于其postition id 無法簡單按次序推廣，故不能高效訓(xùn)練，這也是chatglm初代的很大的一個問題，導(dǎo)致后續(xù)微調(diào)的效果都比較一般。

現(xiàn)在chatglm2的代碼針對這兩個問題已經(jīng)進(jìn)行了改善，可以認(rèn)為他就是典型的decoder-only模型了，具體表現(xiàn)為推斷時候attention 是casual attention的形式，position id也退化為token次序增長。

那么好了，萬事具備，只欠東風(fēng)。我們據(jù)此實(shí)現(xiàn)了chatglm2-6b的代碼微調(diào)。其核心代碼邏輯為處理樣本組織的邏輯，其他的就是大模型微調(diào)，大同小異了。

conversation=''
input_ids = []
labels = []
eos_id = tokenizer.eos_token_id
turn_idx = 0
for sentence in examples[prompt_column][i]:
    sentence_from = sentence["from"].lower()
    sentence_value = '[Round {}]

問：'.format(turn_idx) + sentence["value"] + '

答：' if sentence_from == 'human' else sentence["value"]+'

'
    conversation += sentence_value
    sentence_ids = tokenizer.encode(sentence_value, add_special_tokens=False)  
    label = copy.deepcopy(sentence_ids) if sentence_from != 'human' else [-100] * len(sentence_ids)               
    input_ids += sentence_ids 
    labels += label
    if sentence_from != 'human':
        input_ids += [eos_id]
        labels += [eos_id]
        turn_idx += 1
input_ids=tokenizer.encode('')+input_ids#addgmaskbos
labels =  [-100] * 2 + labels# #add padding
pad_len = max_seq_length - len(input_ids)
input_ids = input_ids + [eos_id] * pad_len 
labels = labels + [-100] * pad_len

其中有幾個關(guān)鍵的地方，就是在開頭要加上 bos和gmask，遵循模型原來的邏輯。問答提示詞和輪次prompt，還有兩個保持和原模型保持一致，最后屏蔽掉pad部分的loss計(jì)算。

實(shí)測訓(xùn)練效果如下：

同樣的數(shù)據(jù)在chatglm1上 train loss只能降到2.x左右，同時評估測試集結(jié)果，在同樣的數(shù)據(jù)上rouge等指標(biāo)都有不小的提升。

我們再仔細(xì)回顧下，對話session級別訓(xùn)練和拆開訓(xùn)練從原理上有啥區(qū)別？

1.session級別訓(xùn)練，效果之一為等價batchsize變大（1個batch可以塞下更多樣本），且同一通對話產(chǎn)生的樣本在一個bs內(nèi)。

2. session級別的不同輪次產(chǎn)生的梯度是求平均的，拆開輪次構(gòu)造訓(xùn)練是求和的，這樣除了等價于lr會變大，還會影響不同輪次token權(quán)重的分配，另外還會影響norm的計(jì)算。

我們用一個簡化地例子定量分析下，我們假設(shè)兩條訓(xùn)練樣本分為 1.問：A 答：xx 2.問: A答：xx 問: B答：xx問: C答：xx 則session級別訓(xùn)練影響梯度為 (Ga+(Ga +Gb + Gc)/3)/2。對 A，B，C影響的權(quán)重分別為，2/3 1/6 1/6。拆開訓(xùn)練為(Ga+Ga+ (Ga+Gb)/2+(Ga+Gb+ Gc)/3)/4。對 A，B，C影響的權(quán)重分別為，17/24 5/24 1/12。從上面的權(quán)重分布來看，session級別靠后的輪次影響權(quán)重要比拆開更大。這也是更合理的，因?yàn)榇蟛糠謭鼍跋?，開場白都是趨同和重復(fù)的。 一點(diǎn)小福利，以上面試題對應(yīng)的ChatGLM2-6B微調(diào)完整的代碼地址為： https://github.com/SpongebBob/Finetune-ChatGLM2-6B

實(shí)現(xiàn)了對于 ChatGLM2-6B 模型的全參數(shù)微調(diào)，主要改進(jìn)點(diǎn)在多輪對話的交互組織方面，使用了更高效的session級別高效訓(xùn)練，訓(xùn)練效果相比原版ChatGLM-6B有較大提升。

這可能是目前全網(wǎng)效果最好的ChatGLM2-6B全參數(shù)微調(diào)代碼。

聲明：本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問題，請聯(lián)系本站處理。舉報投訴