大模型技術(shù)深度解析(微課版) 課件5.1大模型推理能力_第1頁
大模型技術(shù)深度解析(微課版) 課件5.1大模型推理能力_第2頁
大模型技術(shù)深度解析(微課版) 課件5.1大模型推理能力_第3頁
大模型技術(shù)深度解析(微課版) 課件5.1大模型推理能力_第4頁
大模型技術(shù)深度解析(微課版) 課件5.1大模型推理能力_第5頁
已閱讀5頁,還剩33頁未讀 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡(jiǎn)介

大模型推理主要內(nèi)容一、介紹二、大模型推理背景三、大模型推理的主要任務(wù)四、提示工程方法五、推理數(shù)據(jù)集的構(gòu)建六、緩解逆轉(zhuǎn)詛咒七、應(yīng)用場(chǎng)景討論一、介紹AI已有類人推理能力?數(shù)學(xué)推理測(cè)試成績(jī)優(yōu)異代碼生成能力優(yōu)異AI模型的推理模式與問題給予概率的模式匹配標(biāo)記偏差逆轉(zhuǎn)詛咒一、介紹AI發(fā)展的潛在危機(jī)高質(zhì)量數(shù)據(jù)即將被AI學(xué)習(xí)用完賦予LLM推理能力提示工程更復(fù)雜的思維架構(gòu)構(gòu)建更適合AI推理的數(shù)據(jù)集二、LLM推理的背景Transformer架構(gòu)LLM使用因果掩碼損失進(jìn)行下一個(gè)標(biāo)記預(yù)測(cè)的自回歸語言建模是成功的自我監(jiān)督學(xué)習(xí)方法編碼器與解碼器多頭注意力機(jī)制二、LLM推理的背景LLM推理過程主流僅解碼器LLM,通常采用自回歸方法來生成輸出句子。在每個(gè)步驟中,LLM將之前的加上此步的整個(gè)Token序列作為輸入,并生成下一個(gè)Token。LLM的基本推理能力隨著模型大小和訓(xùn)練數(shù)據(jù)的增加,LLM的性能會(huì)顯著提高。解鎖小型模型中所沒有的非凡能力,例如上下文學(xué)習(xí)、角色扮演和類比推理完成代碼生成、機(jī)器人控制和agent三、LLM推理的主要任務(wù)數(shù)學(xué)問題推理解決數(shù)學(xué)問題通常需要一步或多步算術(shù)推理。基于對(duì)輸入問題、隱含算術(shù)運(yùn)算和概念知識(shí)的理解,解題者需要根據(jù)已有知識(shí)和已知條件推導(dǎo)出一系列結(jié)果,從而得到最終答案。例:多項(xiàng)選擇題測(cè)試包含4個(gè)問題,每個(gè)問題有5個(gè)答案選項(xiàng)。如果每個(gè)問題都尚未回答,那么答案有多少種填法?數(shù)學(xué)問題推理的特點(diǎn)包含小學(xué)水平的數(shù)學(xué)知識(shí)。這包括加、減、乘、除等基本運(yùn)算;一些考試的基準(zhǔn)測(cè)試;或是大量高級(jí)數(shù)學(xué)知識(shí)和數(shù)學(xué)推理技巧,以及多步思考的能力才能解決的問題。三、LLM推理的主要任務(wù)常識(shí)性問題推理常識(shí)性推理指的是基于日常生活經(jīng)驗(yàn)和世界常識(shí)進(jìn)行的推理能力。它涉及理解隱含的知識(shí)、處理模糊信息,以及做出符合現(xiàn)實(shí)世界邏輯的判斷。例:我該如何為豚鼠籠子里的新主人做好準(zhǔn)備?常識(shí)性問題推理的特點(diǎn)常識(shí)性推理具有隱含性,普適性,模糊性,動(dòng)態(tài)性等特點(diǎn)。涉及大量的細(xì)節(jié),并且往往模棱兩可。常識(shí)性問題的挑戰(zhàn)AI需要處理模糊和非結(jié)構(gòu)化的信息。三、LLM推理的主要任務(wù)符號(hào)推理符號(hào)推理是一種基于符號(hào)表示和邏輯規(guī)則的推理方式,通常用于精確地解決問題,進(jìn)行數(shù)學(xué)推導(dǎo)、邏輯推理和知識(shí)表示。符號(hào)推理的特點(diǎn)符號(hào)推理的核心在于使用明確的規(guī)則、定義和關(guān)系,通過符號(hào)進(jìn)行邏輯推斷。具有精確性,可解釋性,基于規(guī)則,離散性的特點(diǎn)、常識(shí)性問題的挑戰(zhàn)語言模型展示了理解簡(jiǎn)單符號(hào)操作的能力,但它們被認(rèn)為不太擅長(zhǎng)復(fù)雜的符號(hào)推理任務(wù)。三、LLM推理的主要任務(wù)符號(hào)推理例三、LLM推理的主要任務(wù)思維偏差與逆轉(zhuǎn)詛咒當(dāng)訓(xùn)練文檔偏離模型的首選結(jié)構(gòu)時(shí),它們的知識(shí)應(yīng)用能力可能會(huì)變得不穩(wěn)定,甚至違反直覺。逆轉(zhuǎn)詛咒是指對(duì)于“A=B”的關(guān)系,在“AisB”形式的文檔上訓(xùn)練的LLM無法推廣到反向版本“BisA”。正向和反向的形式嚴(yán)重影響LLM生成的準(zhǔn)確率四、提示工程方法問題分析在開放域問答中,用戶提出的問題往往存在歧義,這給準(zhǔn)確回答帶來了很大挑戰(zhàn)。解決思路歧義檢測(cè),用于識(shí)別用戶提出的問題是否存在歧義。澄清問題生成,為檢測(cè)到的歧義問題生成合適的澄清問題。基于澄清的問答,根據(jù)用戶對(duì)澄清問題的反饋,系統(tǒng)給出精確答案。復(fù)雜任務(wù)分解將問題分解為中間步驟并在給出最終答案之前解決每個(gè)步驟的方法。目標(biāo)是賦予語言模型生成類似思維鏈的能力,即一系列連貫的中間推理步驟,從而得出問題的最終答案。四、提示工程方法思維鏈方法將問題分解為中間步驟并在給出最終答案之前解決每個(gè)步驟的方法。目標(biāo)是賦予語言模型生成類似思維鏈的能力,即一系列連貫的中間推理步驟,從而得出問題的最終答案。思維鏈的基本形式四、提示工程方法思維鏈的性質(zhì)思維鏈原則上允許模型將多步驟問題分解為中間步驟,可以將額外的計(jì)算分配給需要更多推理步驟的問題。思維鏈為模型的行為提供了一個(gè)可解釋的窗口,并提供調(diào)試推理路徑出錯(cuò)的地方的機(jī)會(huì)。思維鏈推理可用于數(shù)學(xué)問題、常識(shí)推理和符號(hào)操作等任務(wù),并且可能適用于人類可以通過語言解決的任何任務(wù)。只需將思維鏈序列的示例包含在少數(shù)鏡頭提示的示例中,就可以在足夠大的現(xiàn)有LLM中輕松引出思維鏈推理。四、提示工程方法思維鏈的性質(zhì)自回歸Transformer架構(gòu)下COT要比RNN架構(gòu)有更好的性能,并且模型確實(shí)在一定程度上學(xué)習(xí)了解決方案(而不是記住數(shù)據(jù)分布)CoT對(duì)數(shù)據(jù)質(zhì)量有穩(wěn)健性,對(duì)缺少中間CoT步驟并涉及單標(biāo)記損壞的數(shù)據(jù)進(jìn)行實(shí)驗(yàn),模型仍然可以達(dá)到很高的準(zhǔn)確率。四、提示工程方法思維鏈方法的延伸自洽思維鏈在思維鏈的基礎(chǔ)上先從大模型生成一定數(shù)量的推理路徑,通過邊緣化采樣的推理路徑來確定最佳答案,以在最終答案集中找到最一致的答案。對(duì)比思維鏈的方法對(duì)比了有效和無效的答案解釋,引導(dǎo)模型生成更準(zhǔn)確的推理鏈,從而提高復(fù)雜任務(wù)的性能。思維圖

允許LLM探索多條推理路徑,評(píng)估潛在結(jié)果,迭代選擇最有希望的路徑。思維圖將信息表示為圖表。這種方法允許更靈活、更復(fù)雜的推理形式四、提示工程方法自我評(píng)估基于顯示反饋的自我評(píng)估:實(shí)施詳細(xì)的評(píng)估標(biāo)準(zhǔn)以灌輸自我評(píng)估能力,或者利用自我辯論進(jìn)行交叉驗(yàn)證。多智能體辯論利用多模型生成與辯論。將其他模型的答案反饋給每個(gè)模型,促使其更新答案。重復(fù)此過程,逐步達(dá)成一致。可以調(diào)整提示詞引導(dǎo)模型“固執(zhí)”或“開放”。通過討論(以小組形式工作)、審查(理審查彼此的推理鏈和代碼以確保正確性)和檢索(代理評(píng)估來自其他代理的推理鏈)減小開銷。四、提示工程方法自我糾正自我糾正是指通過反映先前響應(yīng)中的錯(cuò)誤來迭代改進(jìn)未來響應(yīng)的能力。外源性自我糾正LLM使用外部知識(shí)來源來提煉自己的答案。此過程使模型能夠根據(jù)更新或?qū)I(yè)信息進(jìn)行交叉引用和糾正潛在錯(cuò)誤,從而提高其響應(yīng)的準(zhǔn)確性和可靠性。內(nèi)源性自我糾正指導(dǎo)LLM評(píng)估自己的“信心”,促進(jìn)內(nèi)在的自我糾正。四、提示工程方法壓縮輸入原因:模型的有效上下文長(zhǎng)度是有限的思維骨架引導(dǎo)LLM自己推導(dǎo)出一個(gè)骨架。基于骨架,LLM可以并行完成每個(gè)點(diǎn)。提高了推理效率和否定了完全順序編碼的必要性。思維骨架圖例四、提示工程方法思維遞歸通過生成特殊標(biāo)記來遞歸地創(chuàng)建多個(gè)上下文。即使問題的解決方案超出了最大上下文大小,模型也可以將其劃分為多個(gè)短上下文,以產(chǎn)生具有極長(zhǎng)(100K+標(biāo)記)推理步驟的能力。思維遞歸圖例四、提示工程方法總結(jié)對(duì)LLM處理更長(zhǎng)輸入和更復(fù)雜問題的需求不斷增長(zhǎng),這凸顯了提示工程技術(shù)的重要性。在這些技術(shù)中,構(gòu)建中間步驟類方法專注于提高LLM在推理過程的準(zhǔn)確性和可解釋性。對(duì)于基于API的LLM,壓縮輸入方法不但可以方法可以降低與輸入令牌相關(guān)的API成本,也可以緩解輸入過長(zhǎng)導(dǎo)致的中間迷失問題。在可預(yù)見的未來,提示工程在拆解中間步驟,備選提案等方法,對(duì)于提高推理性能將變得越來越必要。五、推理數(shù)據(jù)集的構(gòu)建人工標(biāo)注人工標(biāo)注在為L(zhǎng)LM構(gòu)建數(shù)據(jù)集中的作用是必不可少的,人工標(biāo)注更為細(xì)致和準(zhǔn)確,并且更能處理模糊的問題,各種研究也揭示了人工標(biāo)注的數(shù)據(jù)在增強(qiáng)大型語言模型的推理能力方面起著關(guān)鍵作用。人工標(biāo)注的問題與替代LLM的訓(xùn)練往往需要大量的數(shù)據(jù),僅通過人工標(biāo)注構(gòu)建數(shù)據(jù)集變得越來越不切實(shí)際。需要替代方法來改進(jìn)推理。協(xié)作標(biāo)注:LLM來執(zhí)行第一輪標(biāo)注,在細(xì)化階段,使用人工標(biāo)注評(píng)估LLM生成的注釋的質(zhì)量,并專注于僅更正質(zhì)量較差的注釋子集。五、推理數(shù)據(jù)集的構(gòu)建使用更強(qiáng)的LLM進(jìn)行標(biāo)注LLM可以大大加速注釋過程,特別是在面對(duì)大規(guī)模數(shù)據(jù)時(shí)。LLM能保持注釋的一致性,并且節(jié)省成本,適合大規(guī)模任務(wù)。基于蒙特卡洛的方法在中間解的完成時(shí)使用蒙特卡洛抽樣來獲得逐步訓(xùn)練標(biāo)注.具體來說,對(duì)于每個(gè)中間解決方案,通過樣本解碼機(jī)制使用推理器多次完成解決方案,完成的解決方案正確的百分比稱為解決方案的正確性。五、推理數(shù)據(jù)集的構(gòu)建使用推理器多次完成中間解決方案,并獲得這些完成的正確百分比值。二分查找的蒙特卡洛方法六、緩解逆轉(zhuǎn)詛咒逆轉(zhuǎn)詛咒的評(píng)估輕量級(jí)的方法都難以解決逆轉(zhuǎn)詛咒。在互聯(lián)網(wǎng)上,有許多事實(shí)只涉及單向的描述。可能的原因LLM可能會(huì)根據(jù)事實(shí)的方向以不同的方式存儲(chǔ)關(guān)聯(lián)。現(xiàn)有解決思路重排訓(xùn)練,演繹閉合訓(xùn)練,模型編輯,使用非自回歸模型等。重排訓(xùn)練——逆向訓(xùn)練小成本逆向訓(xùn)練主要包括token反轉(zhuǎn),單詞反轉(zhuǎn),實(shí)體翻轉(zhuǎn),隨機(jī)段反轉(zhuǎn)。逆向轉(zhuǎn)換可以看作是模型學(xué)習(xí)的第二種“語言”。優(yōu)點(diǎn)這種方法構(gòu)造數(shù)據(jù)集的方法較為簡(jiǎn)單而且沒有使用額外的數(shù)據(jù)結(jié)構(gòu)。六、緩解逆轉(zhuǎn)詛咒重排訓(xùn)練——語義感知排列訓(xùn)練輔助模型將原始訓(xùn)練句子分割成幾個(gè)語義塊。然后,以一定的概率對(duì)語義塊重新排序。對(duì)語義的處理更加合理。六、緩解逆轉(zhuǎn)詛咒演繹閉合訓(xùn)練標(biāo)準(zhǔn)監(jiān)督目標(biāo)會(huì)導(dǎo)致LLM為其訓(xùn)練數(shù)據(jù)中的語句分配高概率,但不一定是這些語句的邏輯結(jié)果。需要一個(gè)替代程序來確保LLM在經(jīng)過訓(xùn)練和微調(diào)時(shí)為一組完整且一致的事實(shí)分配高概率。演繹閉合訓(xùn)練通過語言模型生成與這些文檔相關(guān)或矛盾的其他文本。然后,模型會(huì)對(duì)這些生成的文本進(jìn)行推理,判斷哪些部分最可能是真實(shí)的,并基于這一推理結(jié)果進(jìn)行微調(diào)。六、緩解逆轉(zhuǎn)詛咒演繹閉合訓(xùn)練給定一個(gè)初始種子文檔,為每個(gè)生成的文檔分配一個(gè)分?jǐn)?shù)。確定聯(lián)合真實(shí)性得分最高的文檔子集。最后,在此集合上進(jìn)行微調(diào)。六、緩解逆轉(zhuǎn)詛咒散列掩碼使用無意義標(biāo)識(shí)符,用唯一的散列值替換文本,允許在整個(gè)文本中被引用。散列方法可以優(yōu)化自由文本和表格格式的表現(xiàn)。六、緩解逆轉(zhuǎn)詛咒模型編輯——雙向關(guān)系建模通過修改模型的權(quán)重,捕捉事實(shí)知識(shí)中主語與賓語之間的正向和反向關(guān)系(即以(主語,關(guān)系,賓語)三元組表示的事實(shí)知識(shí))。在編輯過程中將雙向可逆的關(guān)系融入模型,即一對(duì)一、一對(duì)多、多對(duì)一和多對(duì)多的基本關(guān)系,幫助模型在兩種方向上更好地泛化和回憶事實(shí)。(a)雙向加強(qiáng)新事實(shí)的雙向關(guān)聯(lián)(b)雙向削弱舊事實(shí)的關(guān)聯(lián)。六、緩解逆轉(zhuǎn)詛咒使用非自回歸模型自回歸模型的順序采樣過程效率低下,限制了非順序的推理能力。原因:模型通過概率鏈?zhǔn)椒▌t來表征聯(lián)合分布。主要思路使用擴(kuò)散模型代替自回歸模型。六、緩解逆轉(zhuǎn)詛咒重參數(shù)化離散擴(kuò)散刪除了時(shí)間條件,是一種沒有時(shí)間條件的專用擴(kuò)散模型,用于表征與時(shí)間無關(guān)的條件概率。優(yōu)點(diǎn)實(shí)現(xiàn)簡(jiǎn)單當(dāng)噪聲樣本在采樣間隔內(nèi)保持不變時(shí),還可以通過緩存與時(shí)間無關(guān)的網(wǎng)絡(luò)的輸出來減少函數(shù)評(píng)估的數(shù)量。缺點(diǎn)對(duì)于可變長(zhǎng)度支持的靈活性不足。六、緩解逆轉(zhuǎn)詛咒掩碼擴(kuò)散模型填充序列中的掩碼位置來實(shí)現(xiàn)靈活的雙向上下文建模。優(yōu)點(diǎn)有效地克服了反向詛咒保持了相同的性能而且對(duì)時(shí)間變化更穩(wěn)健,緩解了模型老化現(xiàn)象更適合不斷發(fā)展的數(shù)據(jù)分布評(píng)估的數(shù)量。缺點(diǎn)但是在規(guī)模定律和條件生成方面,與自回歸模型相比存在差距。七、應(yīng)用場(chǎng)景討論提示工程的交叉多種提示工程方法往往可以互相兼容,將多種兼容的提示工程方法因地制宜的組合使用應(yīng)該是提示工程應(yīng)用的有效方向。例如:思維圖可以與思維骨架相結(jié)合使得LLM可以遵循動(dòng)態(tài)的思維圖。縮短思維鏈現(xiàn)象:延長(zhǎng)推理步驟也會(huì)大大提高LLM的推理能力。相反,在保留關(guān)鍵信息的同時(shí)縮短推理步驟會(huì)顯著降低模型的推理能力。嘗試使用LLM的內(nèi)部隱式推理,取代顯式推理步驟的研究并未取得好的效果。可能的方法:使用不同的初始提示標(biāo)記來調(diào)節(jié)較長(zhǎng)和較短的思維鏈,LLM可以學(xué)習(xí)它們之間的差異和聯(lián)系,以生成更短的思維鏈。七、應(yīng)用場(chǎng)景討論文檔結(jié)構(gòu)擴(kuò)充通過LLM自身構(gòu)造更多范式,正向反向的數(shù)據(jù),為L(zhǎng)LM提供符合更多結(jié)構(gòu)的數(shù)據(jù)集,減輕LLM的思維偏差和逆轉(zhuǎn)詛咒現(xiàn)象。結(jié)果獎(jiǎng)勵(lì)與過程獎(jiǎng)勵(lì)結(jié)果獎(jiǎng)勵(lì)相對(duì)容易構(gòu)建,但它缺乏對(duì)中間步驟的監(jiān)督,LLM可能通過錯(cuò)誤的中間推理步驟得到正確的結(jié)果,這可能會(huì)降低推理性能,一個(gè)具有挑戰(zhàn)性但是有效的方向是將結(jié)果獎(jiǎng)勵(lì)高效低成本的轉(zhuǎn)化為過程獎(jiǎng)勵(lì)。多模態(tài)大模型推理多模態(tài)大模型具有類似人類的反應(yīng),因此它們常常給人一

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。

最新文檔

評(píng)論

0/150

提交評(píng)論