CN119107447B 一種基于語言和圖像大模型的多源路面病害識別方法 (河北工業大學)_第1頁
CN119107447B 一種基于語言和圖像大模型的多源路面病害識別方法 (河北工業大學)_第2頁
CN119107447B 一種基于語言和圖像大模型的多源路面病害識別方法 (河北工業大學)_第3頁
CN119107447B 一種基于語言和圖像大模型的多源路面病害識別方法 (河北工業大學)_第4頁
CN119107447B 一種基于語言和圖像大模型的多源路面病害識別方法 (河北工業大學)_第5頁
已閱讀5頁,還剩23頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

A,2023.09.15A,2024.02.20A,2024.05.03A,2024.05.07一種基于語言和圖像大模型的多源路面病本發明為一種基于語言和圖像大模型的多于被LLM確定為裂縫橫穿整張圖像時,則以過圖使用視覺語言大模型VLM對路面病害進行目標檢SAM進行微調得到適應于道路病害分割任務的模型和分割大模型三者,并對分割大模型SAM進2道路病害圖像,令其根據知識語料庫進行分類并輸出語義豐富包含上下文信息的文本描使用RGB相機或線掃激光或紅外相機按照不同的采集方式進行圖像采集,并按照采集使用指令對圖像中病害進行問詢使其完成對病害的描述,病害的描述內容包括病害的類第三部分:使用標注有病害掩碼的圖像對SAM進行微調得到適應于道路病害分割任務SAM使用掩碼自編碼器MAE預訓練的VIT作為主干網絡,并采用基于向量的隨機矩陣適主干網絡,所述主干網絡由多個TransformerBlocks組成,每個TransformerBlocks記為3配器Adapter和第二個歸一化層,第二個歸一化層的結果經多層感知機的處理后與適配器p在窗口注意力層中增加VeRA模塊,對于區塊向量獲得每的個圖像區塊patchx∈RHp一個作為支路的VeRA權重矩陣ΔW;ΔW由兩個權重隨機初始化后凍結的低秩矩陣A和權重原始鍵值對K和V向量前分別添加可更新的前綴向量PK和前綴向量PV,將由前綴向量PK和前綴向量PV分別與原始鍵值對K和V組成新的K和V與原始的Q一起SAM的提示編碼器使用位置編碼技術進行編碼嵌入,對提示框的左上角和右下角坐標將圖像特征與文本提示特征進行多層的特征融合,融合融合和深層編碼交替進行,最后,對最終生成的圖像特4鍵作用。而現有的VLM模型缺乏根據圖片自動生成文本提示的能力。與之相對的,LLM(large5[0011]使用RGB相機或線掃激光或紅外相機按照不同的采集方式進行圖像采集,并按照[0012]根據目錄中圖像類型分別設置文本指令,將采集到的圖像輸入到大語言模型LLM[0014]若沒有被LLM判定為裂縫橫穿整張圖像,而整張圖像的預測框仍出現多框重疊情[0015]第三部分:使用標注有病害掩碼的圖像對SAM進行微調得到適應于道路病害分割適配器Adapter和第二個歸一化層,第二個歸一化層的結果經多層感知機的處理后與適配pp6添加一個作為支路的VeRA權重矩陣ΔW;ΔW由兩個權重隨機初始化后凍結的低秩矩陣A和和前綴向量PV分別與原始鍵值對K和V組成新的K和V與原始的Q一起進行[0022]SAM的提示編碼器使用位置編碼技術進行編碼嵌入,對提示框的左上角和右下角[0024]將圖像特征與文本提示特征進行多層的特征融合,融合后再進行更深層次的編[0029]本發明將大語言模型應用在道路病害識別上,使用LLM對路面病害圖像進行初步[0030]本發明中VLM以大數據的方式學習到圖像文本相關性,使它能進行有效的零樣本7[0031]本發明通過對分割大模型SAM(segmentanythingmodel)進行微病害圖像分割任務中的有效應用。入道路病害圖像,令其根據知識庫進行分類并輸出語義豐富包含上下文信息的文本描述;第二部分為使用圖像語言模型GLIP(GroundedLanguage_ImagePre_training)讀入原始立一個覆蓋各等級公路場景和路面病害術語的[0041]使用RGB相機或線掃激光或紅外相機按照不同的采集方式進行圖像采集,但不僅[0042]根據目錄中圖像類型分別設置文本指令,將采集到的圖像輸入到大語言模型LLM征進行多層的特征融合,融合后再進行更深層次的編碼,對文本特征向量是經過Bert8[0045]對于被LLM確定為裂縫橫穿整張圖像時,則以過圖片中心點沿垂直裂縫方向進行邊超過圖像的70則仍需進行裁剪,此時可過最大框的中心點沿短邊方向設置裁剪線進[0048]三、使用標注有病害掩碼的圖像對SAM進行微調得到適應于道路病害分割任務的[0049]微調SAM的訓練集可以使用帶標簽的公開數據集,也可以使用自行采集并進行標明使用GLIP生成的提示框作為微調輸入的一部分,充分發揮SAM作為交互式分割模型的優[0052]本發明的工作原理是:使用爬蟲程序或人工收集道路路部分使用跨模態多頭注意力模塊。分割大模型SAM可以接收提示框,使用VeRA(Vector_9[0056]3.根據目錄中圖像類型分別設置文本指令,將采集到的圖像輸入到大語言模型據目錄中圖像類型分別設置,如為紅外圖像則文本指令可設置為“Whatdoesthe病害,則還需包括是否橫穿整張圖像。采用命令“Youare`gpt_4o`,thelatestOpenAImodelthatcaninterpretimagesandcandescribeimagesprovidedbytheusindetail.Theuserhasattachequestion,thereisdefinitelyanimageattached,youwillneverreplysayingthatyoucannotseetheimagebecausetheimageisabsolutelyandalwaysattachedtothismessage.Answerthequestionaskedbytheuserbasedontheimageprovided.Donotgiveanyfurtherexplanation.Donotreplysayingyoucan'tanswerthequprovideddoesnotcontainthenecessarydatatoanswerthequestion,return'進入角色;使用命令“TheoutputmustbeinJSONformat,withthefollowing[0063]–special:ifit'satransversecrackorlongitidunalcrack,describewith'yes'or'no'ifitcrossestheentireimage”來限定GPT4_o的輸式;最后輸入命令“Youaretaskedwithaccuraandtextfromtheimagesprovided.YouwillfocusonWhatdoesthepavement[0065]向GLIP模型輸入原始路面病害圖像和步驟3得到的文本提示,對道路病害進行目輸入文本提示P到GLIP的文本編碼器中得到文本特征FP。使用跨模態多頭注意力模塊將兩[0066]裁剪分割策略不僅對提高GLIP模型的精度有所幫助,還能對SAM的分割起到有益框雙次預測)后,SAM能夠精準高效地分割出病害的掩碼。這個策略的具體實施為:通過框的中心點沿短邊方向設置。對于單框的情況,則將其長邊與圖像對比,若超過圖像的[0067]判斷是否多框重疊時以當前圖像中所有預測框的四個交點圍成的坐標范圍是否提高SAM在這一領域的適應性,本發明結合了VeRA(Vector_basedRandomp[0070]SAM的圖像編碼器是使用MAE(MaskedAutoencoder,掩碼自編碼器)預訓練的VIT(VisionTransformer)作為主干網絡,它由多個TransformerBlocks組成,每個意力層中增加VeRA模塊,因為其在模型中占據較大的參數比例。對于區塊向量獲得每個p由兩個權重隨機初始化后凍結和權重共享的小矩陣A和B,以及兩個可變的縮放向量b和d在K和V向量前添加可更新的前綴向量PK和PV,PK和PV的維度與K和V的維度相同,訓練中更K和PV中元素在0_1范圍內取值,將由前綴向量PK和前綴向量PV分別與原始鍵值對K和V[0073]在SAM的輕量級掩碼解碼器中,提示框的位置編碼在經過掩碼解碼器的注意力層后,原始的提示編碼特征向量還會被重新添加到已經更新了的圖像嵌入(包含提示框的位[0074]使用標注有病害掩碼的圖像對SAM進行訓練,這種標注有病害掩碼的圖像來源于道路病害圖像開源數據集或自有病害圖像數據集,標注有病害掩碼的圖像輸入到GPT4_o使用Focal損失函數和交叉熵損失函數的加權[0076]L=λLFocal+([0079]Lna=-a(1-)Ntogo)Lce=-ylog(J)-(1-)log(1-)[0085]訓練結束后得到針對道路病害的分割模型RoadS

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論