CN116468725B 基于預訓練模型的工業(yè)缺陷檢測方法、裝置及存儲介質(zhì) (北京航空航天大學杭州創(chuàng)新研究院)_第1頁
CN116468725B 基于預訓練模型的工業(yè)缺陷檢測方法、裝置及存儲介質(zhì) (北京航空航天大學杭州創(chuàng)新研究院)_第2頁
CN116468725B 基于預訓練模型的工業(yè)缺陷檢測方法、裝置及存儲介質(zhì) (北京航空航天大學杭州創(chuàng)新研究院)_第3頁
CN116468725B 基于預訓練模型的工業(yè)缺陷檢測方法、裝置及存儲介質(zhì) (北京航空航天大學杭州創(chuàng)新研究院)_第4頁
CN116468725B 基于預訓練模型的工業(yè)缺陷檢測方法、裝置及存儲介質(zhì) (北京航空航天大學杭州創(chuàng)新研究院)_第5頁
已閱讀5頁,還剩22頁未讀 繼續(xù)免費閱讀

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進行舉報或認領(lǐng)

文檔簡介

院US2023162481A1,2023.05.25WO2022100366A1,2022.05.19US2022350965A1,2022.11.03本發(fā)明涉及基于預訓練模型的工業(yè)缺陷檢的語言文本一并輸入到預訓練的視覺語言模型2獲取工業(yè)缺陷檢測圖像數(shù)據(jù)集,通過工業(yè)缺陷檢測圖像數(shù)據(jù)集來訓練視覺語言模型,所述通過工業(yè)缺陷檢測圖像數(shù)據(jù)集來訓練視覺語言模型對所述工業(yè)缺陷檢測圖像數(shù)據(jù)集中的每一張圖像的缺陷類型以及位將每張含有工業(yè)缺陷的圖像和對應的語言文本作為一組通過圖像編碼器獲得含有工業(yè)缺陷的圖像的圖像特征將所述融合特征向量輸入到所述待訓練的視覺語言模型的分類將所述融合特征向量輸入到所述待訓練的視覺語言模將待檢測圖像和目標缺陷所對應的語言文本輸入到所述預訓練的視覺語言模型結(jié)合所述待檢測圖像以及目所述預訓練的視覺語言模型結(jié)合所述待檢測圖像以及目所述預訓練的視覺語言模型通過圖像編碼器對所述待檢所述預訓練的視覺語言模型將所述融合特征向量輸入到多層感3所述預訓練的視覺語言模型通過圖像編碼器對所述待檢將所述待檢測圖像劃分為固定大小的圖像塊,將所述固將所述圖像塊序列輸入到位置編碼器中,所述位置編將所述位置特征向量輸入到所述預訓練的視覺語言模型的圖像通過WordPiece嵌入器對語言文本中的單詞進行分割,將切割后的單詞映射到一個固所述文本編碼器通過多層雙向編碼器捕獲輸入張量的將所述圖像特征向量以及文本特征向量輸入到所述預訓練的視覺語言模型的跨模態(tài)多頭注意力模塊中,所述跨模態(tài)多頭注意力模塊分別輸出融合了文本信息的圖像特征向視覺語言模型訓練模塊:用于獲取工業(yè)缺陷檢測圖像數(shù)所述通過工業(yè)缺陷檢測圖像數(shù)據(jù)集來訓練視覺語言模型對所述工業(yè)缺陷檢測圖像數(shù)據(jù)集中的每一張圖像的缺陷類型以及位將每張含有工業(yè)缺陷的圖像和對應的語言文本作為一組4通過圖像編碼器獲得含有工業(yè)缺陷的圖像的圖像特征將所述融合特征向量輸入到所述待訓練的視覺語言模型的分類將所述融合特征向量輸入到所述待訓練的視覺語言模語言文本生成模塊:用于針對每種場景下的每種工業(yè)缺輸入模塊:用于將待檢測圖像和目標缺陷所對應的語言文控器執(zhí)行時,實現(xiàn)如權(quán)利要求1_6任一項所述的基于預訓練模型的工業(yè)缺陷檢測方法中的5[0007]將待檢測圖像和目標缺陷所對應的語言文本輸入到所述預訓練的視覺語言模型[0012]所述預訓練的視覺語言模型通過文本編碼器對所述目標缺陷的語言文本進行編[0013]所述預訓練的視覺語言模型將所述圖像特征向量以及所述文本特征向量進行融6[0022]對所述工業(yè)缺陷檢測圖像數(shù)據(jù)集中的每一張圖像的缺陷類型以輸出預測的檢測框位置,將所述預測的檢測框位置與預先標注的缺陷位置進行損失計算,[0035]所述預訓練的視覺語言模型通過文本編碼器對所述目標缺陷的語言文本進行編[0036]通過WordPiece嵌入器對語言文本中的單詞進行分割,將切割后的單詞映射到一7[0040]所述預訓練的視覺語言模型將所述圖像特征向量以及所述文本特征向量進行融[0041]將所述圖像特征向量以及文本特征向量輸入到所述預訓練的視覺語言模型的跨[0042]將所述融合了文本信息的圖像特征向量乘以所述融合了圖像特征的文本特征向8[0053]圖1是根據(jù)一示例性實施例示出的基于預訓練模型的工業(yè)缺陷檢測方法的流程示[0055]圖3是根據(jù)一示例性實施例示出的基于預訓練模型的工業(yè)缺陷檢測裝置的系統(tǒng)示[0059]圖1是根據(jù)一示例性實施例示出的基于預訓練模型的工業(yè)缺陷檢測方法的流程示[0063]S4,所述預訓練的視覺語言模型結(jié)合所述待檢測圖像以及目標9[0067]S401,所述預訓練的視覺語言模型通過圖像編碼器對所述待檢輸入到所述預訓練的視覺語言模型后,模型會將輸入的圖片通過一個圖像編碼器進行編高效的神經(jīng)網(wǎng)絡(luò)架構(gòu)搜索方法,它可以在一次搜索中生成適用于多個設(shè)備和任務的模型,OFA模型結(jié)構(gòu)包括兩個部分:共享骨干網(wǎng)絡(luò)和可調(diào)整的微調(diào)層,共享骨干網(wǎng)絡(luò)是一個通用[0081]對所述工業(yè)缺陷檢測圖像數(shù)據(jù)集中的每一張圖像的缺陷類型以輸出預測的檢測框位置,將所述預測的檢測框位置與預先標注的缺陷位置進行損失計算,作為一組,分別輸入圖像編碼器和文本編碼器中,圖像編碼器我們可以采用ViT或者[0099]所述預訓練的視覺語言模型通過文本編碼器對所述目標缺陷的語言文本進行編[0100]通過WordPiece嵌入器對語言文本中的單詞進行分割,將切割后的單詞映射到一由多頭自注意力機制和前饋神經(jīng)網(wǎng)絡(luò)組成,這些編碼器可以捕獲單詞之間的上下文信息,[0105]所述預訓練的視覺語言模型將所述圖像特征向量以及所述文本特征向量進行融[0106]將所述圖像特征向量以及文本特征向量輸入到所述預訓練的視覺語言模型的跨[0107]將所述融合了文本信息的圖像特征向量乘以所述融合了圖像特征的文本特征向[0110]圖3是根據(jù)一示例性實施例示出的基于預訓練模型的工業(yè)缺陷檢測裝置的系統(tǒng)示[0113]輸入模塊3:用于將待檢測圖像和目標缺陷所對應的語言文本輸入到所述預訓練[0114]目標缺陷檢測模塊4:用于通過所述預訓練的視覺語言模型結(jié)合所述待檢測圖像[0115]可以理解的是,本申請通過視覺語言模型訓練模塊1用于獲取工業(yè)缺陷檢測圖像通過語言文本生成模塊2用于針對每種場景下的每種工業(yè)缺陷設(shè)置語言文本,所述語言文本用于描述該工業(yè)缺陷的特征;通過輸入模塊3用于將待檢測圖像和目標缺陷所對應的語言文本輸入到所述預訓練的視覺語言模型中;通過目標缺陷檢測模塊4用于通過所述預訓圖像以及目標缺陷的語言文本,通過在待檢測圖像上尋找與語言文本相關(guān)聯(lián)的物體區(qū)域,

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負責。
  • 6. 下載文件中如有侵權(quán)或不適當內(nèi)容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論