【基于投票的物體位姿估計(jì)算法分析4400字】_第1頁(yè)
【基于投票的物體位姿估計(jì)算法分析4400字】_第2頁(yè)
【基于投票的物體位姿估計(jì)算法分析4400字】_第3頁(yè)
【基于投票的物體位姿估計(jì)算法分析4400字】_第4頁(yè)
【基于投票的物體位姿估計(jì)算法分析4400字】_第5頁(yè)
已閱讀5頁(yè),還剩10頁(yè)未讀 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡(jiǎn)介

-PAGE44--PAGE43-基于投票的物體位姿估計(jì)算法分析目錄TOC\o"1-3"\h\u4274基于投票的物體位姿估計(jì)算法分析 1230311.1 算法思想 119681.2 像素級(jí)投票網(wǎng)絡(luò)PVNet 285371.2.1 網(wǎng)絡(luò)結(jié)構(gòu) 2280501.2.2 關(guān)鍵點(diǎn)選擇 3307841.2.3 RANSAC算法 564861.3 3D-2DPnP 513121.1.1 PnP算法思路 6238911.1.2 PnP算法數(shù)學(xué)推導(dǎo) 7102311.1.2 不確定性驅(qū)動(dòng)的PnP 872971.4 目標(biāo)姿態(tài)估計(jì)實(shí)驗(yàn)及分析 858711.4.1 實(shí)驗(yàn)環(huán)境及硬件配置 8243711.4.2 數(shù)據(jù)集和預(yù)處理 9247561.4.3 目標(biāo)姿態(tài)估計(jì)結(jié)果 131.1 算法思想在單張RGB圖像的六自由度位姿估計(jì)問題上,很多位姿估計(jì)算法都采取兩階段的方法實(shí)現(xiàn)對(duì)目標(biāo)物體的位姿估計(jì),通常是先采用CNN檢測(cè)關(guān)鍵點(diǎn),然后通過PnP算法求解出物體的估計(jì)位姿,因此成功檢測(cè)出準(zhǔn)確的關(guān)鍵點(diǎn)是很重要的。但是很多方法僅僅通過回歸圖像坐標(biāo)或熱圖確定關(guān)鍵點(diǎn),在處于遮擋截?cái)嗲闆r下時(shí)目標(biāo)物體的部分關(guān)鍵點(diǎn)往往是不可見的,這使得這些算法在面對(duì)目標(biāo)物體處于被遮擋和截?cái)鄦栴}時(shí)有很大的困難,即使它們能夠利用卷積神經(jīng)網(wǎng)絡(luò)來預(yù)測(cè)看不見的關(guān)鍵點(diǎn),但泛化是很困難的。本文使用基于像素投票的方式能夠很好地解決遮擋和截?cái)嗲樾蜗碌年P(guān)鍵點(diǎn)檢測(cè)問題。基于像素投票的物體位姿估計(jì)算法分為兩個(gè)階段,第一階段中PVNet先對(duì)輸入RGB圖像進(jìn)行處理得到向量場(chǎng)預(yù)測(cè)和語義標(biāo)簽,之后利用PVNet輸出的語義標(biāo)簽和從像素指向預(yù)測(cè)關(guān)鍵點(diǎn)的單位向量,隨機(jī)選擇一對(duì)像素的向量,把它們的交叉點(diǎn)看作為一個(gè)關(guān)鍵點(diǎn),重復(fù)這樣的過程的得到一個(gè)關(guān)鍵點(diǎn)假設(shè)集合,然后基于RANSAC投票生成關(guān)鍵點(diǎn)預(yù)測(cè);第二階段在已知目標(biāo)物體的2D關(guān)鍵點(diǎn)位置后可以使用PnP算法求解目標(biāo)物體的六自由度位姿。但是不同的一點(diǎn)是它考慮了不同關(guān)鍵點(diǎn)的可靠度不同,并引入了關(guān)鍵點(diǎn)概率分布的協(xié)方差矩陣,進(jìn)一步提高了目標(biāo)姿態(tài)估計(jì)的魯棒性。算法基本流程如下圖所示:圖1.1基于像素投票位姿估計(jì)算法流程1.2 像素級(jí)投票網(wǎng)絡(luò)PVNet1.2.1 網(wǎng)絡(luò)結(jié)構(gòu)本文采用的PVNet網(wǎng)絡(luò)結(jié)構(gòu)是在基于ResNet-18網(wǎng)絡(luò)模型的進(jìn)行修改,網(wǎng)絡(luò)模型如圖1.2,在ResNet-18網(wǎng)絡(luò)模型有三個(gè)部分的修改,第一部分是取消網(wǎng)絡(luò)中的特征圖大小為H=8×W=8時(shí)后續(xù)的池化,不對(duì)特征圖進(jìn)行下降采樣,減少信息的損失。因?yàn)闇p少池化層改變了感受野,因此需要將Res-Net18里后續(xù)的卷積層替換為合適的空洞卷積層,空洞卷積的原理如圖1.3,空洞卷積的優(yōu)點(diǎn)是在不做池化損失信息的同時(shí)增大了感受野,使得卷積輸出信息范圍增大。同時(shí)需要將Res-Net18網(wǎng)絡(luò)里的全連接層替換為卷積層采用全卷積的結(jié)構(gòu),使得輸入圖片的大小不受限制。圖1.2網(wǎng)絡(luò)結(jié)構(gòu)圖圖1.3DilatedconvPVNet的輸入為H×W×3的圖像,用全卷積結(jié)構(gòu)PVNet對(duì)它進(jìn)行處理,輸出為H×W×(K×2×C)的單位向量和類概率,輸出結(jié)果如圖1.4。圖1.4網(wǎng)絡(luò)輸出結(jié)果1.2.2 關(guān)鍵點(diǎn)選擇在目標(biāo)物體位姿估計(jì)中,要求已知三維物體關(guān)鍵點(diǎn)的關(guān)鍵點(diǎn),結(jié)合通過投票機(jī)制得到的2D關(guān)鍵點(diǎn),再由PnP算法求解位姿。因此三維物體關(guān)鍵點(diǎn)的定義對(duì)關(guān)鍵點(diǎn)的定位影響很大,很多深度學(xué)習(xí)方法定義目標(biāo)物體在3D包圍框的八個(gè)角點(diǎn)為關(guān)鍵點(diǎn)如圖1.5,顯然2D圖像中這8個(gè)角點(diǎn)距離目標(biāo)物體圖像像素距離較遠(yuǎn),由于關(guān)鍵點(diǎn)假設(shè)是由從目標(biāo)物體開始的矢量生成的,這些關(guān)鍵點(diǎn)距離目標(biāo)物體像素的距離越遠(yuǎn)定位誤差就越大,檢測(cè)關(guān)鍵點(diǎn)的難度就越大。因此考慮到在目標(biāo)物體表面選擇關(guān)鍵點(diǎn),我們使用最遠(yuǎn)點(diǎn)采樣算法(FPS)選擇關(guān)鍵點(diǎn)。圖1.53D包圍框最遠(yuǎn)點(diǎn)采樣算法(FPS)是一種常用的采樣算法,能夠?qū)崿F(xiàn)對(duì)樣本的均勻采樣,其基本原理如下:假設(shè)有n個(gè)點(diǎn),要從里面按照FPS算法,采樣出k個(gè)點(diǎn)。將所有點(diǎn)分類到兩個(gè)集合A,B里面。A表示選中的點(diǎn)形成的集合,B表示未選中的點(diǎn)構(gòu)成的集合。最遠(yuǎn)點(diǎn)采樣算法的邏輯如下:每次從集合B里面選一個(gè)到集合A里面的點(diǎn)距離最大的點(diǎn)將其分類到A集合,A集合中的點(diǎn)就是我們采樣得到的關(guān)鍵點(diǎn)集。初始情況下,集合A為空,集合B包括所有點(diǎn)。第一步從集合B中隨機(jī)選一個(gè)點(diǎn)到A集合中。接著選第二個(gè)點(diǎn),選出集合B中所有點(diǎn)中距離A中的點(diǎn)最遠(yuǎn)的點(diǎn),將其分類到A集合中,此時(shí)集合A包含兩個(gè)點(diǎn),集合B包含n-1個(gè)點(diǎn)。選第三個(gè)點(diǎn),這是最遠(yuǎn)點(diǎn)采樣算法的核心;因?yàn)榧螦中不止有一個(gè)點(diǎn),所以我們假設(shè)集合B中一個(gè)點(diǎn)pB:先分別計(jì)算出pB到集合A中每個(gè)點(diǎn)的距離,再取pB使用最遠(yuǎn)點(diǎn)采樣方法選擇關(guān)鍵點(diǎn)的結(jié)果如下圖1.6:圖1.6最遠(yuǎn)點(diǎn)采樣法的關(guān)鍵點(diǎn)分布1.2.3 RANSAC算法PVNet輸出目標(biāo)對(duì)應(yīng)的語義標(biāo)簽以及每個(gè)像素趨于2D關(guān)鍵點(diǎn)XK的向量場(chǎng)預(yù)測(cè),對(duì)于每個(gè)像素點(diǎn)P,其趨向于2D關(guān)鍵點(diǎn)XK的單位向量VV已知語義標(biāo)簽和單位向量Vkh最后,用目標(biāo)物體的所有像素對(duì)關(guān)鍵點(diǎn)假設(shè)進(jìn)行投票,關(guān)鍵點(diǎn)的投票分?jǐn)?shù)的定義如下:w投票分?jǐn)?shù)越高代表與更多的預(yù)測(cè)方向一致,其置信度更高,根據(jù)關(guān)鍵點(diǎn)假設(shè)可以估算關(guān)鍵點(diǎn)的空間概率分布,這里可以求出關(guān)鍵點(diǎn)XK的均值μk和協(xié)方差μk1.3 3D-2DPnP根據(jù)前面工作我們已經(jīng)得到了目標(biāo)物體的2D關(guān)鍵點(diǎn)位置,可以使用PnP算法求解6D姿態(tài),但是本文的投票機(jī)制得出關(guān)鍵點(diǎn)信息是每個(gè)關(guān)鍵點(diǎn)的概率分布,所以區(qū)別于很多姿態(tài)估計(jì)算法中直接使用現(xiàn)有的PnP求解器求解,PVNet算法考慮了關(guān)鍵點(diǎn)置信度的差異和不確定性,使用不確定性驅(qū)動(dòng)的PnP算法求解目標(biāo)物體的6D姿態(tài)。1.1.1 PnP算法思路PnP問題就是解決在已知世界坐標(biāo)系中三維物體關(guān)鍵點(diǎn)信息以及其在圖像上的投影的情況時(shí)如何計(jì)算相機(jī)位姿或物體位姿的問題,PnP問題求解方法還有很多,例如直接線性變換(DLT)、EPnP、P3P、非線性優(yōu)化方式等。我們接下來對(duì)PnP算法的討論的前提是假設(shè)以下相機(jī)處于點(diǎn)Oc,P1、P2、P1為特征點(diǎn)。當(dāng)n=1時(shí),即只有一個(gè)特征點(diǎn)時(shí),假設(shè)P1位于圖像的中心,那么顯然向量Oc當(dāng)n=2時(shí),即多了一個(gè)約束,顯然OcP1P2形成一個(gè)三角形,由于P1、P2兩點(diǎn)位置確定,三角形的邊P1P2確定。再加上向量OcP1和OcP2,從Oc點(diǎn)射向特征點(diǎn)的方向角也能確定。于是能夠計(jì)算出OcP1的長(zhǎng)度=r1,OcP2的長(zhǎng)度=r2。于是這種情況下得到兩個(gè)球:以P1為球心,半徑為r1的球A;以P2為球心,半徑為r2的球B。顯然,相機(jī)位于球A,球B的相交處,依舊是無數(shù)個(gè)解。當(dāng)n=3時(shí),即多了一個(gè)以P3為球心的球C,相機(jī)位于ABC三個(gè)球面的相交處,這次有4組解,其中一個(gè)正解就是相機(jī)真實(shí)的位姿。當(dāng)n>3時(shí),n=3時(shí)已經(jīng)求出4個(gè)解,再加一個(gè)特征點(diǎn)就可以求出唯一正解,但是計(jì)算量過大,過于復(fù)雜,因此可以先通過3個(gè)特征點(diǎn)計(jì)算出4組解,根據(jù)公式:x將第四個(gè)點(diǎn)的世界坐標(biāo)代入,能夠得到在圖像上的四個(gè)投影,將投影誤差最小的作為我們的正解。1.1.2 PnP算法數(shù)學(xué)推導(dǎo)記世界坐標(biāo)系中的三維坐標(biāo)點(diǎn)為A,B,C,2D點(diǎn)為a,b,c其中a,b,c為A,B,C在相機(jī)成像平面上的投影。示意圖如下:圖1.7P3P問題示意圖由余弦定理有:O兩邊同時(shí)除以,并記為,記為,得x記v=A有:x可以解得:(1?u)已知圖像上2D點(diǎn)的位置,則公式中的余弦角已知,可以通過世界坐標(biāo)系下A,B,C的坐標(biāo)算出。未知的,求解這樣一個(gè)二元二次方程組是困難的,需要用到吳消元法,最多得到四個(gè)解,使用驗(yàn)證點(diǎn)來確定最可能的解,從而得到相機(jī)坐標(biāo)系下的3D坐標(biāo),再使用ICP計(jì)算相機(jī)的位姿信息。1.1.2 不確定性驅(qū)動(dòng)的PnP因?yàn)镻VNet網(wǎng)絡(luò)中基于RANSAC投票的機(jī)制給出了每個(gè)關(guān)鍵點(diǎn)的空間概率分布,所以要考慮這種不確定性的帶給姿態(tài)估計(jì)精度的影響。我們?cè)谇懊媸阶又幸呀?jīng)給出了關(guān)鍵點(diǎn)的均值μk以及協(xié)方差kmin

X因?yàn)镻VNet網(wǎng)絡(luò)中基于RANSAC投票的機(jī)制給出了每個(gè)關(guān)鍵點(diǎn)的空間概率分布,所以要考慮信息的不確定性,在原來公式中添加了協(xié)方差矩陣如下:Xk這里的Xk代表關(guān)鍵點(diǎn)的3D坐標(biāo),Xk是1.4 目標(biāo)姿態(tài)估計(jì)實(shí)驗(yàn)及分析1.4.1 實(shí)驗(yàn)環(huán)境及硬件配置本項(xiàng)目使用數(shù)據(jù)集為L(zhǎng)INEMOD數(shù)據(jù)集。LINEMOD數(shù)據(jù)集在深度學(xué)習(xí)目標(biāo)姿態(tài)估計(jì)中被廣泛應(yīng)用,它是一個(gè)標(biāo)準(zhǔn)6D姿態(tài)檢測(cè)數(shù)據(jù)集,數(shù)據(jù)集中包含13個(gè)子集,每個(gè)子集中包含1300張目標(biāo)圖像和目標(biāo)3D模型相關(guān)的虛擬3D控制點(diǎn)文件。實(shí)驗(yàn)中OcclusionLINEMOD數(shù)據(jù)集用于測(cè)試,LINEMOD數(shù)據(jù)集和blender渲染合成的數(shù)據(jù)集作為訓(xùn)練數(shù)據(jù)進(jìn)行訓(xùn)練。本實(shí)驗(yàn)環(huán)境配置如下:表1.SEQ表\*ARABIC\s11項(xiàng)目所用實(shí)驗(yàn)環(huán)境及設(shè)備參數(shù)類型名稱參數(shù)顯卡型號(hào)NvidiaGeforceRTX1050Ti操作系統(tǒng)Ubuntu18.0464位pytorch版本1.4CUDA版本CUDA10.1、cuDNNv7.6.5Python版本1.61.4.2 數(shù)據(jù)集和預(yù)處理(1)LINEMOD數(shù)據(jù)集LINEMOD數(shù)據(jù)集是一個(gè)有許多遮擋場(chǎng)景、低紋理目標(biāo)等數(shù)據(jù)的數(shù)據(jù)集,它可以作為標(biāo)準(zhǔn)6D姿態(tài)檢測(cè)數(shù)據(jù)集,LINEMOD格式數(shù)據(jù)集中包含JPEIGmages,Lable,Label_occlusion等文件。JPEGImages中存放的是訓(xùn)練集圖片,格式為jpg,如圖1.8所示:圖1.8訓(xùn)練集樣本但真正輸入網(wǎng)絡(luò)訓(xùn)練的并不是訓(xùn)練集中的所有圖片,而是train.txt隨機(jī)選擇的圖片作為訓(xùn)練集,如下圖所示。圖1.9訓(xùn)練集選取照片Labels文件夾下存放的是txt格式文件,每個(gè)文件對(duì)應(yīng)一張訓(xùn)練集圖片的關(guān)鍵點(diǎn)的標(biāo)注信息如1.10圖所示,第一個(gè)數(shù)據(jù)為類別編號(hào),其余18個(gè)數(shù)據(jù)為關(guān)鍵點(diǎn)的坐標(biāo)。圖1.10訓(xùn)練集標(biāo)注信息Mask文件下存放的是與JPEGImages文件中訓(xùn)練集圖像對(duì)應(yīng)的掩碼圖像,如圖1.11所示:圖1.11訓(xùn)練集掩碼test.Txt文件夾下保存的是測(cè)試用的所有樣本的絕對(duì)路徑,train.txt中存在訓(xùn)練樣本的所有路徑,.ply文件中是目標(biāo)物體的3D圖像信息如下圖1.12所示圖1.12三維模型(2)基于渲染的訓(xùn)練數(shù)據(jù)合成為了避免產(chǎn)生過擬合,我們?cè)谟?xùn)練集中加入了渲染合成的圖像,使用Blender從3D模型合成渲染圖像,對(duì)每個(gè)目標(biāo)對(duì)象呈現(xiàn)均勻視點(diǎn)采樣的10000幅圖像,結(jié)合從SUN397數(shù)據(jù)集中隨機(jī)的背景合成10000幅圖像。基于渲染合成的訓(xùn)練數(shù)據(jù)如圖1.13所示。圖1.13基于渲染合成的訓(xùn)練數(shù)據(jù)(3)數(shù)據(jù)預(yù)處理首先獲得圖片索引以及高寬,并獲得圖片像素、2D關(guān)鍵點(diǎn)坐標(biāo)以及圖像掩碼用于數(shù)據(jù)增強(qiáng)。首先對(duì)像素格式進(jìn)行轉(zhuǎn)換,再計(jì)算是否屬于前景物體,若在前景物體則對(duì)圖像進(jìn)行隨機(jī)角度旋轉(zhuǎn),此時(shí)像素、圖像掩碼、二維關(guān)鍵點(diǎn)坐標(biāo)都會(huì)旋轉(zhuǎn),之后再對(duì)圖像隨機(jī)進(jìn)行裁剪操作和改變圖像大小,如果只有背景沒有前景則直接進(jìn)行裁剪和填充操作將圖片變換到固定大小。具體代碼實(shí)現(xiàn)如圖1.14所示。圖1.13數(shù)據(jù)增強(qiáng)1.4.3 目標(biāo)姿態(tài)估計(jì)結(jié)果(1)測(cè)試模型檢測(cè)效果圖1.14cat測(cè)試檢測(cè)效果在LINEMOD數(shù)據(jù)集上的測(cè)試結(jié)果如下圖1.15所示。圖1.15LINEMOD數(shù)據(jù)集測(cè)試結(jié)果在Occlusion_LINEMOD數(shù)據(jù)集上的測(cè)試結(jié)果,如圖1.16所示。圖1.16OccluedLINEMOD結(jié)果我們使用2D映射量化(2DProjectionmetric)和模型點(diǎn)平均3D距離量化(ADDmetric)這兩個(gè)兩個(gè)量化標(biāo)準(zhǔn)對(duì)我們的模型進(jìn)行評(píng)估,2D映射量化通過計(jì)算給定的估計(jì)值和真實(shí)姿態(tài)的三維模型點(diǎn)投影之間的平均距離,當(dāng)姿態(tài)距離小于5像素時(shí)我們認(rèn)為姿態(tài)估計(jì)姿態(tài)正確。使用LINEMOD數(shù)據(jù)和合成數(shù)據(jù)訓(xùn)練的模型,在LINEMOD數(shù)據(jù)集進(jìn)行測(cè)試的效果如表1.2所示。表1.2本文方法PVNet與常見的姿態(tài)估計(jì)方法的ADD(-s)評(píng)估方法SSD-6DBB8PVNetcat0.5145.279.34glue027.095.66duck032.852.58ape027.941.62eggbox8.940.099.15為了測(cè)試算法對(duì)遮擋的魯棒性,我們使用LINEMOD和合成數(shù)據(jù)訓(xùn)練的模型來測(cè)

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。

最新文檔

評(píng)論

0/150

提交評(píng)論