HC1209205 第五章 集群NAS存儲系統故障處理2.0_第1頁
HC1209205 第五章 集群NAS存儲系統故障處理2.0_第2頁
HC1209205 第五章 集群NAS存儲系統故障處理2.0_第3頁
HC1209205 第五章 集群NAS存儲系統故障處理2.0_第4頁
HC1209205 第五章 集群NAS存儲系統故障處理2.0_第5頁
已閱讀5頁,還剩44頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

修訂記錄課程編碼適用產品產品版本課程版本ISSUEHC1209205N8500V100R002V2.0開發/優化者時間審核人開發類型(新開發/優化)張博2013-09-20余雷新開發本頁不打印HC1209205

集群NAS存儲系統故障處理目標學完本課程后,您將能夠:了解N8500問題處理流程掌握N8500常見問題及故障的處理方法具備集群NAS典型故障分析處理能力

目錄N8500故障處理的原則、方法N8500故障處理的流程N8500分類故障以及典型問題處理方法N8500故障處理案例

先外部后內部先高級后低級先共性后個別故障處理原則故障處理方法分析法替換法看告警信息并配合對性能數據的分析替換懷疑工作不正常的部件

目錄N8500故障處理的原則、方法N8500故障處理的流程N8500分類故障以及典型問題處理方法N8500故障處理案例N8500故障處理流程N8500信息收集故障發生時,需要第一時間收集故障相關信息,主要包括:故障發生的具體時間故障現象的詳細描述N8000設備的版本故障后已經采取的措施和結果客戶業務組網環境、目前業務情況收集N8000設備的日志信息集群NAS引擎日志系統日志位置日志文件日志用途/var/logmessage操作系統相關的所有關鍵事件/var/logsfsfs_event.log引擎的network,storage服務所產生的事件日志/opt/VRTSnasgw/logUpgrade.log引擎系統升級中的過程/opt/VRTSnasgw/logscanbus.log引擎掃描磁盤操作中搜集的相關信息和關鍵事件/opt/VRTSnasgw/logCIFS.logCIFS共享操作相關的集群管理服務操作及相關事件/opt/VRTSnasgw/logNFSAgent.logNFS共享代理操作相關的集群管理服務操作及相關事件/var/VRTSvcs/logEngine_A.logVCS集群日志故障分析定位和排除故障分析判斷和定位通過對收集的信息進行分析,從眾多可能原因中找出故障原因的過程,通過故障分析,可以確定故障范圍、故障種類、故障發生的具體原因以及故障排除的手段。故障排除是指采取適當的措施或步驟清除故障、恢復系統及業務的過程,具體的方式有檢修線路、更換硬件、修改配置數據、重新啟動服務或應用程序、替換損壞文件、重新啟動系統、修復文件系統及服務等故障分析定位的主要方法原始信息分析指示燈狀態分析告警信息分析告警信息分析日志信息分析消息跟蹤分析故障分析定位的主要方法原始信息分析指示燈狀態分析告警信息分析告警信息分析日志信息分析消息跟蹤分析

目錄N8500故障處理的原則、方法N8500故障處理的流程N8500分類故障以及典型問題處理方法N8500故障處理案例1、節點控制器故障2、接口卡故障3、節點系統硬盤故障4、節點電源風扇故障1、引擎軟件安裝和登錄故障2、集群容錯故障3、

功能使用故障1、硬件故障2、RAID和LUN故障3、性能故障4、主機與存儲連接故障5、數據丟失故障引擎節點硬件故障引擎節點軟件故障存儲單元故障集群NAS系統故障分類集群NAS系統故障影響1、業務中斷2、業務性能下降1、無法登錄2、集群節點無法切換3、

業務性能下降4、業務功能無法使用1、文件資源失效2、業務中斷3、性能下降4、數據丟失引擎節點硬件故障引擎節點軟件故障存儲單元故障集群NAS典型故障診斷后端存儲故障引起系統異常引擎節點硬件故障引起系統異常內部通信鏈路問題診斷管理模塊問題診斷文件系統故障診斷文件讀寫性能問題診斷NFS掛載和訪問問題診斷CIFS掛載和訪問問題診斷網絡問題診斷1、后端存儲故障引起NAS系統異常2、引擎節點硬件故障引起系統異常3、集群NAS內部網絡問題內部通信鏈路問題分析和處理方法引擎之間心跳網絡故障序號問題解決方案1腦裂1、停止業務2、修復心跳網絡3、配置iofencing硬盤,引擎識別到iofencing硬盤,但是不用加入pool4、啟用iofencing功能,重啟整個集群內部通信鏈路問題分析和處理方法引擎與存儲單元的鏈路故障序號問題解決方案1某個節點不能掃描到硬盤1、檢查該節點的系統狀態

2、查看該節點的HBA卡的狀態并恢復正常2執行scanbus、mount操作時掛死1、檢查所有存儲單元的狀態2、查看所有存儲單元與引擎的FC連接狀態,如果有存儲單元的FC連接異常,需要修復連接。3、在引擎主節點的support模式下,通過kill命令刪除scanbus進程4、重啟主節點內部通信鏈路問題分析和處理辦法序號問題解決方案1存儲單元端FC誤碼率過高1、更換光纖線、光模塊和FC主機口

2、更換控制器2引擎、存儲單元與光纖交換機的協商問題1、登錄存儲單元,查看HBA卡的連接狀態和速率,修改HBA的連接狀態為點對點或者交換機模式2、登錄光纖交換機,更改端口模式4、管理模塊問題管理模塊問題解決方案序號問題解決方案1console口所在的物理網卡沒有連網線連上網線,等待1分鐘后重新登錄2console地址與網絡上其他主機有沖突1、通過KVM修改console地址

2、修改沖突主機上的IP地址3資源offline1、通過hagrp-stat|grepMan

2、通過hagrp-onlineManagementConsole-sysN8300_01命令上線5、集群NAS文件系統故障故障集群NAS文件系統故障分析和處理步驟步驟一:確認引擎和存儲單元間的鏈路是否正常登錄N8000,執行storagedisklistpaths,查看每個節點鏈路狀態若存在非active的鏈路,恢復鏈路后執行storagescanbus,手動online文件系統步驟二:登錄存儲單元,確認存儲單元狀態查看是否有存儲單元故障,參考存儲單元故障處理內容。是否誤刪N8000文件系統在用的LUN,請聯系技術支持是否誤刪映射,恢復LUN映射,執行storagescanbus,文件系統可自動恢復,若無法恢復,聯系技術支持。集群NAS文件系統故障分析和處理步驟步驟三:通過master賬號登錄引擎,確認是否文件系統故障手動online文件系統,如果online成功,則恢復業務,收集debuginfo信息如果無法online,查看文件系統標志位如果文件系統需要做fsck,請聯系技術支持。步驟四:fsck完成后,手動online文件系統如果可以,收集debuginfo供技術支持定位原因;如果不能,則重啟系統再嘗試online,執行過程時請聯系技術支持。6、文件讀寫性能問題文件讀寫性能問題原因分析文件讀寫性能問題診斷-業務變更原因分析原來只有順序讀寫業務,現在變成了隨機讀寫業務;原來有只有讀業務,現在加入了寫業務;原來有10路用戶并發,現在更多路用戶同時并發;其他復雜業務變更。處理意見:由于業務類型的變化而造成的流量上的下降屬正常現象,無需處理。文件讀寫性能問題診斷-存儲單元原因文件讀寫性能問題診斷思路-引擎原因原因分析文件系統存儲及文件系統參數配置不當文件系統存放大量小文件,并且文件系統利用率大于80%,造成檢索速度下降集群狀態:IP地址在集群各節點上分布不均勻服務狀態(NFS/CIFS)參數設置不當。7、NFS掛載和訪問問題NFS掛載和訪問問題總結NFS掛載和訪問問題常見問題包括:客戶端原因:掛載參數錯誤、防火墻原因、權限問題。網絡原因:無法ping通N8000的虛擬IP;DNS服務器無法連通;網絡鏈路不穩定。N8000原因:NFS服務或虛擬IPoffline;文件系統故障;NFS相關服務資源異常。8、CIFS掛載和訪問問題診斷CIFS掛載和訪問問題總結CIFS模塊問題常見問題包括:客戶端原因:掛載參數錯誤、防火墻原因、權限問題網絡原因:無法ping通N8000的虛擬IP;DNS服務器出現問題;網絡鏈路不穩定N8000原因:CIFS服務或虛擬IPoffline;文件系統故障;CIFS相關服務資源異常9、NAS網絡問題NAS網絡問題診斷總結

目錄N8500故障處理的原則、方法N8500故障處理的流程N8500分類故障以及典型問題處理方法N8500故障處理案例案例1:管理模塊無法登錄問題描述:客戶反映無法通過master登錄集群,顯示該賬號不可用原因分析:1、通過終端可以ping通管理console地址2、通過KVM連接到集群,通過support賬號登錄集群,使用hastatus–sum|grepMan查詢狀態為offline,執行hagrp-onlineManagementConsole-systestN8300_013、在集群的support賬號下,使用ethtool查看管理網口的物理狀態。通過在主機端檢查arp–a發現consoleip的mac地址不是集群管理網口的mac地址,表明網絡中的ip地址有沖突案例2問題及故障描述集群在設置IOfencing后,重啟整個集群,出現部分節點無法加入集群的情況,此現象概率出現原因分析集群重啟時,IO防護為了防止集群腦裂,會將部分啟動較慢的節點排除出集群。因此不允許直接重啟整個集群。若必須將所有節點都進行重啟,請一次只重啟一個節點,待該節點完全啟動并可以提供業務時,再重啟下一個節點,直到所有節點全部重啟完畢,且可以正常提供業務

處理步驟該現象發生后,重啟未能加入集群的節點即可修復案例3問題及故障描述在有NFS業務時,重啟一個業務節點后,一個文件系統offline,導致該文件系統不可訪問原因分析重啟節點與主節點的時間不一致導致,集群為保護文件系統一致性,強制將文件系統標志位設置為1,引起文件系統offline處理步驟登錄到集群管理界面的storage模式下,使用fsfsckfs100g命令進行文件系統修復,修復完成后需要使用fsonlinefs100g的命令將文件系統上線案例4問題及故障描述把一個節點從集群刪除后再加入集群,該節點的NFS共享服務fault,業務IP無法切換到該節點原因分析在添加一個新的節點加入集群時,必須保證該節點是全新安裝的節點,否則由于原來刪除的節點依然保留有原有集群的信息,可能導致發生異常情況處理步驟出現此問題時,執行nfsserverstart命令重啟NFS服務,即可將虛擬IPonline到新加入的節點案例5問題及故障描述將系統時區從GMT+8改為GMT+9,系統時間應該增加一個小時,實際情況是減少了一個小時,反之亦然原因分析該問題是由于linux下的時區修改和windows的處理方式不一致導致的處理步驟出現該現象時,立即進行系統時間修改,修改時區會導致文件系統全部掛掉時區修改應在系統安裝完畢后立即修改使用clocktimezone設置時區時直接使用時區名進行設置,不要使用GMT時間進行設置案例6問題及故障描述使用fsonline命令online一個offline狀態的文件系統時,提示該文件系統“Filesystemisalreadyonline”原因分析由于文件系統在節點上mtab信息丟失,但cfs層掛載點正常,而fslist命令是檢測系統mount信息判斷文件系統是否online的,因此顯示文件系統為offline,而fsonline是檢測cfs層掛載點狀態,因此導致無法online文件系統處理步驟出現該現象時,可以在support用戶下,將該文件系統信息手動加入/etc/mtab文件中,則文件系統可以正常顯示為online案例7問題及故障描述對未創建快照的文件系統進行刪除時,提示有快照存在不可刪除原因分析

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論