




下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、某公司数据恢复报告书、故障描述1、设备清单设备名称设备型号数量HPFCff储HPMSA20001450GSAS1盘82、故障描述整个存储空间由8块450GBSA的硬盘组成,其中7块硬盘组成一个RAID5的阵列,剩余1块做成热备盘使用。由于RAID5阵列中出现2块硬盘损坏,而此时只有一块热备盘成功激活,因此导致RAID5阵列瘫痪,上层LUN无法正常使用。、检测磁盘由于存储是因为RAID阵列中某些磁盘掉线,从而导致整个存储不可用因此接收到磁盘后先对所有磁盘做物理检测,检测完后发现没有物理故障。接着使用坏道检测工具检测磁盘坏道,发现也没有坏道。磁盘坏道检测日志如下图:排口椎记犊文件时羯希旧翎时背音旧
2、帚的如3015/109/11,17:19:00,匚疝/130冷哈”.匹SENATEET3啦题娜->E:Liig匚皿1、加1亍。胃口医ECL血盘如如亍由儿PEJ<匚而判1冠亍口丁立K.aCL疝“L>t«S-flt11,ic_aCxmizgu?2015-DG-J1,1。/口向"Log如11,1火Sector0>begumsoffile8791097,568Sectnes2015,3/11,18:14:04.6时也为L96?sec1c-(s;suxessfuliycopiei0badajurcesectursetKouirterei匚加小1出后吧】!,UL
3、B_iKtstssaiLAhiaLiirit-srpi丫匚般Cti-DlO.t-rp三、备份数据考虑到数据的安全性以及可还原性,在做数据恢复之前需要对所有源数据做备份,以防其他原因导致数据无法再次恢复。使用dd命令或winhex工具将所有磁盘都镜像成文件。备份完部分数据如下图:新加卷图:)更金三共写新建文件夹1名若*|修改日期|类型.1.ing2C15/19/2:l10:30IMG文件匚img2C15/?/Zl1194工眄文件一3i»§aiis网/5ii;xIMG文件4-img2O15W2113115工龄文件5.img2O15W211352IMG文件_&ii*gZ0
4、15/3/E1K:31IMG文件一7,img2015/S/Z1IT;31工版文件4i”-1/22l&:30IMG文件四、故障分析1、分析故障原因由于前两个步骤并没有检测到磁盘有物理故障或者是坏道,由此推断可能是由于某些磁盘读写不稳定导致故障发生。因为HPMSA2000空制器检查磁盘的策略很严格,一旦某些磁盘性能不稳定,HPMSA2000空制器就认为是坏盘,就将认为是坏盘的磁盘踢出RAID组。而一旦RAID组中掉线的盘到达到RAID级别允许掉盘的极限,那么这个RAID组将变的不可用,上层基于RAID组的LUN也将变的不可用。目前初步了解的情况为RAID组的LUN有6个,均分配给HP-Un
5、ix小机使用,上层做的LVM逻辑卷,重要数据为Oracle数据库及OA服务端。2、分析RAID组结构HPMSA2000#储的LUN都是基于RAID组的,因此需要先分析底层RAID组的信息,然后根据分析的信息重构原始的RAID组。分析每一块数据盘,发现4号盘的数据同其它数据盘不太一样,初步认为可能是hotSpare盘。接着分析其他数据盘,分析Oracle数据库页在每个磁盘中分布的情况,并根据数据分布的情况得出RAID组的条带大小,磁盘顺序及数据走向等RAID组的重要信息。3、分析RAID组掉线盘根据上述分析的RAID信息,尝试通过北亚自主开发的RAID虚拟程序将原始的RAID组虚拟出来。但由于整
6、个RAID组中一共掉线两块盘,因此需要分析这两块硬盘掉线的顺序。仔细分析每一块硬盘中的数据,发现有一块硬盘在同一个条带上的数据和其他硬盘明显不一样,因此初步判断此硬盘可能是最先掉线的,通过北亚自主开发的RAID校验程序对这个条带做校验,发现除掉刚才分析的那块硬盘得出的数据是最好的,因此可以明确最先掉线的硬盘了。4、分析RAID组中的LUN信息由于LUN是基于RAID组的,因此需要根据上述分析的信息将RAID组最新的状态虚拟出来。然后分析LUN在RAID组中的分配情况,以及LUN分配的数据块MAP。底层有6个LUN,因此只需要将每一个LUN的数据块分布MAP提取出来。然后针对这些信息编写相应的程
7、序,对所有LUN的数据MAP做解析,然后根据数据MAP并导出所有LUN的数据。yu必1JL4W-5-UAMvAmJi唏2喇比。雷斑睇_vcliifttI.irjSllWl?9螃典飒史二UM3明睇醺,螂,忆LIE2DIW1E17:30此文件色股工¥匕近;谑眄呐2U:U而州需KE20L5W加源时甑,拈1吟4)匕血二呜r:i2嘛建出即_Yclnne_5.】叮他那曲屈1二)_忙血尼型近二咤2M比17:13驷交件善如yc1um_6.5M12:11福眈vclwJJECAJ.LIE*1ri1b-21囱船2H即建35EB五、LVM逻辑卷及VXFS文件系统修复1、解析LVM逻辑卷分析生成出来的所有LU
8、N,发现所有LUN中均包含HP-Unix的LVM逻辑卷信息。尝试解析每个LUN中的LVM信息,发现其中一共有三套LVM,其中45G的LVM中划分了一个LV,里面存放OA服务器端的数据,190G的LVM中划分了一个LV,里面存放临时备份数据。剩余4个LUN组成一个2.1T左右的LVM,也只划分了一个LV,里面存放Oracle数据库文件。编写解释LVM的程序,尝试将每套LVM中的LV卷都解释出来,但发现解释程序出错。2、修复LVM逻辑卷仔细分析程序报错的原因,安排开发工程师debug程序出错的位置,并同时安排高级文件系统工程师对恢复的LUN做检测,检测LVM信息是否会因存储瘫痪导致LVM逻辑卷的信
9、息损坏。经过仔细检测,发现确实因为存储瘫痪导致LVM信息损坏。尝试人工对损坏的区域进行修复,并同步修改程序,重新解析LVM逻辑卷。3、解析VXF成件系统搭建HP-Unix环境,将解释出来的LV卷映射到HP-Unix,并尝试Mount文件系统。结果Mount文件系统出错,尝试使用“fsck-Fvxfs”命令修复vxfs文件系统,但修复结果还是不能挂载,怀疑底层vxfs文件系统的部分源数据可能被破坏,需要进行手工修复。4、修复VXF成件系统仔细分析解析出来的LV,并由g据VXFSi件系统的底层结构校验此文件系统是否完整。分析发现底层VXFSi件系统果然有问题,原来当时存储瘫痪的同时此文件在系统正在
10、执行IO操作,因此导致部分文件系统源文件没有更新以及损坏。人工对这些损坏的源文件进行手工修复,保证VXFSC件系统能够正常解析。再次将修复好的LV卷挂载到HP-Unix小机上,尝试Mount文件系统,文件系统没有报错,成功挂载。六、检测Oracle数据库文件并启动数据库1、恢复所有用户文件在HP-Unix机器上mount文件系统后,将所有用户数据均备份至指定磁盘空间。所有用户数据大小在1.2TB左右。部分文件目录截图如下:翻|麟鹏|翅!|处3脑士皿p印西网13”湘文版2015网/语S3:2B文件夹3Eat也g&flE舜期132S:29蝌gloit+fcW2015/S/1323:29文件
11、突4初5/W1323瓢文腰2、检测数据库文件是否完整使用Oracle数据库文件检测工具“dbV佥测每个数据库文件是否完整,发现并没有错误。再使用北亚自主研发的Oracle数据库检测工具(检验更严格),发现有部分数据库文件和日志文件校验不一致,安排高级数据库工程师对此类文件进行修复,并再次校验,直到所有文件校验均完全通过。3、启动Oracle数据库由于我们提供的HP-Unix环境没有此版本的Oracle数据,因此和用户协调将原始生成环境带至北亚数据恢复中心,然后将恢复的Oracle数据库附加到原始生产环境的HP-Unix服务器中,尝试启动Oracle数据库,Oracle数据库启动成功。部分截图如
12、下:ORA-OL1S7:cannotidentify/lockdanafile1-seeDBWRtracefileORA-Olllfl!dataftle1:T/iMir/dini9/bb/a/9Lin.2SS.722277571TSQL>startuppfile=/u01/oracle/aiinin/orcl/pfile/init»ora»812201511443.dir.isQRA-010S1:cannotatarta1ready-runningORACLE-shutitdounfirstSQLshutdowniMDedLateORA-01105!dauabagen
13、.ocopenDatabasediamountedORACLEInstanoeshut;down,SQL>startuppfile-ZuOl/QTdcle/admin/orcl/pfile/lnlt,ora,£12201511443«dmisORACLEinstancestarted.T&ta.lSyatEinGlotjalAr?ea1207959552FiKed512EVariableSizeDatabaseBuffersRedoBuffersDa.tabaseniDunced-Da.&haaeopened.SQL>SQL>5QL>
14、SQL>|127337231367538£7241523215503360bytesbytesbytegbytesbytesrrIit七、数据验证由用户方配合,启动Oracle数据库,启动OA服务端,在本地笔记本安装OA客户端。通过OA客户端对最新的数据记录以及历史数据记录进行验证,并且有用户安排远程不同部门人员进行远程验证。最终数据验证无误,数据完整,数据恢复成功。八、移交数据用户方重新购买了8块HP-MSA2000原厂硬盘,由北亚工程师配合重新对HP-MSA2000存储进行配置。创建和原始一样的Volume,并将恢复的数据全部复制到重新配置好的存储中,并验证所有服务能够正常启动,包括Oracle数据库服务,OA服务端等。九、数据恢复结论由于故障发生后保存现场环境良好,没做相关危险的操作,对后期的数据恢复有很大的帮助。整个数据恢复过程中虽然遇到好多技术瓶颈,但也都一一解决。最终在预期的时间内完成整个数据恢复,恢复的数据用户方也相当满意。十、项目成员列表工程师姓名电话邮箱商务张晓娜185
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年中国工业制造RFID行业市场动态分析、发展方向及投资前景分析报告
- 农业气候风险防控与应对机制
- 低空经济飞行器管理与运营方案
- 大气污染防治策略与路径
- 初级社会工作实务-初级社会工作者考试《社会工作实务》点睛提分卷2
- 2018-2019学年高中一轮复习英语讲义选修六Module4Music
- 员工绩效工资奖金发放方案
- 鸭腺病毒3型基因组序列分析及致病性研究
- 九年级数学上册专题训练八平面图形的运动及不规则图形面积问题课时精讲新版新人教版
- 中介转让店铺合同范例
- 2025年江苏南通炜赋集团有限公司招聘笔试参考题库含答案解析
- 《中国象棋基础教程》课件
- 大模型落地应用实践方案
- 写字楼反恐防暴演练
- 2025年鞍钢集团招聘笔试参考题库含答案解析
- 2025年劳务合同范本(2篇)
- 人文社科类横向课题技术服务合同5篇
- MCN机构的业务模式与盈利模式
- 高压氧护理进修汇报
- 2024解析:第五章透镜及其应用-讲核心(解析版)
- 《国家的空间特征》课件
评论
0/150
提交评论