网站建设 通讯员,多商户海外商城源码下载,建设系统网站首页,宿迁房产网官网备案一、故障描述1、设备清单设备名称设备型号数量HP FC存储HP MSA20001450G SAS.硬盘82、故障描述整个存储空间由8块450GB SAS的硬盘组成#xff0c;其中7块硬盘组成一个RAID5的阵列#xff0c;剩余1块做成热备盘使用。由于RAID5阵列中出现2块硬盘损坏#xff0c;而此时只有一块… 一、故障描述 1、设备清单设备名称设备型号数量HP FC存储HP MSA20001450G SAS.硬盘8 2、故障描述 整个存储空间由8块450GB SAS的硬盘组成其中7块硬盘组成一个RAID5的阵列剩余1块做成热备盘使用。由于RAID5阵列中出现2块硬盘损坏而此时只有一块热备盘成功激活因此导致RAID5阵列瘫痪上层LUN无法正常使用。 二、检测磁盘 由于存储是因为RAID阵列中某些磁盘掉线从而导致整个存储不可用。因此接收到磁盘后先对所有磁盘做物理检测检测完后发现没有物理故障。接着使用坏道检测工具检测磁盘坏道发现也没有坏道。磁盘坏道检测日志如下图 三、备份数据 考虑到数据的安全性以及可还原性在做数据恢复之前需要对所有源数据做备份以防其他原因导致数据无法再次恢复。使用dd命令或winhex工具将所有磁盘都镜像成文件。备份完部分数据如下图 四、故障分析 1、分析故障原因 由于前两个步骤并没有检测到磁盘有物理故障或者是坏道由此推断可能是由于某些磁盘读写不稳定导致故障发生。因为HP MSA2000控制器检查磁盘的策略很严格一旦某些磁盘性能不稳定HP MSA2000控制器就认为是坏盘就将认为是坏盘的磁盘踢出RAID组。而一旦RAID组中掉线的盘到达到RAID级别允许掉盘的极限那么这个RAID组将变的不可用上层基于RAID组的LUN也将变的不可用。目前初步了解的情况为RAID组的LUN有6个均分配给HP-Unix小机使用上层做的LVM逻辑卷重要数据为Oracle数据库及OA服务端。 2、分析RAID组结构 HP MSA2000存储的LUN都是基于RAID组的因此需要先分析底层RAID组的信息然后根据分析的信息重构原始的RAID组。分析每一块数据盘发现4号盘的数据同其它数据盘不太一样初步认为可能是hot Spare盘。接着分析其他数据盘分析Oracle数据库页在每个磁盘中分布的情况并根据数据分布的情况得出RAID组的条带大小磁盘顺序及数据走向等RAID组的重要信息。 3、分析RAID组掉线盘 根据上述分析的RAID信息尝试通过北亚自主开发的RAID虚拟程序将原始的RAID组虚拟出来。但由于整个RAID组中一共掉线两块盘因此需要分析这两块硬盘掉线的顺序。仔细分析每一块硬盘中的数据发现有一块硬盘在同一个条带上的数据和其他硬盘明显不一样因此初步判断此硬盘可能是最先掉线的通过北亚自主开发的RAID校验程序对这个条带做校验发现除掉刚才分析的那块硬盘得出的数据是最好的因此可以明确最先掉线的硬盘了。 4、分析RAID组中的LUN信息 由于LUN是基于RAID组的因此需要根据上述分析的信息将RAID组最新的状态虚拟出来。然后分析LUN在RAID组中的分配情况以及LUN分配的数据块MAP。底层有6个LUN因此只需要将每一个LUN的数据块分布MAP提取出来。然后针对这些信息编写相应的程序对所有LUN的数据MAP做解析然后根据数据MAP并导出所有LUN的数据。 五、LVM逻辑卷及VXFS文件系统修复 1、解析LVM逻辑卷 分析生成出来的所有LUN发现所有LUN中均包含HP-Unix的LVM逻辑卷信息。尝试解析每个LUN中的LVM信息发现其中一共有三套LVM其中45G的LVM中划分了一个LV里面存放OA服务器端的数据190G的LVM中划分了一个LV里面存放临时备份数据。剩余4个LUN组成一个2.1T左右的LVM也只划分了一个LV里面存放Oracle数据库文件。编写解释LVM的程序尝试将每套LVM中的LV卷都解释出来但发现解释程序出错。 2、修复LVM逻辑卷 仔细分析程序报错的原因安排开发工程师debug程序出错的位置并同时安排高级文件系统工程师对恢复的LUN做检测检测LVM信息是否会因存储瘫痪导致LVM逻辑卷的信息损坏。经过仔细检测发现确实因为存储瘫痪导致LVM信息损坏。尝试人工对损坏的区域进行修复并同步修改程序重新解析LVM逻辑卷。 3、解析VXFS文件系统 搭建HP-Unix环境将解释出来的LV卷映射到HP-Unix并尝试Mount文件系统。结果Mount文件系统出错尝试使用“fsck –F vxfs” 命令修复vxfs文件系统但修复结果还是不能挂载怀疑底层vxfs文件系统的部分源数据可能被破坏需要进行手工修复。 4、修复VXFS文件系统 仔细分析解析出来的LV并根据VXFS文件系统的底层结构校验此文件系统是否完整。分析发现底层VXFS文件系统果然有问题原来当时存储瘫痪的同时此文件在系统正在执行IO操作因此导致部分文件系统源文件没有更新以及损坏。人工对这些损坏的源文件进行手工修复保证VXFS文件系统能够正常解析。再次将修复好的LV卷挂载到HP-Unix小机上尝试Mount文件系统文件系统没有报错成功挂载。 六、检测Oracle数据库文件并启动数据库 1、恢复所有用户文件 在HP-Unix机器上mount文件系统后将所有用户数据均备份至指定磁盘空间。所有用户数据大小在1.2TB左右。部分文件目录截图如下 2、检测数据库文件是否完整 使用Oracle数据库文件检测工具“dbv”检测每个数据库文件是否完整发现并没有错误。再使用北亚自主研发的Oracle数据库检测工具检验更严格发现有部分数据库文件和日志文件校验不一致安排高级数据库工程师对此类文件进行修复并再次校验直到所有文件校验均完全通过。 3、启动Oracle数据库 由于我们提供的HP-Unix环境没有此版本的Oracle数据因此和用户协调将原始生成环境带至北亚数据恢复中心然后将恢复的Oracle数据库附加到原始生产环境的HP-Unix服务器中尝试启动Oracle数据库Oracle数据库启动成功。部分截图如下 七、数据验证 由用户方配合启动Oracle数据库启动OA服务端在本地笔记本安装OA客户端。通过OA客户端对最新的数据记录以及历史数据记录进行验证并且有用户安排远程不同部门人员进行远程验证。最终数据验证无误数据完整数据恢复成功。 八、移交数据 用户方重新购买了8块HP-MSA2000原厂硬盘由北亚工程师配合重新对HP-MSA2000存储进行配置。创建和原始一样的Volume并将恢复的数据全部复制到重新配置好的存储中并验证所有服务能够正常启动包括Oracle数据库服务OA服务端等。 九、数据恢复结论 由于故障发生后保存现场环境良好没做相关危险的操作对后期的数据恢复有很大的帮助。整个数据恢复过程中虽然遇到好多技术瓶颈但也都一一解决。最终在预期的时间内完成整个数据恢复恢复的数据用户方也相当满意。 十、项目成员列表工程师姓名电话邮箱商务张晓娜18515283863zxn#frombyte.com项目主管邓奇18515283878dq#frombyte.com存储工程师邓奇18515283878dq#frombyte.comRAID工程宋国建18515283861songguojian#frombyte.com开发工程师秦颖吉18515283871qyj#frombyte.com文件系统工程师宋国建18515283861songguojian#frombyte.com审核工程师张宇 工程师职能 商务工程师负责反馈消息给用户 初检工程师负责设备初检事宜 实施工程师负责设备数据安全救援事宜 审核工程师负责每一步流程审核