解析IBM x3850 RAID5服务器故障恢复方案

  

<强>【基本信息】
服务器型号:IBM X3850服务器,
硬盘型号:73 g SAS硬盘,
硬盘数量:5块硬盘其中4块组成一个RAID5,另一块做为热备盘(热备件),
操作系统:redhat linux 5.3,应用系统为构架于甲骨文的一个oa。

  

<强>【故障表现】
3号盘早已经离线,但热备盘未自动激活重建(原因不明),之后2号盘离线,RAID崩溃。
甲骨文已经不再对本oa系统提供后续支持,用户要求尽可能数据恢复+操作系统复原。

  

【初检结论】
热备盘完全无启用,硬盘无明显物理故障,无明显同步表现。数据通常可恢复。

  

<强>【恢复方案】
1,保护原环境,关闭服务器,确保在恢复过程中不再开启服务器。
2,把故障硬盘编号排的序,用以确保硬盘取出槽位后可以完全复原。
3,将故障硬盘挂载至只读环境,对所有故障硬盘做完全镜像(参考& lt;如何对磁盘做完整的全盘镜像备份祝辞)。备份完成后交回原故障盘,之后的恢复操作直到数据确认无误前不再涉及原故障盘。
4,对备份盘进行突袭结构分析,得到其原来的RAID级别,条带规则,条带大小,校验方向,元区域等。
5,根据得到的RAID信息搭建一组虚拟的RAID5环境。
6,进行虚拟磁盘及文件系统解释。
7日检测虚拟结构是否正确,如不正确,重复4 - 7过程。
8,确定数据无误后,按用户要求回迁数据。如果仍然使用原盘,需确定已经完全对原盘做过备份后,重建RAID,再做回迁。回迁操作系统时,可以使用linux的livecd或赢得pe(通常不支持)等进行,也可以在故障服务器上用另外硬盘安装一个回迁用的操作系统,再进行扇区级别的回迁。
9数据移交后,由我数据恢复中心延长保管数据3天,以避免可能忽略的纰漏。

  

<强>【预估周期】
备份时间:2小时左右
解释及导出数据时间:约4小时
回迁操作系统:约4小时。

  

<强>【过程详解】
1,对原硬盘进行完整镜像,镜像后发现2号盘有10 - 20个坏扇区,其余磁盘均无坏道。
2,通过对结构的分析得到的最佳结构为0,1,2,3盘序,缺3号盘,块大小512扇区,向后平价(Adaptec),结构如下图:
解析IBM x3850 RAID5服务器故障恢复方案”> <br/> 3组好后数据验证,200米以上的最新压缩包解压无报错,确定结构正确。<br/> 4,直接按此结构生成虚拟袭击到一块单硬盘上,打开文件系统无明显报错。<br/> 5,确定备份包安全的情况下,经客户同意后,对原盘重建RAID,重建时已经用全新硬盘更换损坏的2号盘。将恢复好的单盘用USB方式接入故障服务器,再用linux SystemRescueCd启动故障服务器,之后通过dd命令进行全盘回写。<br/> 6,回写后,启动操作系统。<br/> 7, dd所有数据后,启动操作系统,无法进入,报错信息为:到/etc/rc。sysinit: 1号线:/sbin/pidof:没有权限,分析为此文件权限有问题。<br/> 8,用SystemRescueCd重启后检查,此文件时间,权限,大小均有明显错误,显然节点损坏。<br/> 9日重新分析重组数据中的根分区,定位出错的/sbin/pidof,发现问题因2号盘坏道引起。<br/> 10,使用0、1、3这3块盘,针对2号盘的损坏区域进行xor补齐。补齐后重新校验文件系统,依然有错误,再次检查索引节点表,发现2号盘损坏区域有部分节点表现为(图中的55 55 55部分):<br/> <img src=解析IBM x3850 RAID5服务器故障恢复方案