服务器维修故障诊断思路大全_第1页
服务器维修故障诊断思路大全_第2页
服务器维修故障诊断思路大全_第3页
服务器维修故障诊断思路大全_第4页
服务器维修故障诊断思路大全_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、前言:相对PC机而言服务器出故障的机率是小多了,但是它的故障给企业也带来了一些影响。作为服务器工程师除要有服务器基础知识以外,还需要具备服务器故障的诊断思路,这样才能最快速的解决问题也可以减少故障停机时间。本文并不是针对某个厂家服务器故障完全手册,而是根据个人经验总结出来的一些经验思路还有一些总结案例。按照下面思路和方法基本上能够解决目前服务器更换式维修的大多数问题。而且里面的一些操作风险性也不是很大,因为服务器本身就是坏的,最坏的情况下就是它一点都不能工作了呗,( 主要确认是否有数据,数据无价啊)而且现在很多厂商都有自己的客服电话关于产品问题打个电话也很方便,所以安心做啦毕竟顾客就是上帝嘛,

2、但因为一般报修最快都是第二天当然如果服务器在保修期内就打电话让售后工程师上门服务,是如果上帝比较着急使用,一般小故障自己解决一下就好了,(大客户如银行等除外,一般当天还得是晚上才能停机解决)目录:一、服务器常见故障分类二、服务器常见故障现象及其对应排错方法三、服务器排错基本原则四、服务器故障需要收集哪些信息五、服务器硬件故障排错实例六、服务器软件故障排错实例七、服务器常见内存故障现象一、服务器常见故障类型分类:A. 开机无显示B,加电BIOS自检阶段故障C.系统和软件安装阶段故障和现象D.操作系统启动失败E.系统运行阶段故障二、服务器常见故障现象及其对应的排除方法A.服务器开机无显示(加电无显

3、示和不加电无显示)1. 检查供电环境2. 检查电源和故障指示灯(故障指示灯状态,目前很多厂商的服务器都有故障指示灯,或故障诊断卡等。)3. 按下电源开关时,键盘指示灯是否亮、风扇是否全部转动4. 是否更换过显示器,尝试更换另外一台显示器5. 插拔内存,用橡皮擦擦拭一下金手指,如果在故障之前有增加内存,去掉增加的内存尝试6. 是否添加了 CPU®果有增加CPE试去掉7. 去掉增加的第三方I/O卡包括Raid卡等8. ClearCMOS (记得使用跳线来清除,尽量不要直接拔电池,每款服务器清除跳线位置不一致,具体找不到电话联系一下厂商客服)9. 尝试更换主板、内存等主要部件10. ?青除

4、静电,将电源线等外插在服务器上的线缆全部拔掉,然后轻按开机键几下B.加电BIOS自检报错1 .根据BIOS自检报错信息提示2 .查看是否外插了第三方的卡或者添加部件,如果有还原基本配置重启3 .做最小化测试4 . 尝试清除CMOS5 . 看能否正常进入BIOSC.系统安装阶段故障和现象1 .查看服务器支持操作系统的兼容版本(从厂商能查到兼容性列表)2 .系统安装蓝屏(对蓝屏故障代码诊断)3 .安装在分区格式化的时候找不到硬盘(阵列驱动没有安装或者没有配置阵列,可以尝试适应引导光盘安装)4 .大于2T的硬盘式应该如何分区(必须使用阵列卡才能实现或者有外插识别卡)(使用阵列卡配置阵列分成一个小于2

5、T的空间,一个大于2T的空间,然后将系统安装在小于2T的上面,安装好系统后在使用GPTT式分区即可)5 .安装过程是死机(检查兼容性列表-查看硬盘接口选择是否正确-阵列驱动安装是否正确-尝试最小化配置安装检查是否为内存和CP屏问题)6 .引导光盘安装失败(使用引导光盘安装失败,查看引导光盘版本是否匹配,尝试手动安装系统,如有阵列重新配置阵列引导安装)D.操作系统启动失败1 .在系统启动自检过程中有报错(具体查看启动报错信息在定方案)2 .启动系统蓝屏(查看蓝屏代码核对)3 .进入登陆界面死机(查看进入单用户或者安全模式是否正常,进入BIOS是否正常、是否会死机,进入磁盘阵列查看阵列状态是否正常

6、,检查测试硬盘是否有坏道,最小化配置启动)4 .忘记密码(windows使用PE破解,linux进入单用户破解)E.系统运行阶段故障1. 安装数据库等应用软件报错(对系统版本和软件版本是否兼容,查看报错信息是否缺少插件)2?系统运行速度变慢(查杀病毒,检测阵列状态,测试硬盘有无坏道,重新安装系统或者修复)3 .运行蓝屏(查看蓝屏代码目录)4 .运行死机(检查进入BIOS是否死机,进入系统后测试部件温度是否正常,windows系统查看dump文件)5 .硬盘拷贝数据文件速度变慢(测试硬盘是否有坏道,如果有阵列检查阵列状态,检查改变条带大小,与软件应用要求测试对比)三?服务器故障排错的基本原则:1

7、. 尽量恢复系统出厂配置a:硬件配置:去除第三方厂商备件和非标配备件b:资源配置:清除CMOS恢复资源初始配置c: BIOS、F/W驱动程序:升级最新的BIOS F/W和相关驱动程序d: TPL :扩展的第三方的I/O卡是否属于该机型的硬件兼容列表(TPL)2. 从基本到复杂a:系统上从个体到网络:首先将存在故障的服务器独立运行,待测试正常后再接入网络运行,观察故障现象变化并处理。b:硬件上从最小系统到现实系统:指从可以运行的硬件开始逐步到现实系统为止。c:软件上从基本系统到现实系统:指从基本操作系统开始逐步到现实系统为止3. 部件交换对比测试a:在最大可能相同的条件下,交换操作简单效果明显的

8、部件b:交换NO澈体,既交换软件环境c:交换硬件,既交换硬件环境d:交换整机,既交换整体环境总结:在服务器的维修中,线索都会显得扑朔迷离,有的甚至按起葫芦翘起瓢。一般来说不可能一次就可以准确地判断出问题的所在。这样就要求工程师要有信心和耐心。出现错误一般的方法都是根据经验优先使用最简单排错方法测试,如果没有解决问题再找其它因素进行测试。总之,服务器出错后必须一步一步解决,没有捷径可言。四、服务器故障排除需要收集哪些信息1.服务器信息:.机器型号:什么厂家的机器、什么型号如:DELL R720服务器?机器序列号或主机编号(如:主机编号为 NC00755666)?是否增加其它设备,如网卡、 Rai

9、d卡、内存、CPU .硬盘配置,如是否做磁盘阵列,阵列级别 .安装什么操作系统及版本(win2003、Redhat等) .在故障前有没有做过操作、或者运行了什么软件 .BIOS版本2.故障信息: .在POSTS检时,屏幕显示的异常信息 .服务器本身指示灯的状态 .报警声和 BEEP CODES .系统的事件记录文件 .Sel日志五、 服务器硬件故障处理实际案例(因厂家机型不同,在实际问题中如果遇到相似现象,也需要具体问题具体分析,请不较复杂,因此在检要盲目套用)硬件故障是指服务器硬件出现异常而导致的各类错误,由于服务器构成比查的时候必须认真、仔细。实例一:有一台XXX型号服务器,配有256M内

10、存,使用一个 PIIIXEON 500带2M高速缓存的处 理器。开机后没有任何显示,但系统日志上提示了一条 CPU电压为0伏的信息,系统指示灯三灯不 停在闪烁(指示灯三灯闪烁是服务器的另一种报警方式,我会在文后说明)。这种错误一般是处理器电压调节模块(VRMH错或CPU出错或CPlUf CPl块接触不良,但也可能是 CPUS块出错,这时情况就比较复杂了,必须经过认真慎重的思考。因为CP版块在整个服务器中,占有举足轻重的地位,如果它出错服务器是会报致命错误的,并且在系统日志中会提示致命错误,但报CPU电压报错的情况也有5%左右。我们立刻把CP咽换在另一 CPU插槽中,开机后依然是刚才的那种故障。

11、所以在初步判断中,可以排除是CPLK块坏。这时取出CPU子细擦拭金手指,以及 CPU板块中与CPUe触的地方后,开机依然无显示。相对处理器坏的情况来说处理器电压模块(VRMH现故障的情况比较大。于是立即在另一台同型号服务器中取下一个处理器电压模块,安装在此服务器中。开机后,服务器依然没有任何显示,系统日志上依然提示 CPU电压为0伏的信息,系统指示灯三灯依然不停在闪烁。这时的情况就比较明显了。于是立即从另一台同类型服务器中取下一个CPU安装后,开机正常。实例二:有一台XXX型号服务器不显示,发现开机时系统日志没有任何信息,且系统指示灯不亮。初步判断是电源方面出现了错误。经过仔细检查,发现服务器

12、的电源是正常的,因此最大的可能就是服务器的电源管理板出现故障。更换电源管理板后,开机显示正常。但这时,新的问题来了:自检时,用 CTRL+M不能检测到硬盘。 硬盘在别的服务器上是正常的,因此立即清除此服务器的CMO图依然不正常。立刻上网找到此服务器的最新BIOS,升级BIOS后也不能解决问题。又检查硬盘笼子和服务器里的数据线及电源线后依然出错。这时,一般情况会怀疑是服务器的I/O板(输入输出板块)有问题。但就在这个时候,工程师发现在I/O板上有一个非XXX型号服务器标配的旧式网卡,立即去除此网卡后服务器就一切正常。硬件故障并不单单指硬件有问题,它也指硬件之间不兼容。因为服务器的正常运作需要各部

13、件之间的大力协调。建议大家在采购各元件时,都采用同一品牌原装的,并且要采用能发挥服务器性能的元件(上例中的旧式网卡即使正常也会严重影响服务器性能),这样才不会发生莫明其妙的故障。实例三:用户需要把他的XXX型号服务器升级到双网卡,我建议他购买原装网卡,但当他看到XXX型号服务器的网卡是采用的INTEL 82559芯片后,断然决定不使用原装网卡而采用另一品牌也采用INTEL 82559的网卡。过了几天,他打电话给我说,他的新网卡不能使用网络冗余及数据校验,并怀疑服务器有问题。工程师带了一个INTEL 82559网卡到用户那里,仔细检查了服务器的环境完全正常后,把INTEL 82559网卡安装到机

14、器上后一切正常。这个例子更加说明了,要发挥服务器的最大性能及功能,必须使用原品牌原装的配件。非原品牌非原装的配件,不能支持服务器的某些功能,严重的会影响到服务器的正常使用。要避免硬件故障发生频率,服务器管理人员必须注意服务器的使用环境完全正常。比较重要的服务器必须在恒温、恒湿的环境;电压也要符合,不仅要采用UPS还必须接地线, 必须是左零线、右火线,零地电压在13伏。在开、关服务器上必须符合正常的流程。工作人员必须严格执行操作流程。实例四:服务器故障现象:一台XXX型号服务器,近期频繁出现几次蓝屏幕死机故障。趁死机关闭的机会,将内存由原来的128M升级到512M (普通内存),并且在系统 CM

15、OS置中选才i装入(Load)最优参数设置,对内存每个单元进行检测。怪异服务器故障出现了,当我开机后,内存检测正常,但是屏幕提示须重新 SETU版指定的F2键后却死机。我装个内存条招谁惹谁了,怎么会死机?而且内存检测正常啊?服务器故障处理:服务器出了故障就要解决,哪怕是怪异服务器故障。按照缩小故障源的思路,换回原来 的内存条,逐步去掉各个部分(软驱、硬盘、光驱等),可是这个怪异服务器故障依然存在。分析可能与系统SETUS置有关,特别是关于对内存每个单元进行检测的设置。于是,拔出电池,对电池插脚短接放电,没有奏效。看来,这个怪异服务器故障还真是顽固。后来,找到主板清除CMO跳线设置,将插脚线由1

16、-2改到2-3 一会儿,然后恢复原位,开机正常(提 示:不要轻易拔出电 池,而是要找CMOSft跳线)。再次将内存升级,调整CMOS SETUP设置,特别注意到对内存的检测,设置为检测到每兆,至此系统完全恢复正常。服务器故障经验这个怪异服务器故障发生的根本原因是服务器的内存缺省设置为ECC带校验),由于使用普通不带校验的内存,而系统中设置每个单元都进行检测,所以导致了上面的故障。排除的方法是清除CMO设置,调整有关参数设置。另外CMOSSETU入最优参数设置通常有2种:一种是BIOS优化参数,这种参数稳定性最好;另一种是SETU犹化参数,优化整个系统,但是需要系统支持,其稳定性不能保证最好。所

17、以,当系统出现故障时,不妨先将稳定性最好的参数装入,解决问题后再行实例五:一台XXX型号服务器使用8708E的raid卡在读取某个文件或运行某个软件时经常出错,或者要经过很长时间才能成功,其间硬盘不断读盘并发出刺耳的杂音,这种现象意味着硬盘上载有数据的某些扇区已坏。一旦硬盘有比较刺耳的杂音可以尝试使用HD软件来测试硬盘时彳g有坏道,进入 ctrl+H配置界面进行查看,阵列是否降级六、服务器常见软故障解决思路与实例服务器软件故障是在服务器故障中占有比例最高的部份,约占70%牟决的过程必须更加深思熟虑。导致服务器出现软件故障的原因有很多,最常见的是服务器BIOS版本太低、服务器的管理软件或服务器的

18、驱动程序有BUG应用程序有冲突及人为造成的软件故障。下面分别举例说明各类软件故障的维修方法。实例一:有一台XXX型号服务器,配置为双 PIII500带521K高速缓存的CPU 512毗存。开机 后,系统日 志报电压调节模块异常 (VRM的错误,报错的信息是:“ Voltage Regulator Module (VRM) over/u nder-voltage 2.88V/0Vo从表面来看,极有可能是服务器的电压调节模块或其它硬件出现故障,极容易导致维护人员认为是硬件故障。维护人员立刻使用其它同类型服务器的硬件来测试,发现即使使用新的配件,此服务器依然报VRM错。就在一筹莫展的时候,维修工程师

19、带来了最新的 CPU管理板(CPUManagementControl )的固件(FIRMWARE,于是升级了 CPU 管理板块的FIRMWARE服务器恢复立即正常。FIRMWA时级方法是每个厂家的服务器都有专门的firmware升级方法和软件,以联想为例,一般需要使用PE或dos环境下使用专门的升级软件来使用,任何一款服务器的FIRMWARE及BIOS都会有不同的BUGS为BU施所难免,所以我们不能错误地认为服务器的BIOS程序就很完善,最新的不是一定是最好的最稳定的才是最好的,在升级之前应该小心谨慎,升级了错误的版本和使用错误的步骤会导致机器彻底的黑屏和瘫痪。目前流行的中高档服务器都拥有强大的管理程序,为客户提供了方便的管理途径;服务器也拥有各种操作系统下的驱动程序,方便了客户在各种操作系统中的使用。但是,世上任何一款程序都会有一些 BUG这些BU扇影响用户使用。但是服务器厂商总是会在第一时间内开发出新的程序,客户只需要及时更新这些程序就可以避免这类故障。当服务器的软件故障为此类时,表现的现象也不尽相同。一般来说,管理程序BUG导致系统速度变慢,CPU占用率变高,无法正常使用某些功能等;驱动程序的BU彼导致死机、与某些软件有冲突,磁盘工作不稳定等。查看管理程序是否出错的最好的办法就是在

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论