小小的网络故障,带来深深的思考,运维的成败果然在于细节

早晨8点多,收到Zabbix的邮件告警,显示客户的戴尔服务器和爱快路由器掉线了,由于该客户的机房之前有过多次停电,症状当然也是如此这般,加上客户没有电话或者微信报修,就先入为主地判定为机房又停电了,因此未采取任何措施。

小小的网络故障,带来深深的思考,运维的成败果然在于细节

直到过了下班时间,客户才反馈:外网无法使用向日葵远程控制服务器。因为不止一次,也就直说了,是不是机房又没电。

客户反馈有电,照片显示服务器处于开机状态,爱快路由器也是一样。

嗯?这怎么可能,难道短暂停电后就恢复了,恢复的时候,Zabbix没有自动发邮件提醒我?

远程登录爱快,失败;登录爱快云后台查看,显示该路由器为离线状态;登录部署在云服务器里面的Zabbix,发现客户的戴尔服务器和爱快还是离线状态,并没恢复。

小小的网络故障,带来深深的思考,运维的成败果然在于细节

指导客户重启爱快,无效;难道是停电后掉配置了?客户都已经下班了,也就没有其他远程手段了,为了不影响客户第二天上班使用,于是驱车前往。

到了机房,首先把显示器接到爱快上,果然有宽带没连接上?Lan口也是已断开状态?

小小的网络故障,带来深深的思考,运维的成败果然在于细节

把键盘接上,顺手按了几下回车键,所有网卡显示为已连接,貌似没问题啊,奇怪。

既然如此,打开笔记本电脑,登录爱快路由器,准备检查问题所在;

小小的网络故障,带来深深的思考,运维的成败果然在于细节

原来是固定IP的城域网掉线了,这是爱快的默认链路,专供服务器和监控使用的,所以白天办公的时候,用户是感觉不到的,直到要远程操作服务器的时候,才发现网络有问题。路由器端口好好的,网卡的“眼睛”唰唰地眨着,于是转到机柜后面,一眼就看到某个光猫闪着红灯,好吧,电信光纤断了;

小小的网络故障,带来深深的思考,运维的成败果然在于细节

可是爱快云显示路由器处于掉线状态也太不应该了,其他几条拨号宽带不都是好好的在线么?

也许是配置不仔细吧,没有配置自动切换线路,另外几条拨号的宽带倒是都配置了,只是固定IP的城域网没配置,主要是太相信电信了,嘿嘿,现在赶紧补上吧,来都来了,是吧。

小小的网络故障,带来深深的思考,运维的成败果然在于细节

勾上“掉线自动切换”后,爱快云立刻显示路由器在线了,哪怕没有固定IP,在外网也能通过爱快云远程登录这台路由器了;

服务器上的向日葵,本以为会自动上线,结果重试了几次都无法上线,只能手动退出软件,重新开启后,才恢复连接;

先让客户这么用吧,暂时没什么大影响,只能明天早上再向电信报修线路故障了。

准备收拾东西走人,先备份一下爱快的配置吧,下次有问题的时候,能快速恢复;

小小的网络故障,带来深深的思考,运维的成败果然在于细节

反思:

1、由此看来,先入为主和经验主义的确是害了自己,接到客户报修就先把自己掘进坑里了,没有冷静、认真地分析,虽然也快速解决了问题,没影响客户使用,但是这一趟其实可以不用跑,单程40分钟,毕竟说远不远,说近也不近;

2、云端的Zabbix,配置为smnp轮询客户的设备,一旦固定IP的链路掉线,所有的监测肯定是全部失效了,如果是在服务器上安装了Zabbix agent,并且配置为主动模式,就能主动向Zabbix Server上报信息,配合爱快的“掉线自动切换”,云端的Zabbix就不会与被监测的服务器失联了,这样就很容易地判断出是固定IP的城域网掉线了。

3、不能太相信运营商,该做的配置,还得做细致做完整,免得有问题的时候,再费时费力地排查。

——笔者为网络工程师,擅长计算机网络领域,创业多年,希望把自己的经验分享给大家,觉得有用的,如有相同或者不同观点,欢迎评论。

文章来源:https://www.cnaaa.net,转载请注明出处:https://www.cnaaa.net/archives/11799

(0)
凯影的头像凯影
上一篇 2024年5月21日 下午3:33
下一篇 2024年5月22日 下午2:45

相关推荐

  • 网管最后的倔强——你要上网可以,但是走哪条链路由我说了算

    作为一名合格的网管,除了修得了电脑,还要换得了灯泡;除了能折腾服务器,还得做好物业服务,要么擅长通下水道,要么会修中央空调。 但是,千万别说网管没脾气,他们也有倔强的时候,比如说,你想要上网,那没问题,但是走哪条链路(上高速还是走国道),那就是网管说了算。 如上图所示,公司有两条外部网络链,其中,左边一条是高速链路,网关为10.1.10.1/24;右边一条是…

    2024年5月22日
    1.2K00
  • 小型企业网络组网与配置仿真实验

     实验要求如下: 我这里以学号46为例 一、IP 地址规划表 (一)主类网络 (二)子网划分需要自己计算有效ip范围 在C类主网络192.168.46.0/24中,我们需要先了解这个网络的子网掩码为255.255.255.0,其二进制表示为11111111.11111111.11111111.00000000。这个网络包含了从192.168.46.1到192…

    2024年7月3日
    2.7K00
  • 端口隔离和VLAN的区别

    对于大型网络,我们常常对于ip的规划比较烦恼,也有很多朋友问到,对于1000个以上的终端设备如何去设置它的ip地址呢? 对于大型网络,它的ip规划我们常常的做法是划分vlan,因为划分vlan有诸多好处,方便管理以及提升了整个网络的安全性。当然除了划分vlan有其它的方法吗?答案是肯定,那就是端口隔离。这两种方法在ip规划中使用的最多,我们本期来详细了解vl…

    2023年12月14日
    1.4K00
  • ELK日志系统之使用Rsyslog快速方便的收集Nginx日志

    Rsyslog Rsyslog是高速的日志收集处理服务,它具有高性能、安全可靠和模块化设计的特点,能够接收来自各种来源的日志输入(例如:file,tcp,udp,uxsock等),并通过处理后将结果输出的不同的目的地(例如:mysql,mongodb,elasticsearch,kafka等),每秒处理日志量能够超过百万条。 Rsyslog作为syslog的…

    2023年5月24日
    1.6K00
  • 如何自动备份交换机和路由器的配置文件到服务器

    在多年的IT外包服务生涯中,见过很多网络设备意外丢失配置文件的状况,甚至亲身经历过某个客户的H3C防火墙,不但丢失配置文件,就连系统文件都直接消失了,哪怕上传系统文件,重新配置,只要一重启,所有的都会消失,后来,我们维修了主板,才解决了问题。 所以,在日常的网络管理中,自动备份关键配置文件至服务器,不仅能够提高恢复效率,还可以防止因意外丢失而导致的重大损失。…

    2024年5月16日
    1.2K00

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

在线咨询: QQ交谈

邮件:712342017@qq.com

工作时间:周一至周五,8:30-17:30,节假日休息

关注微信