备份和恢复有点像滑雪。 当需要加速下山或在发生灾难时保持业务正常运转时,稍作准备将决定是顺利着陆还是直接坠入雪堆。 这里有四种方法可以避免史诗般的失败。
史诗般的失败#1:齿轮故障
您如何在斜坡上发现新手? 拥有昂贵、时尚的滑雪夹克但手套很薄且油漆不防水的滑雪者怎么样? 还是那个忘记确保他的固定器处于良好工作状态并且在半山腰丢失了他的滑板的人? 毕竟,除非您的装备正常工作,否则您无法粉碎山丘。
同样,如果在数据丢失发生之前您的备份没有到位,您将无法从灾难中恢复。 在灾难发生之前,确保您的技术正常工作并拥有足够强大的功能集对您的业务至关重要,这一点至关重要。 您需要一个自动且可靠的实施,通过在线和离线验证维护数据的完整性,通过恢复保证软件自动进行恢复测试,并将备份成功复制到辅助位置或云。 简而言之,确保您的数据确实在异地备份和复制。 听起来很简单,但重要的是要确认即使您的本地服务器出现故障,您的业务也能继续运行。
史诗般的失败 #2:忽略路线图
如果不检查它是去绿色斜坡还是黑色钻石,你就不会登上滑雪缆车。 你也不会在没有计划的情况下转出小径并在树林中滑雪,因为你很可能会发现自己撞到泥土或更糟糕的东西,比如掉进裂缝或峡谷。 在你上山之前,你需要计划你的下降。 您还需要检查沿途的标志以确保您仍在路线上。
正如您需要一张滑雪板探险路线图一样,您还需要一份成功灾难恢复的书面计划。 这意味着您需要创建一个范围广泛且包含分步指南的文档。 这应该考虑到三个独特的领域:
- 人员:确定关键运营人员,并为他们制定在灾难发生时远程或在次要地点工作的方式。 这意味着无论他们位于何处,都可以让他们直接访问维持业务运营所需的恢复系统、数据和其他资源。 在您组织的主要通信基础设施(例如,公司电子邮件或电话系统)出现故障的情况下,设置备用通信方式(例如,员工的手机)也很重要。
- 基础设施:确定关键的运营基础设施——您的业务离不开的那些基础设施部分——并确保它们受到保护。 请记住,您希望您的 IT 基础架构成功度过灾难的原因是您最重要的资产,您的员工,拥有他们需要的工具来继续推动业务收入和盈利能力。
- 流程:确定关键的运营流程——概述在发生中断时谁做什么的分步指南——并确保团队成员了解并实践他们的角色。 考虑对企业日常运营至关重要的每个流程,不要只关注 IT 流程。
您的 DR 计划以及您的数据保护解决方案还应该满足您公司的恢复点目标 (RPO),或者您可以承受丢失的最大数据量(以时间表示),以及您的恢复时间目标(RTO),这是您可以承受的没有数据和系统的最长时间。 最好的 DR 计划基于正在恢复的数据量以及这些信息需要以多快的速度上线。
史诗般的失败#3:忽视练习
如果您第一次下山是在双黑钻步道上,您肯定会摔倒在地。 您不能仅仅购买装备并研究路线图,然后神奇地知道如何在没有踏上雪地的情况下滑雪。 练习技巧、锻炼身体素质和磨练直觉是成功下山的关键。
在灾难期间继续您的业务并恢复丢失的数据是黑钻级别的事件。 如果您从未测试过您的 DR 策略,您很可能会一败涂地。 IT 管理员安装备份解决方案并且很少(或从不)抽空测试实际恢复的情况并不少见。 此外,在测试方面,一两个是不够的。 当今数字化转型和 IT 发展的快速步伐意味着您的基础设施也在快速变化。 最好的 DR 测试是迭代的,并且按照一致的计划进行,因此您可以确保您的备份能够保护公司基础架构的当前状态。 数据的更改率是确定测试灾难恢复计划的频率的良好基准。 一些备份供应商提供自动 DR 测试,这可以为您节省大量时间和麻烦。
您还需要考虑各种灾难场景并评估 DR 流程可能会因此发生怎样的变化。 例如,您的策略是否需要团队成员开车到次要位置轮换媒体? 如果洪水或暴风雪等大规模自然灾害阻碍了旅行怎么办? 在云中备份是克服物理和基于站点限制的一个很好的解决方案,但您还需要计划从云中恢复数据的速度。 超大规模云可以提供廉价的存储,但可能需要数天才能通过 WAN 恢复数据。 如果您没有在地理上与主站点分开的辅助站点(对许多企业来说这是一个昂贵的提议),DR 即服务可以在云中提供负担得起的启动和业务连续性。 无论您选择什么,都要了解供应商的 SLA,了解您的 RPO 和 RTO,当然还有测试。
史诗般的失败#4:假设所有的雪都是一样的
如果粉末总是新鲜的并且小径从不拥挤,那就太好了,但让我们面对现实吧,有时您会在泥泞中挣扎或在春假期间避开游客。 经验丰富的寄宿生也知道,如果你培养了应对不同地形和不同雪地公园的技能,你往往会玩到最有趣的单板滑雪。 即使您将大部分时间花在自己喜欢的斜坡上,步道也会每天和每个季节发生变化。 如果您假设所有的雪都是一样的,那么您会发现自己在下山的路上遇到了麻烦。
对于您的 IT 基础架构,您不能假定同质性。 也许您更喜欢尽可能多的虚拟化,但您的组织需要一些物理服务器。 保持灵活性非常重要,这样您的 IT 团队才能对用户不断变化的需求和不断发展的技术环境保持响应和敏捷。
举一个最常见的例子,避免单一供应商锁定对于现代 IT 的技术和财务成功都至关重要。 DR 故障经常发生是因为管理员在他们的 DR 规划中只支持单一的技术。 例如,它们将支持 SAN 或 NAS 等存储技术,但忽略直接附加存储; 拥抱虚拟化,忽视物理服务器; 或支持物理设备,但未考虑不同型号和不同代服务器之间的恢复需求。 创建并测试包含您的业务保持运行所需的技术范围的备份和灾难恢复计划。
如果您是单板滑雪新手,首先要知道的事情之一就是您会摔倒。 IT 基础设施也是如此——无论是用户的轻微删除、破坏性的恶意软件入侵,还是导致整个站点瘫痪的全面自然灾害,都会发生数据丢失。 无论大小如何,您都可以做好准备。 通过确保您的设备正常运行、完成您的计划、测试您的 DR 并保持策略的灵活性来避免史诗般的失败。 这样做,您很快就会把那些斜坡切碎。
关于作者
Brooke Bullman是Unitrends的产品营销经理,Unitrends是企业级云端业务连续性解决方案的领先供应商。欲了解更多信息,请通过info@unitrends.com联系作者,或访问www.unitrends.com。




Amazon