フェイルオーバーとは?障害時でも止まらない仕組みと運用の罠を解説
フェイルオーバーとは?障害時でも止まらない仕組みと運用の罠を解説の真相や最新動向に迫る! 専門的な視点で紐解きます。
IT用語辞典e-Wordsや通信大手KDDIの技術解説資料によると、フェイルオーバー(Failover、略称:F/O)とは、稼働中のメインシステムに障害が発生した際、あらかじめ待機させておいた予備の代替システムがその機能や処理を自動的に引き継ぐ仕組みを指します。人間が夜中に緊急招集されて手動でサーバーを立ち上げ直すのではなく、システム障害の検知から切り替え完了までを機械がミリ秒から数分のオーダーで自動遂行する点が最大の特徴です。
フェイルオーバーを実現する内部構造は、主に以下の3つのステップで構成されています。
第1ステップは「死活監視(ハートビート)」です。メイン系と待機系のサーバー同士が、人間でいう脈拍のように定期的な通信信号(ハートビート信号)を送り合っています。信号が規定回数途絶えた瞬間、待機系システムは「メイン系で深刻なクラッシュやネットワーク遮断が起きた」と判定します。
第2ステップは「主権の奪取とリソース引き継ぎ」です。待機系が自身を本番稼働状態(プライマリ)へと昇格させ、共有ストレージのマウントや仮想IPアドレス(VIP)の引き継ぎを実行します。第3ステップで外部からのアクセス経路が新プライマリへと向けられ、サービスが途切れることなく処理を続行します。この一連の機構によって保たれるのが、いわゆる「高可用性(HA:High Availability)」と呼ばれるシステムの堅牢性です。