大規模ネットワークにおける障害可視化のためのアーキテクチャについて
- NTTComm
- 今回は物理によっているけど物理構成と論理構成について NTTComm では変えているよ
- SSoT について config ではなく、show int を元にしているのはなぜか
- config も取得しているよ
- serial とか取得しているのでそれを流用していている
- 取得間隔は 1 日 1 回
- 台数が多すぎるのでここらへんが限界かも
- 夜間帯を狙って取得している
- TextFSM ってめんどくさくない?みんなで OSS とかにすると良いかもしれない
- トポロジの自動配置について
- 機器種別によって縛りをつけて制御している
- インフラエンジニアが可視化すると地獄にならない?組織どうなっている?
- しんどい
- ベンダさんにも手伝ってもらったりとか
- この可視化については 2 〜 3 年やっている
- 機器のバージョンアップで変わっちゃうとかそこらへんについて
- しんどい
- Output 系について(うちだと EMS みたいなやつ)の自動化はどうしている?
- Down している区間を共有したりとかしている
- メール送信自動化とか
- どういう社内情勢で進めたのか
- 障害報告早くしないといけないよねって話がベース
- 経営層もエンジニアも課題感が合った
- 自動処理を別途進めていて内製でやっていくという流れがもともとあった