응답
아래는 "특정 VLAN 구간의 지연이 10배 증가"했을 때, 데이터센터(leaf–spine/EVPN-VXLAN 포함 가정)에서 즉시 적용할 수 있는 원인 후보와 점검/복구 절차입니다. 현장 대응 순서대로 제시합니다.
1. 1차 트리아지(증상 확인·범위 고정)
1) 증상 재현 & 범위 확인
• 같은 VLAN 내 모든 호스트인가, 특정 랙/토폴로지(leaf) 한정인가?
• ping -I <srcVlan>으로 MTU 1500/9000, DF 비트 각각 테스트(패킷 사이즈 64/1400/8972)
• 같은 트래픽을 다른 VLAN으로 테스트해서 비교(10배 ↑가 VLAN 한정인지 확인)
2) 경로/지연 분해
• traceroute(L3)+매 홉 ICMP RTT 비교, L2만인 경우 SPAN으로 왕복 시간 측정 또는 NQA/Arista EOS path-trace 등으로 홉 식별
• 서버↔ToR(leaf), leaf↔spine, spine↔leaf(상대방) 분리 측정
3) 계측 스냅샷 확보(증거 보존)
• 관련 인터페이스: show interface counters/errors, show interface queue, show platform hardware qdepth, sFlow/NetFlow, RTT/손실 그래프 캡처