2026-07-16
안녕하세요? 현재 AWS CloudFront 배포 오리진으로 VPC Origin을 사용하여 구성 하신 사이트가 정상적으로 로딩 되지 않는 현상이 발생하고 있습니다. AWS 헬스보드 참고: https://health.aws.amazon.com/health/status?path=open-issues 장애 복구를 위해서는 우선, 새 원본(오리진)을 생성한 뒤 동작 구성에서 새 원본에 연결되도록 임시로 구성을 변경하시는 방안이 있습니다. 새 원본을 생성하실 때는 원본 형식으로 vpc origin 이 아닌 ec2의 퍼블릭 엔드포인트 도메인이나 로드밸런서의 엔드포인트 도메인을 선택해서 생성해야 합니다. 이 때 보안그룹에서 CloudFront에서만 80/HTTP 접근이 가능하도록 규칙 구성이 되어 있는지 확인해야 합니다. 사이트를 임시로 복구하여 운영하시고, AWS 측에서 본 서비스가 정상화가 되면 다시 원래 오리진으로 동작 연결을 복구하여 주시기 바랍니다. 감사합니다. 조치 경과: 2026년 7월 16일 오후 4시 45분부터 약 3시간 30분 동안, CloudFront 기능 중 'VPC Origin'을 사용 중인 서비스에서 5xx 서버 에러가 발생한 장애입니다. 현재는 완전히 복구되었습니다. 🔍 무엇이 문제였나요? (용어 및 원인 풀이) VPC Origin이란? CloudFront(콘텐츠 전송 네트워크)가 외부 인터넷을 거치지 않고, 사용자 개인 사설망(VPC) 안에 있는 백엔드 서버(ALB, EC2 등)로 직접 연결되도록 돕는 기능입니다. 무슨 일이 일어났나? CloudFront와 VPC를 연결해 주는 AWS 내부 라우팅 시스템의 용량 한계(Capacity constraint)에 도달하면서 문제가 발생했습니다. 장애 결과: 용량이 가득 차자 네트워크 장비에 업데이트된 '길찾기 정보(Routing data)'가 제대로 전달되지 않았고, 이로 인해 CloudFront가 VPC 안의 서버로 가는 길을 잃어 5xx(서버 응답 오류) 에러를 내뱉게 되었습니다. 💡 참고: 일반 S3 버킷이나 외부 공개용(Public) IP/ALB를 Origin으로 사용하던 분들은 이번 장애의 영향을 전혀 받지 않았습니다. ⏱️ 시간대별 진행 경과 (한국 시간 기준) 장애 발생 16:45 (UTC+9) CloudFront에서 VPC Origin 연결을 사용하는 요청들에 5xx 에러가 급증하기 시작했습니다. AWS 조사 시작 17:44 (UTC+9) AWS 엔지니어들이 문제를 인지하고 조사를 시작했습니다. 영향 범위 특정 및 우회책 안내 18:21 (UTC+9) VPC Origin 사용자만 영향받는 것을 확인했습니다. 급한 사용자들을 위해 **"임시로 VPC Origin이 아닌 일반 Public Origin 방식으로 설정 변경"**할 것을 권장했습니다. 원인 파악 및 완화책 테스트 19:18 ~ 20:16 (UTC+9) VPC 라우팅 패킷 처리 시스템의 라우팅 테이블 용량 문제임을 알아내고 복구 패치(Mitigation strategy)를 테스트 및 적용하기 시작했습니다. 복구 완료 20:18 (UTC+9) 완화 조치가 적용되어 서비스가 완전히 정상화되었습니다. 최종 보고서 발행 21:21 (UTC+9) 근본 원인(내부 프라이빗 연결 관리 플릿의 용량 제한 및 라우팅 정보 로드 실패) 및 조치 내역을 정리하여 공식 종결 처리했습니다. 🛠️ 지금 해야 할 조치가 있나요? 장애 당시 임시 우회 설정을 하셨던 경우: 오류를 피하기 위해 CloudFront의 Origin 설정을 일반 퍼블릭 설정으로 바꿔두셨다면, 이제 안심하고 원래의 VPC Origin 설정으로 다시 복구(Revert)하셔도 됩니다. 별도 설정을 변경하지 않으셨던 경우: 이미 AWS 측에서 원인 해결 및 복구를 완료했으므로 추가로 진행하실 조치는 없습니다.