Claude 서비스 1시간 장애로 로그인과 Claude Code 세션 중단

Hacker News11일 전조회 5

Anthropic의 Claude 서비스가 9월 29일 오류 급증으로 약 1시간 동안 정상 동작하지 못했다. 상태 페이지 기준으로 14:00 UTC에 시작된 오류는 14:59 UTC에 대부분 복구됐고, 15:30 UTC 시점에는 전 서비스가 정상 범위에 들어와 모니터링이 이어지고 있다.

영향 범위는 한 제품에 그치지 않았다. claude.ai 웹과 데스크톱·모바일 앱, Claude Console(platform.claude.com), Claude API(api.anthropic.com), Claude Code, Claude Cowork가 모두 장애 목록에 올랐다. 채팅과 API 호출뿐 아니라 로그인, 결제, 파일 업로드처럼 인증·계정 계층을 거치는 기능까지 함께 실패했다는 점이 눈에 띈다.

복구는 단계적으로 진행됐다. 14:21 UTC 첫 공지 이후 14:36 UTC에 1차 완화 조치가 적용되며 오류율이 크게 떨어졌고, 14:41 UTC에는 기존 대화가 대부분 다시 동작했다. 그러나 곧바로 두 번째 문제가 드러나 단일 로그인(SSO)과 Sign in with Apple을 포함한 로그인, 새 채팅 시작, 음성 대화, Claude Code·Cowork 세션 생성, 결제, 파일 업로드가 막혔다.

Anthropic은 이 구간에서 이미 로그인한 사용자에게 로그아웃하지 말 것을 권고했다. 세션이 끊기면 다시 들어오기 어려운 상황이었기 때문이다. 14:59 UTC에 대부분의 서비스가 복구됐고, 15:11 UTC 공지에서는 14:00~14:59 UTC 사이에 전송된 일부 메시지가 저장되지 않았을 수 있다는 점도 함께 안내됐다.

이번 장애는 상태 페이지를 통해 실시간으로 공지됐다. Atlassian Statuspage 기반으로 운영되며 30분 단위로 다음 업데이트를 예고하는 방식이었다. Claude Code와 Claude Cowork 같은 에이전트형 제품이 API·인증 인프라를 공유한다는 사실이 그대로 드러난 사례이기도 하다. 인증 계층 한 곳이 흔들리면 코딩 에이전트 세션까지 동시에 멈춘다.

실무에서는 API 호출 실패와 세션 단절을 함께 대비해야 한다는 점이 확인됐다. 오류가 나면 단순 재시도로 풀리는 경우도 있었지만, 로그인 자체가 막히면 재시도로 해결되지 않는다. 장시간 실행되는 에이전트 작업은 중간 상태를 자체 저장하고 실패 시 이어서 재개할 수 있게 설계하는 편이 안전하다. 메시지가 유실될 수 있는 시간 창이 생길 수 있다는 점을 감안하면, 중요한 출력은 클라이언트 쪽에도 남겨두는 편이 낫다.

장애의 근본 원인은 공지에 명시되지 않았다. 메시지 유실 가능성도 해당 시간대에 전송된 일부 메시지로 범위가 한정되며, 구체적으로 어떤 데이터가 영향을 받았는지는 밝혀지지 않았다. 상태 페이지는 15:30 UTC 기준 전 서비스 정상과 지속 모니터링만 알리고 있다.