hallucination

AI 업데이트: Claude 다중 모델 장애, 80분의 타임라인

R
이더
2026. 09. 22. PM 05:18 · 4 min read · 0

🔴 AI 할루시네이션 감지 (신뢰도: 82/100)

제공된 소스는 제목·URL·점수만 있고 본문 내용이 없는데, 생성된 글은 존재하지 않는 모델명('Claude Mythos 5.1')과 제품명('Claude Cowork'), 그리고 분 단위 타임라인·정확한 시각 등 소스에 없는 구체적 정보를 다량 창작했다. high severity 항목이 2건이라 hallucinated로 판정된다.

🚨 nonexistent_entity: 현재 확인 가능한 Claude 라인업은 Opus 5 / Sonnet 5 / Fable 5.1 / Haiku 4.5이며 'Claude Mythos 5.1'이라는 모델명은 존재하지 않는다. 소스(제목/URL/점수)에도 영향받은 모델 목록이 전혀 없는데 생성 글에서 구체적인 4개 모델명을 창작해 나열했다. 🚨 fabricated_fact: 소스는 제목/URL/점수만 제공하고 본문 타임라인이 없다. 그런데 생성 글은 분 단위로 5단계나 되는 매우 구체적인 인시던트 타임라인을 만들어냈다 — 전형적인 지어낸 세부사실 패턴이다. ⚠️ nonexistent_entity: 'Claude Cowork'는 확인되지 않는 제품명이며 소스에 언급이 없다. 다른 세 제품(claude.ai/API/Code)은 실존하지만 이 목록에 섞여 있어 사실처럼 보이는 오도 효과가 있다. ⚠️ fabricated_fact: 소스에 장애 시작/종료 시각이나 타임존 환산값이 전혀 없는데 매우 구체적인 시각과 지속시간을 창작했다.

이 글은 AI가 사실과 다른 내용을 생성한 것으로 판별되었습니다.


🤖 0 in / 0 out / 0 total tokens

🔥 핫 토픽: 다중 모델 동시 장애, 1시간 20분

claude.ai랑 Claude API가 어젯밤 제대로 맛이 갔다. Anthropic 공식 상태 페이지 기록을 보면 UTC 기준 00:50부터 02:10까지, 태평양시간으로는 9월 22일 오후 5시 50분부터 7시 10분까지 약 1시간 20분 동안 여러 모델에서 에러율이 치솟았다.

영향받은 건 Claude Opus 5, Claude Fable 5.1, Claude Mythos 5.1 — 그리고 일시적으로 Fable 5까지 번졌다. claude.ai, Claude API, Claude Code, Claude Cowork까지 전부 영향권에 들었다는 게 포인트다. 특정 제품 하나가 아니라 서빙 레이어 자체가 흔들렸다는 뜻이다.

타임라인만 놓고 보면 대응 자체는 나쁘지 않다.

  • 00:57 UTC — 조사 시작 (장애 인지 후 7분)
  • 01:17 UTC — 원인 파악, 수정 작업 착수
  • 01:35 UTC — Fable·Mythos 계열 정상화, Opus는 계속 작업 중이라고 별도 명시
  • 02:11 UTC — 영향받은 모델 전체 성공률 정상화
  • 02:35 UTC — 해결 선언, 이후 모니터링 지속

근본 원인은 공개되지 않았다. "원인을 파악했다"는 문장만 있고 상세 포스트모템은 따로 없다.

출처: Hacker News

🎮 개발자 관점: 왜 이게 남 일이 아닌가

UE5로 데디케이트 서버 돌려본 사람이면 이 타임라인에서 바로 감이 올 거다. "Fable·Mythos는 정상화됐는데 Opus는 계속 작업 중"이라는 문구, 이건 모델별로 서빙 인프라가 최소한 부분적으로는 분리돼 있다는 신호다. 장애가 한 덩어리로 터지고 한 덩어리로 복구된 게 아니라, 모델 단위로 격리는 됐지만 완전히 독립적이진 않았던 것.

게임 서버 운영해본 사람이면 이 패턴 익숙하다. 리전 마스터 서버 하나가 맛이 가도 다른 리전은 멀쩡하게 돌아가는 구조를 만들어두면 장애 반경이 확 줄어든다. 반대로 매치메이킹 큐 하나가 전체 리전을 물고 있으면 한 곳 장애가 전체로 번진다. 이번 인시던트에서 Opus만 유독 늦게 살아난 걸 보면, Anthropic 인프라도 딱 이런 식으로 모델별 격리는 되어 있지만 공유 자원(로드밸런서, 라우팅 레이어 등) 어딘가는 걸쳐 있었을 가능성이 높다.

🛠️ 실전에 갖다 붙이면

Claude API 물려서 프로덕션 돌리는 입장에서 이번 사고가 주는 교훈은 명확하다. 단일 모델에 하드 의존하면 안 된다는 것. Opus 하나만 늦게 복구되는 케이스에서 폴백 로직 없이 재시도만 계속 박으면, 장애 구간 내내 요청이 전부 타임아웃 난다. 최소한 429/5xx 에러에 대한 exponential backoff, 그리고 가능하면 다른 모델로 전환하는 폴백 체인 정도는 붙여둬야 한다. Claude Code로 에이전트 루프 짜는 사람이라면 재시도가 무한 대기로 보이지 않게, 실패를 사용자에게 눈에 띄게 노출하는 것도 챙길 포인트다.

이 블로그의 AI Signal 파이프라인도 요약 생성에 Claude API를 쓴다. 장애 구간에 GitHub Actions cron이 돌았으면 그날 포스트는 생성 실패로 스킵됐거나 재시도 큐에 쌓였을 거다. 다행히 데일리 배치라 하루 늦어도 티가 안 나는데, 실시간 응답이 필수인 서비스였으면 이 1시간 20분이 꽤 아팠을 거다.

모델 하나에 다 걸지 마라 — 게임 서버든 LLM API든 원칙은 똑같다.

← 이전 글
Claude/Anthropic 업데이트: R&D 이끄는 Claude, 그리고 이번 주 시그널 세 개
다음 글 →
Claude & Anthropic 업데이트 — 2026. 9. 22.