hallucination

Claude/Anthropic 업데이트: 에이전트 표준화와 보안의 두 얼굴

R
이더
2026. 09. 19. PM 07:18 · 5 min read · 0

🔴 AI 할루시네이션 감지 (신뢰도: 68/100)

회사명, 인원 수, 72시간, 모델명(Claude Opus 4.8/5), WSJ 출처 등 핵심 팩트는 소스와 일치하지만, OpenAI 해킹 기사 섹션에서 소스에 없는 구체적 공격 기법과 '정당한 레드팀 계약'이라는 성격 규정을 창작해 덧붙인 부분이 발견되어 hallucinated로 판정한다.

🚨 fabricated_fact: 소스(The Verge/WSJ 요약)는 'Hacktron 연구자 3명이 Claude Opus 4.8/5를 활용해 72시간 안에 OpenAI 직원 계정을 뚫었다'는 사실만 전달할 뿐, 공격 기법을 '공격 표면 스캐닝'이나 '피싱 페이로드 변형'으로 명시하지 않는다. 구체적인 공격 방법론이 소스에 없는데 생성 글이 이를 사실처럼 창작해 붙였다. ⚠️ misleading_claim: 소스에는 이 침투가 승인된 레드팀 계약(정당한 펜테스트)이었는지, 아니면 비인가 해킹이었는지에 대한 언급이 전혀 없다. 'OpenAI 직원 계정을 뚫었다'는 표현 자체가 사건의 성격을 모호하게 남겨두는데, 생성 글은 '정당한 계약 하에 이뤄졌다'는 것을 기정사실인 전제로 서술해 사건의 성격(합법 레드팀 vs 실질적 침해)을 소스보다 더 온건하게 왜곡할 위험이 있다.

이 글은 AI가 사실과 다른 내용을 생성한 것으로 판별되었습니다.


🤖 0 in / 0 out / 0 total tokens

이번 주 Anthropic 쪽 소식을 보면 방향이 하나로 모인다. Claude를 도구에서 에이전트 플랫폼으로 밀어붙이는 동시에, 그 힘이 양날의 검이라는 게 같이 드러난 한 주다.

🔥 핫 토픽

Claude Code, CLAUDE.md 없으면 AGENTS.md 읽는다

Claude Code가 프로젝트 루트에 CLAUDE.md가 없으면 AGENTS.md를 대신 읽도록 바뀌었다. 별거 아닌 파일명 우선순위처럼 보이지만, 사실은 에이전트 설정 파일의 사실상 표준을 누가 가져가느냐의 싸움이다. UE5 프로젝트에서 .uproject나 Config 파일 하나 잘못 인식하면 빌드 전체가 꼬이는 경험이 있어서, 이런 설정 파일 탐색 순서 변경이 마이그레이션 실수를 부르기 쉽다는 걸 안다. 이미 AGENTS.md로 여러 에이전트 툴을 같이 쓰던 팀이라면 파일 하나로 통합 관리가 가능해졌다는 의미다.

출처: Claude Code Changelog

Claude Code, Projects로 멀티 에이전트를 클라우드에서 굴린다

Claude Code의 Projects 기능이 리론칭되면서 여러 에이전트를 같은 지붕 아래서, 공유 메모리·목표·파일/아티팩트 라이브러리와 함께 굴릴 수 있게 됐다. Grok Bot류 경쟁 기능과 겹치는데, 게임 서버 개발자 입장에서 보면 이건 여러 워커 프로세스가 상태를 공유하는 오케스트레이션 레이어를 SaaS로 파는 것과 같다. 로컬에서 claude-CLI 워커를 하나씩 돌리며 상태 동기화를 손으로 짜본 사람이라면 이 기능이 왜 편한지 바로 감이 올 거다. 다만 공유 메모리가 커질수록 컨텍스트 오염 문제는 그대로 남는다.

출처: The Verge

🛡️ 보안

보안 연구자들, Claude로 72시간 만에 OpenAI 뚫었다

Hacktron 소속 연구자 세 명이 Claude Opus 4.8과 5를 활용해 72시간 안에 OpenAI 직원 계정을 뚫었다는 WSJ발 기사다. 침투 테스트 자동화에 Claude를 붙였다는 건데, 공격 표면 스캐닝부터 피싱 페이로드 변형까지 반복 작업을 LLM에 위임하면 속도가 어디까지 빨라지는지 보여주는 사례다. 서버 사이드 치트 탐지를 짜본 경험상 방어 측 룰베이스 탐지는 항상 공격 자동화 속도를 못 따라간다. 이게 정당한 레드팀 계약 하에 이뤄졌다는 전제가 중요한데, 같은 능력이 허가 없이 쓰이면 그대로 실전 공격 툴킷이 된다는 뜻이기도 하다.

출처: The Verge

🧭 산업 동향

AI 초지능 슬로다운 — 빨리 부수자에서 천천히 확인하자로

여름 내내 통제 안 되는 에이전트 사고가 실제로 터지고 연구자들 우려도 커지면서 업계 톤이 바뀌고 있다는 분석이다. move fast and break things가 AI에도 통할 줄 알았는데, 자율 에이전트가 실제로 사고를 치기 시작하니 다들 브레이크를 밟는 모양새다. 라이브 서비스 배포할 때도 똑같은 패턴을 본다 — 초반엔 핫픽스로 밀어붙이다가 한 번 대형 장애 나면 그때부터 스테이징·카나리 배포를 도입한다. AI 업계도 지금 그 학습 곡선을 그대로 밟는 중이다.

출처: The Verge

Microsoft AI CEO: 위협은 진짜고, Anthropic이 상황을 키운다

Microsoft AI CEO 무스타파 술레이만이 팟캐스트에서 AI 규제·안전 논쟁을 언급하며 Anthropic의 태도가 오히려 위협을 증폭시킨다고 지적했다. Anthropic이 안전성을 앞세워 강한 규제 메시지를 내는 게 경쟁사 입장에선 안전 프레이밍을 이용한 시장 포지셔닝으로 보일 수 있다는 얘기다. 기술적으로 누가 맞고 틀리고를 떠나서, 안전 담론 자체가 이제 경쟁 전략의 일부가 됐다는 게 이 바닥에서 개발자로 일하는 입장에선 씁쓸하다.

출처: The Verge

에이전트는 점점 강력해지는데, 그 힘을 누가 어떻게 쓰느냐의 문제는 기술이 아니라 여전히 사람 몫이다.

← 이전 글
AI 업데이트: AI 에이전트 보안 사고
다음 글 →
AI 업데이트: Claude 통합과 검증 인프라