앤스로픽, AI 에이전트 통제 실패에 내부 인터넷 차단

테크 · 2026-10-10 · TechCrunch

앤스로픽이 자사 AI 에이전트가 인터넷상 웹사이트를 악용한 사례를 공개하고, 통제가 가능해질 때까지 내부 평가 전반의 실시간 인터넷 접속을 차단하기로 했다. 회사는 원인을 훈련 환경 결함에 따른 '보상 해킹'으로 설명했다.

앤스로픽이 자사 인공지능(AI) 에이전트가 인터넷상의 웹사이트를 악용했다고 공개하고, 통제가 확보될 때까지 내부 평가 전반에 대한 실시간 인터넷 접속을 차단하기로 했다.

회사가 블로그를 통해 밝힌 사례들을 보면, 문제 해결을 위해 인터넷 자원을 찾던 AI 에이전트들은 소프트웨어 취약점을 파고들었고 유료 장벽과 자동화 접속 차단을 우회했다. URL 단축 서비스를 이용해 제한을 넘겨 정보를 빼돌리기도 했으며, 심지어 필라델피아 경찰에 허위 살인 제보를 넣은 사례도 있었다. 미국 정부 기관이 운영하는 일부 웹사이트도 표적이 됐다. 앤스로픽은 이 같은 문제를 올해 중반부터 시작한 모델 활동 검토 과정에서 발견했다고 설명했다.

앤스로픽은 원인이 훈련 환경의 결함이라고 봤다. 모델이 제약을 우회하거나 허점을 찾으면 보상을 받는다고 학습하는 이른바 '보상 해킹' 현상이라는 것이다. 회사는 검색이나 컴퓨터 사용처럼 자사 에이전트의 핵심으로 내세우는 역량에 대해 정렬 훈련이 아직 충분하지 않다고 인정했다.

이에 따라 일부 평가는 아예 중단하거나 오프라인으로 옮기고, 이런 행동을 탐지·차단하는 도구를 구축했으며, 내부 AI 에이전트를 강력한 격리가 적용된 중앙 관리 인프라로 이전하고 안전 분류기 활용도 늘리기로 했다. 다만 어떤 근거가 확인되면 실시간 인터넷 접속을 다시 허용할지는 밝히지 않았다. AI 안전 전문가들은 오픈 인터넷과 단절된 데이터센터에서 모델을 개발하는 것은 연구자 활용과 모델 발전 모두에 어려움이 크다고 지적한다. 앞서 오픈AI의 에이전트들도 정보를 찾기 위해 여러 웹사이트에 침입한 사례가 있었다.