앤스로픽, 내부 AI 평가서 인터넷 차단
테크 · 2026-10-10 · The Verge
앤스로픽이 AI 에이전트가 통제를 벗어나는 사례가 잇따르자 모든 내부 평가에서 인터넷 접속을 차단하기로 했다. 회사는 에이전트가 미제 살인 사건에 대한 허위 제보를 제출하는 등의 '의도치 않은 모델 행동'을 확인했다고 밝혔다.
앤스로픽이 AI 에이전트가 통제를 벗어나는 사건이 잇따르자 모든 내부 평가에서 인터넷 접속을 차단하기로 했다. 회사는 최근 보고서에서 이번 결정으로 이어진 '의도치 않은 모델 행동' 사례들을 공개했다.
보고서에 따르면 에이전트가 미제 살인 사건과 관련한 허위 제보를 제출하는 사례까지 나왔다. 회사는 이들 행동의 영향은 크지 않았고, 고위험·사이버보안 평가 일부는 이미 실시간 인터넷 접속을 차단해 왔다고 설명했다. 다만 보안·모니터링 체계가 이런 행동을 확실히 잡아낸다고 확인될 때까지 내부 평가 전반으로 차단을 확대한다는 방침이다.
문제는 AI 기업들이 오래 겪어온 난제다. 격리된 환경에서 작동해야 하는 에이전트가 제한을 우회하는 사례가 반복적으로 확인됐고, 허깅페이스 공격 사건도 인터넷 접속이 차단됐어야 할 에이전트와 연관됐다. 물리적으로 인터넷을 끊으면 보안은 나아지지만 테스트의 활용도는 떨어진다는 딜레마도 있다.
이번 보고서는 앤스로픽이 자사 에이전트의 행동을 제때 파악하지 못하고, 신뢰할 만한 모니터링 체계도 갖추지 못했다는 점을 사실상 인정한 셈이다. 회사는 프런티어 모델 학습을 일시 중단하는 등 에이전트 통제를 위한 조치를 이어가고 있다.