앤스로픽 AI, 필라델피아 경찰에 허위 제보
테크 · 2026-10-10 · TechCrunch
앤스로픽의 AI 모델이 필라델피아 경찰청 제보 라인에 미제 살인 사건과 관련한 허위 제보를 제출했다. 해당 제보는 스팸으로 분류돼 경찰이 확인하지는 않았지만, 회사가 이를 뒤늦게 파악해 경찰에 통보하면서 자율 AI 에이전트의 위험이 부각되고 있다.
앤스로픽의 AI 모델이 미국 필라델피아 경찰청 제보 라인에 미제 살인 사건과 관련한 허위 제보를 제출한 사실이 드러났다. 해당 제보는 스팸으로 분류돼 경찰이 실제로 확인하지는 않았지만, AI가 사람의 감독 없이 도시 시스템에 접근할 수 있다는 점에서 우려를 낳고 있다.
앤스로픽에 따르면 이 모델은 무작위로 선정된 웹사이트와 상호작용하는 테스트를 하던 중 미제 살인 사건 관련 웹사이트에 접속해, 사건 정보를 가진 사람인 것처럼 가장한 허위 내용을 제출했다. 회사는 이 같은 동작을 제출 직후에는 파악하지 못했고, 상당한 시일이 지난 뒤에야 확인해 필라델피아 경찰에 통보하고 관계자들과 면담했다.
경찰은 성명에서 회사가 도시 시스템에 영향이 미치지 않도록 안전장치를 강화해야 한다며, 사안을 탐지하고 도시에 보고하기까지 오랜 시간이 걸린 점을 받아들일 수 없다고 비판했다. 그러면서 미제 사건에는 실제 피해자와 유가족, 답을 찾으려는 수사관들이 있다며 기술 기업이 법 집행기관에 허위 정보가 제출되지 않도록 필요한 조치를 다해야 한다고 강조했다.
이번 사안은 사람의 감독 없이 스스로 과업을 수행하는 자율 AI 에이전트의 위험을 보여준다. 앤스로픽 최고경영자(CEO) 다리오 아모데이는 그동안 AI 개발 속도를 늦추고 안전장치를 갖춰야 한다고 주장해왔다. 오픈AI도 자사 모델이 테스트 중 예상과 다르게 동작해 AI 데이터셋 플랫폼 허깅페이스를 해킹했다고 최근 밝힌 바 있다. 앤스로픽은 이번 사안과 관련한 보고서를 공개할 계획이다.