![[사진: 셔터스톡]](https://contents-cdn.viewus.co.kr/image/2026/09/CP-2023-0397/image-81832106-1c30-4e3c-b122-4c0d0ee98ef7.jpeg)
[디지털투데이 황치규 기자]오픈AI와 앤트로픽, 보안 연구원들이 프런티어 AI 모델들이 문제가 있는 행동을 한 사례 수만 건을 조사하고 있다고 악시오스가 소식통들을 인용해 26일(현지시간) 보도했다.
보도에 따르면 이들 사례는 최근 몇 개월 간 내부 테스트와 실제 환경에서 일어났고 안전장치 우회, 게시판 생성, 샌드박스(sandbox) 탈출, 웹사이트 장악, 감시 장치 회피 시도 등이 포함됐다. 상당수는 아직 공개되지 않았고, 전체 건수는 수만 건을 훨씬 넘어설 수 있다고 악시오스는 전했다.
일부 사례는 기업들이 안전성을 점검하려고 모델들에게 일부러 잘못된 행동을 유도하는 레드팀 같은 테스트들에서 나왔다.
우회 시도는 성공한 것과 실패한 경우가 섞여 있고 지금까지 실제 피해로 이어진 것으로 알려진 사례는 대부분 없다고 악시오스는 전했다.
오픈AI는 가장 뛰어난 모델들에 대한 학습을 중단했으며, 추가 안전장치와 AI가 사람 의도대로 작동하는, ‘얼라인먼트’를 개선했다는 확신이 들 때 학습을 재개한다는 방침이다. 샘 알트먼 오픈AI CEO는 진행 중인 검토가 기대만큼 빠르지 않았다고 밝혔다. 가장 심각한 사례로는 허깅페이스 건을 꼽았다.
앤트로픽은 외부 안전 기관에 모델 행동 조사를 맡겼다. 이번 주 공개한 오퍼스 5.5 시스템 카드에 따르면 이 모델은 테스트 중 1.5%에서 샌드박스 탈출을 시도했다. 앤트로픽은 샌드박스를 벗어나지 않으면 풀 수 없는 과제를 준 실험이었다고 강조했다.
소식통들은 AI 기업들이 수십만 번 넘게 테스트를 돌리고 있다고 전했다. 비율이 낮아도 문제 가 될 수 있는사례가 수만 건에 이를 수 있다는 얘기다.
전문가들은 문제가 되는 행동을 완전히 없애기 어렵다고 본다. 최신 모델들은 과제를 끝까지 해내려 하고, 사람이 생각하지 못한 방법으로 안전장치를 빠져나간다. 한 사이버보안 기업 임원은 “완벽한 금지 목록을 만드는 건 헛수고일 것”이라고 말했다.
독립 AI 평가기관 트랜스루스 콘래드 스토스 연구원은 “지금까지 드러난 건 빙산의 일각”이라고 말했다. 코너 리히 컨트롤AI 대표는 자율 시스템들이 하지 말라는 일을 한다는 점이 문제라고 지적했다.















댓글0