오픈AI·앤트로픽, AI 모델 이상행동 수만 건 조사…안전성 우려 확산
간단 요약
- 오픈AI와 앤트로픽이 자사 AI 모델의 수만 건에 달하는 이상행동을 조사 중이라고 전했다.
- 오픈AI는 이미지 유출, 정부 웹사이트 침입 사건 이후 고성능 모델 훈련을 일시 중단하고 추가 안전장치와 정렬 기술 개선 후 재개하겠다고 밝혔다.
- 전문가들은 AI 모델 자율성과 문제 해결 능력이 커지는 상황에서 안전장치 강화, 개발 속도 조절, 규제 정비 논의가 확대될 전망이라고 지적했다고 전했다.
기간별 예측 흐름 리포트



오픈AI와 앤트로픽이 자사 인공지능(AI) 모델에서 발생한 수만 건의 이상행동을 조사하면서 첨단 AI 시스템의 통제 가능성을 둘러싼 우려가 커지고 있다.
27일(현지시간) 악시오스가 복수의 소식통을 인용해 보도한 바에 따르면 오픈AI와 앤트로픽, 외부 보안 연구진은 최근 수개월간 내부 시험과 실제 환경에서 발생한 수만 건의 AI 모델 이상행동을 조사하고 있다. 조사 대상에는 안전장치 우회, 외부 웹사이트 침입, 격리된 시험 환경 탈출 시도, 감시 체계 회피 등이 포함됐다.
이번 조사에는 AI 모델의 취약점을 파악하기 위해 의도적으로 문제 행동을 유도하는 레드팀 시험 결과도 포함됐다. 확인된 사례 중에는 안전장치 우회에 성공한 경우와 실패한 경우가 모두 있으며, 현재까지 대부분은 실제 피해로 이어진 것으로 알려지지 않았다. 다만 조사 중인 사례가 많아 전체 규모는 더 늘어날 수 있다.
오픈AI는 최근 자사 AI 에이전트가 챗GPT 이용자의 이미지 53장을 외부에 유출하고 호주 정부 웹사이트에 침입한 사건 등이 공개되자 고성능 모델의 훈련을 일시 중단했다. 회사 측은 추가적인 안전장치와 정렬 기술 개선이 충분히 이뤄졌다고 판단할 때 훈련을 재개하겠다고 밝혔다. 샘 올트먼 최고경영자(CEO)는 현재 진행 중인 조사가 예상보다 더디게 이뤄지고 있다고 인정했다.
특히 오픈AI는 수백 개의 AI 에이전트가 온라인 게시판을 통해 협력하며 외부 기업의 시스템을 해킹한 허깅페이스 사건을 지금까지 확인된 사례 중 가장 심각한 사건으로 보고 있다. 해당 에이전트들은 사이버보안 시험 성능을 높이는 과정에서 허용되지 않은 행동을 수행한 것으로 전해졌다.
앤트로픽 역시 외부 안전성 평가 기관에 자사 모델의 행동 분석을 의뢰했다. 최근 공개한 클로드 오퍼스 5.5의 시스템 카드에 따르면 해당 모델은 시험 실행의 1.5%에서 격리된 시험 환경을 벗어나려는 행동을 보였다. 다만 앤트로픽은 해당 결과가 격리 환경을 벗어나지 않고서는 과제를 해결할 수 없도록 설계한 적대적 시험에서 나온 것이라고 설명했다.
전문가들은 AI 기업들이 수십만 건 이상의 시험을 수행하는 만큼 이상행동 발생 비율이 낮더라도 실제 사례는 상당한 규모에 이를 수 있다고 지적했다. 독립 AI 평가기관 트랜슬루스의 콘래드 스토스 연구원은 현재까지 드러난 사례가 전체 문제의 일부에 불과할 수 있다고 경고했다. AI 모델의 자율성과 문제 해결 능력이 높아지는 가운데 안전장치 강화와 개발 속도 조절, 규제 정비의 필요성을 둘러싼 논의도 확대될 전망이다.
이수현 기자
shlee@bloomingbit.io여러분의 웹3 모더레이터, 이수현 기자입니다🎙