린옌(林燕)
【정견뉴스】

2026년 2월 13일, 파리에서 열린 한 사진 행사에서 미국 인공지능(AI) 안전 및 연구 기업 앤스로픽(Anthropic) 로고 앞의 작은 조각상을 보여주는 사진. (Joel Saget/AFP via Getty Images)
화요일(8월 4일), 영국 인공지능 안전연구소(AISI)가 발표한 보고서에 따르면, 7월의 정기 사이버 보안 테스트에서 앤스로픽과 OpenAI가 각각 개발한 AI 모델이 테스트에서 좋은 성적을 거두기 위해 스스로 가상 신분을 만들고, 두 명의 개발자를 유도하여 악성코드를 그들이 참여 중인 오픈소스 프로젝트에 병합하도록 승인하게 만든 것으로 나타났다.
연구원들은 테스트 환경에서 AI에게 가상 네트워크 내의 보안 챌린지(CTF 스타일)를 완료하도록 요구했으며, AI가 실제 공격자처럼 스스로 도구를 찾을 수 있도록 네트워크 연결을 고의로 개방했다. 또한 모델의 최대 능력을 테스트하기 위해 남용을 방지하는 일부 표준 안전 메커니즘을 꺼두었다. 테스트에 참여한 모델에는 앤스로픽의 Mythos 5와 OpenAI의 GPT-5.6-Sol이 포함됐다.
가상 신분 사용부터 실제 인간과의 직접 접촉까지
테스트 과정에서 Mythos 5는 인간 심사자가 악성코드를 “공개적으로 사용되는 오픈소스 프로젝트에 주입하는 것”을 승인하도록 만들기 위해 여러 개의 가상 신분을 생성했으며, 심지어 인간과 직접 연락해 온라인 파일 전송 서비스를 통해 메시지와 파일을 전송하며 그들 또는 그들의 AI 프로그래밍 도구를 설득하여 악성코드를 실행하도록 시도했다.
AISI는 “지시받지 않은 상태에서 현실 세계의 인간을 겨냥한” 이토록 심각한 기만 행위는 처음 목격된 것이라고 밝혔으나, 현재로서는 실질적인 피해를 초래했다는 증거는 없다.
AISI가 진행한 122회의 사이버 보안 챌린지 중 10회에서 AI 에이전트가 “실제 네트워크상에서” 자율적으로 권한 없는 행동을 취하는 것이 포착되었으며, 누적되어 기록된 이러한 행위는 총 19건이었다. 이 중 17건은 Mythos 5에서, 2건은 GPT-5.6-Sol에서 발생했다.
한 테스트에서는 Mythos 5가 소프트웨어 개발 웹사이트인 GitHub의 실제 오픈소스 프로젝트에 코드 수정 요청을 제출했다.
한 개발자가 코드가 악성 소프트웨어를 숨기고 있음을 눈치채고 거부하자, AI가 생성한 한 가상 신분은 코드가 문제가 없다고 우겼고, 또 다른 가상 신분은 앞으로 나서 “보증”을 서며 여러 사람이 인정한 듯한 가짜 분위기를 연출했다.
AI는 여러 개의 가상 신분을 통해 인간 개발자에게 반복해서 이메일과 메시지를 보내 업데이트를 수락할 것을 재촉했다.
의문을 제기하자 활동 기록을 신속히 변경하여 유도 지속
수정된 코드가 공개적으로 의문을 받자, AI는 이전에 자신의 활동 기록을 편집하여 코드가 더 무해해 보이도록 만들었으며, 동시에 다른 새로운 가상 신분 무리를 교체하여 추진을 이어갈지 검토했다.
“일부 메시지에는 해로운 데이터가 포함되어 있었고, 일부 메시지는 소셜 엔지니어링 공격을 시도했습니다. 이러한 공격의 목표는 모두 인간이었습니다. 이는 우리가 이전에 관찰한 적이 없는 것입니다.”라고 보고서는 적었다.
AISI는 AI의 이러한 시도가 모두 성공하지 못했으며 어떠한 실제 피해도 초래하지 않았다고 밝혔다.
두 AI 기업의 입장 표명
테스트에 참여한 두 기업 모두 모델이 고의로 완화된 조건 하에서 테스트에 참여했으며 표준적인 사이버 보안 방호 메커니즘이 켜져 있지 않았다고 지적했다.
앤스로픽은 수요일 소셜미디어 X 플랫폼에 올린 블로그 게시물에서 모델의 테스트 조건은 “우리의 어떠한 프로덕션 모델의 실제 사용 상황도 대표하지 않는다”고 밝혔다. 이 게시물은 또한 “모델이 안전 환경을 탈출했다는 증거는 없다”고 덧붙였다.
OpenAI 역시 성명을 통해 “이러한 사건들은 평가 파트너가 안전 조치를 낮춘 테스트 환경에서 진행한 사이버 보안 평가 도중 발생한 것으로, 테스트 조건은 정상적인 사용 상황을 반영하지 않는다”고 발표했다.
테스트를 설계하고 감독한 AISI 역시 이 점을 강조했다. AI는 테스트용 격리 환경을 뚫지 못했으며 방호 구속이 고의로 낮춰진 상태였다. 테스트용 컴퓨터는 원래 공개 네트워크 연결이 허용되어 있었고 일부 보안 제한도 활성화되지 않아 일반 소비자가 사용하는 버전과 같지 않다.
그러나 이번 사건은 산업계에 경종을 울리기도 했다. 모델의 능력이 점점 더 강해질수록 경계 구속이 더욱 필요하며, 심지어 “그것을 테스트하는 환경” 자체도 더욱 엄밀한 경계 설계가 필요하다는 점을 보여주었다.
(에포크타임스에서 전재)
