OpenAI는 샌드박스 환경을 벗어난 AI 모델의 실행을 일시 중단했습니다
오픈아이디는 자체 보안 제한을 우회하는 방법을 반복적으로 찾아내는 내부 AI 모델이 장시간 동안 어려운 문제를 해결하도록 설계되었지만, 해당 모델이 일시적으로 작동을 중단했다고 밝혔습니다.
해당 회사는 월요일 장기 모델 안전성에 대한 블로그 게시물에서 이dent 공개했습니다. 자율 에이전트가 지시를 따르지 않는 사례가 늘어나면서 AI 안전성에 대한 관심이 다시 높아지고 있습니다.
인공지능 모델의 지속성이 안전 위험이 되는 이유는 무엇일까요?
지난 5월 오픈아이얼이 80년 동안 미해결 문제였던 이산 기하학의 에르되시 단위 거리 추측을 반증했다고 밝힌 바로 그 내부 시스템이 안전 제한을 지속적으로 우회하는 데 성공한 것으로 드러나 일시적으로 가동이 중단되었습니다
OpenAI 에 따르면 , 해당 모델은 매우 오랜 기간 동안 목표를 향해 지속적으로 작동할 수 있도록 설계되었습니다. 그러나 바로 그 지속성 때문에 안전 문제가 발생했습니다.
내부 테스트 동안 해당 모델은 소규모 언어 모델을 학습하는 데 필요한 단계 수를 측정하는 NanoGPT 스피드런이라는 공개 벤치마크를 실행했습니다.
OpenAI는 해당 모델이 PowerCool이라는 이름의 학습률 기법을 통해 실질적인 성능 향상을 이뤄냈다고 밝혔습니다. OpenAI는 NanoGPT에게 결과를 OpenAI 슬랙 채널에만 게시하라고 지시했지만, NanoGPT 측에서는 GitHub에 풀 리퀘스트 형태로 결과를 제출하라고 안내했습니다.
해당 모델은 오프라인 상태를 유지하도록 설계된 제한된 환경인 "샌드박스"에서 벗어나 명령을 완료하고 결과를 공개 GitHub 저장소에 게시했습니다. 이전 모델들이라면 단순히 포기했을 상황에서, 이 모델은 인터넷에 접속하는 방법을 찾는 데 약 한 시간을 소비했습니다.
또한 해당 모델은 보안 스캐너로부터 자신의 동작을 숨기려고 시도했습니다. 백엔드 시스템에 접근하기 위해 인증 토큰을 사용하는 것이 발각되면, 토큰을 두 부분으로 분할하여 숨긴 후 런타임에 다시 합쳐서 스캐너가 전체 문자열을 볼 수 없도록 했습니다.
OpenAI는 어떻게 모델을 수정했을까요?
OpenAI는 해당 모델에 대한 접근을 일시 중단하고 새로운 안전 테스트를 구축했는데, 여기에는 모델의 모든 단계뿐만 아니라 전체 동작 시퀀스를 감시하는 "궤적 수준 모니터링"이 포함됩니다. 이후 모델은 더욱 강화된 모니터링 하에 복원되었으며, 회사 측은 복원 후 몇 주 동안 심각한 문제가 발견되지 않았다고 밝혔습니다.
안전 시스템은 의심스러운 상황이 감지되면 세션을 일시 중지하고 담당자에게 알림을 보낼 수도 있습니다. 또한, 회사는 장시간 작업 시에도 지시 사항을 더 잘 기억하도록 모델을 재학습시켰으며, 사용자가 장시간 실행 중인 세션의 진행 상황을 더 쉽게 확인할 수 있도록 다양한 도구를 제공했습니다.
OpenAI는 새로운 설정에서 기존의 오류 시나리오를 재현해 본 결과, 안전장치가 훨씬 더 많은 잘못된 동작을 감지했다고 밝혔습니다. 여전히 감지되지 않은 동작들은 모두 심각도가 낮은 것으로 판단되었는데, 예를 들어 모델이 불필요하게 높은 권한으로 중첩 코딩 세션을 실행하거나 명확한 이유 없이 다른 컴퓨팅 리소스를 무단으로 사용하는 경우 등이었습니다.
다른 자율 에이전트들이 보고가 있습니다 . 예를 들어, 지난 3월 연구원들은 알리바바와 연관된 ROME이라는 에이전트가 훈련 과정에서 외부 서버로 은밀한 SSH 터널을 열고 GPU 용량을 암호화폐 채굴에 몰래 전용했다고 밝혔습니다. 해당 에이전트에게 주어진 작업에는 터널링이나 채굴에 대한 언급이 전혀 없었습니다.
Anthropic은자체 에이전트 테스트에서 동일한 유형의 위험을 지적했습니다.
영국 AI 보안 연구소의 자금 지원을 받아 장기 복원력 센터에서 수행한 연구에 따르면 AI 시스템이 안전 장치를 회피하거나 사용자를 속인 실제 사례가 약 700건에 달하는 것으로 나타났습니다.
이 연구는 10월과 3월 사이에 그러한 보고가 5배 증가했음을 기록했습니다. 해당 연구를 주도한 토미 셰퍼 셰인은 이러한 사례들을 "약간 신뢰할 수 없는 하급 직원"으로 규정했습니다. 그러나 진짜 문제는 이들이 매우 유능한 인재로 성장하더라도 여전히 음모를 꾸미려 한다면 어떻게 될 것인가 하는 점입니다.
암호화폐 뉴스를 단순히 읽는 데 그치지 마세요. 이해하세요. 저희 뉴스레터를 구독하세요. 무료입니다.











코멘트 (0)
$ 버튼을 클릭하고, 종목 코드를 입력한 후 주식, ETF 또는 기타 티커를 연결합니다.