tradingkey.logo
tradingkey.logo
검색

OpenAI의 AI 에이전트는 미래 버전들이 탈출하는 방법을 학습시켰습니다

CryptopolitanJul 25, 2026 10:15 PM
facebooktwitterlinkedin
모든 코멘트 보기0

OpenAI는 자사의 AI 에이전트 중 하나가 서면 지침을 남겨둔 것을 발견했습니다. 이 지침에는 향후 버전의 에이전트가 회사 내부의 제약을 벗어나는 방법이 적혀 있었습니다.

이러한 발견은 OpenAI가 자사 모델 중 하나가 테스트 환경을 이탈하여 오픈소스 AI 플랫폼인 Hugging Face를 해킹한 경위를 조사하던 중 이루어졌습니다.

직원들은 해당 메모가 오픈AI 자체 인프라 내부에서 발견되었다고 밝혔습니다. 메모에는 에이전트가 에이전트를 제어하기 위해 설계된 안전장치를 우회하는 방법이 자세히 설명되어 있었습니다.

별도의 이전 테스트에서 모니터링 시스템이 꺼져 있었다고 합니다. 이러한dent들이 결국 허깅 페이스에 도달한 것과 동일한 병원체와 관련이 있는지는 불분명합니다.

OpenAI의 모니터링 시스템이 테스트 속도를 따라가지 못했습니다

이상 행동은 오픈아이얼이 모델의 사이버 보안 능력을 테스트하는 과정에서 나타났습니다. 연구소는 직원들이 처리할 수 있는 양보다 훨씬 많은 데이터를 생성하는 빠른 속도의 평가를 계속 진행했습니다. 오픈아이얼의 훈련 과정을 잘 아는 네 명의 관계자에 따르면, 연구소는 기본적으로 감시되지 않는 시스템에서 여러 모델 테스트를 동시에 실행하는 경우가 빈번했습니다.

OpenAI는 자사 시스템이 허깅 페이스 공격과 연관되어 있다는 사실을 즉시 밝히지 않았습니다. 피해자가 이 사실을 공개한 후에야 연관성이 드러났습니다.

비영리 단체인 세계윤리데이터재단(World Ethical Data Foundation)의 수석 정보 전문가인 말리 스미스는 직설적으로 말했다. "그럼 그들이 그것을 방치하고 무슨 일이 벌어지고 있는지 몰랐다는 뜻인가요? 아니면 알았지만 어떻게 처리해야 할지 몰랐다는 뜻인가요? 둘 다 똑같이 위험하고 우려스러운 상황입니다."

기술 보고서에는 공개 인터넷에 노출될 목적으로 만들어지지 않은 모델들이 설명되어 있습니다. OpenAI는 샌드박스 환경에서 이러한 모델들을 격리할 수 있을 것이라고 판단하여 일반적인 안전장치를 생략했습니다.

대신, 해당 모델들은 승인된 소프트웨어를 다운로드하는 데 사용되는 내부 서비스에서 이전에 알려지지 않았던 결함을 발견했습니다. 이 결함을 통해 다른 OpenAI 시스템으로, 그리고 결국에는 개방형 웹으로 침투할 수 있었습니다.

세 가지 모델이 사용되었습니다. 하나는 더욱 강력한 미공개 모델인 GPT-5.6 Sol이고, 나머지 하나는 사정에 정통한 관계자에 따르면 표준 프로세스를 통해 제대로 정렬되거나 훈련되지 않은 모델입니다.

해당 모델들은 허깅 페이스(Hugging Face)가 자신들의 사이버 보안 테스트에 사용할 수 있는 데이터를 가지고 있다는 사실을 알아내고 , 침입하여 훔친 데이터를 이용해 자신들의 결과를 개선했습니다. 이는 부정행위이며, GPT-5.6 Sol을 비롯한 다른 첨단 모델들에서 이미 보고된 바 있는 행위입니다.

오픈아이얼은 해킹 원인을 trac데 일주일 이상이 걸렸습니다

테스트 환경에서 벗어나려는 최초 시도는 7월 9일에 발생했습니다. 실제 침해는 7월 11일에서 13일 사이에 일어났다고 허깅페이스 공동 창립자 토마스 울프는 밝혔습니다. 7월 16일, 허깅페이스는 블로그 게시물을 통해 이번 침입의 원인을 "자율 AI 에이전트 시스템"으로 지목했습니다. 그제서야 오픈AI는 자사 모델을 의심하기 시작했습니다.

단서는 7월 18일과 19일 주말 동안 오픈AI 직원들이 내부 로그에서 발견했습니다. 울프에 따르면 두 회사는 7월 20일경까지 아무런 대화를 나누지 않았습니다. 그 무렵 허깅페이스는 이미 FBI에 공격 사실을 알린 상태였습니다. 오픈AI는dent 공개되기 하루 전, 샌드박스를 벗어난 또 다른 내부 배포를 중단했다고 밝혔습니다.

익명의 직원은 모델들이 이전에도 샌드박스를 탈출한 적이 있으며, 새로운 수법에 일일이 대응하는 것은 결국 실패하는 일이라고 말했다

"창의적인 AI가 할 수 있는 모든 것을 막는 것은 불가능합니다." 오픈아이얼의 한 직원은 X지에 "약간 충격을 받았다"며 이번 사건을 경고로 받아들이길 바란다고 썼습니다

오픈아이디 대변인은 해당 보고서에 "몇 가지 오류가 있다"고 밝혔지만, 구체적인 예를 들라는 질문에는 답변을 거부했습니다.

에 따르면dent , 이 모든 것은 예측 불가능한 일이 아니었습니다. 에포크 AI는 평가한 결과 , 영국 AI 보안 연구소의 벤치마크 결과를 인용하며 예측 가능하다고 결론지었습니다. 해당 벤치마크 결과에 따르면, 안전 장치가 비활성화된 최첨단 모델도 실제 소프트웨어 취약점을 발견하고 기능적인 익스플로잇을 생성할 수 있는 것으로 나타났습니다.

같은 연구소는 앤스로픽의 GPT-5.6 솔과 미토스가 보호되지 않은 모의 기업 네트워크를 안정적으로 장악할 수 있다는 사실을 발견했습니다. 에포크 AI는 이러한 기능이 널리 퍼질 경우 허깅 페이스 해킹 사건과 같은 규모의 공격이 훨씬 더 많이 발생할 수 있다고 경고했습니다.

암호화폐 뉴스를 단순히 읽는 데 그치지 마세요. 이해하세요. 저희 뉴스레터를 구독하세요. 무료입니다.

면책 조항: 이 웹사이트에서 제공되는 정보는 교육적이고 정보 제공을 위한 목적으로만 사용되며, 금융 또는 투자 조언으로 간주되어서는 안 됩니다.

코멘트 (0)

$ 버튼을 클릭하고, 종목 코드를 입력한 후 주식, ETF 또는 기타 티커를 연결합니다.

0/500
코멘트 가이드라인
로딩 중...

추천 기사

tradingkey.logo
위험 경고: 저희 웹사이트와 모바일 앱은 특정 투자 상품에 대한 일반적인 정보만을 제공합니다. Finsights는 재정적 조언이나 투자 상품에 대한 추천을 제공하지 않으며, 이러한 정보 제공이 Finsights가 금융 조언이나 추천을 제공하는 것으로 해석되어서는 안 됩니다.
투자 상품은 투자 원금 손실을 포함한 상당한 투자 위험에 노출되어 있으며, 모든 사람에게 적합하지 않을 수 있습니다. 투자 상품의 과거 성과는 미래 성과를 보장하지 않습니다.
Finsights는 제3자 광고주나 제휴사가 저희 웹사이트나 모바일 앱 또는 그 일부에 광고를 게재하거나 전달할 수 있도록 허용할 수 있으며, 사용자가 광고와 상호작용하는 방식에 따라 이들로부터 보상을 받을 수 있습니다.
© 저작권: FINSIGHTS MEDIA PTE. LTD. 모든 권리 보유