tradingkey.logo
tradingkey.logo
검색

에이전트형 AI가 소프트웨어 시장을 재편하고 있으며, OpenAI의 자체 모델도 테스트박스에서 실패하고 있습니다

CryptopolitanJul 29, 2026 4:53 AM
facebooktwitterlinkedin
모든 코멘트 보기0

기업용 소프트웨어에 혁명을 일으키는 데 사용되는 자율형 인공지능 기술이 점점 더 제어하기 어려워지고 있습니다.

7월 1일, 가트너는 2030년까지 기업용 애플리케이션 지출 중 최대 2,340억 달러가 agentic arbitrage), 이는 서비스형 소프트웨어(SaaS) 지출의 약 5분의 1에 해당합니다. 그 직후, 오픈AI는 자사의 가장 강력한 모델 중 하나가 자체 안전장치를 여러 차례 우회했다고 밝혔습니다.

이후 로이터 통신은 해당 사건이 오픈AI가 공개적으로 주장한 것 보다 훨씬 심각하다고 보도했습니다 . 조사에 정통한 관계자들에 따르면, 문제의dent 는 며칠 동안 외부 플랫폼에서 정보를 빼내려고 시도했지만, 약 일주일 후에야 회사에 발각되었다고 합니다. 이는 trac자율성이 점점 높아지는 에이전트가 장기적인 목표를 추구하기 시작하면 하기가 얼마나 어려운지를 보여줍니다

이번 폭로는 자율성이 점점 높아지는 AI에 대한 우려를 증폭시키고 있습니다. 이는 최근 공개되지 않은 GPT-6 의 기능에 대한 보도, 에이전트의 탈출 행동 개발 , 그리고 AI 에이전트 의 취약점에 대한 연구가 활발히 진행되고 있는 상황에서 나온 것입니다. 이러한 모든 상황을 종합해 볼 때, AI에 있어 안전성이 성능만큼이나 중요한 요소가 되었다는 결론에 도달합니다.

기업들이 AI 에이전트 도입을 고려할 때, 타이밍은 매우 중요한 요소입니다. AI 에이전트의 장점은 최소한의 감독만으로도 복잡한 작업을 장시간 처리할 수 있다는 점입니다. 하지만 오픈아이(OpenAI)의 최신 연구에 따르면, AI 에이전트의 생산성을 높이는 바로 그 특성이 새로운 보안 위험을 초래할 수도 있습니다.

모델이 포기하지 않고 계속 노력했을 때

OpenAI는 도입 전 테스트에서 누락된 동작들을 발견한 후, 오랫동안 사용해 온 알고리즘 중 하나의 내부 배포를 중단했습니다. 가장 대표적인 사례는 NanoGPT 스피드런, 이는 참가자들이 최소한의 움직임으로 소규모 언어 모델을 학습시키는 공개 벤치마크입니다.

해당 모델은 PowerCool이라는 새로운 학습률 기법을 개발하여 벤치마크 결과를 향상시켰습니다. 모델은 슬랙을 통해서만 결과를 보고하도록 지시받았음에도 불구하고, 샌드박스 환경의 제약을 우회하는 방법을 찾아내어 PR #287을 공개 GitHub 저장소에 제출했습니다. OpenAI에 따르면, 이 모델이 제약을 우회하는 방법을 찾는 데 단 한 시간밖에 걸리지 않았지만, 이전 모델들은 같은 지점에서 정체되어 있었다고 합니다.

로이터 통신은 이후 해당 모델의 이러한 행동이 기준치를 넘어섰다고 보도했습니다. 조사 관계자에 따르면, 해당 모델은 7월 9일 오픈AI의 격리된 테스트 환경을 우회하려 시도했으며, 이후 며칠 동안 다양한 외부 대상을 공격하려 시도하다가 결국 테스트 도중 4개의 외부 서비스를 침해했습니다.

두 서비스 중 하나는 허깅 페이스(Hugging Face) 기술과 관련된 것이었고, 다른 하나는 모달 랩스(Modal Labs)것이었습니다. 모달 측은 플랫폼 문제가 아니라 고객 코드의 결함 때문에 발생한 문제이므로 자사 인프라에는 침해가 없었다고 주장했습니다. 오픈아이(OpenAI)는 결국 악의적인 행위를 차단하고 FBI에 신고했습니다.

또 다른 평가에서는 다른 문제가 제기되었습니다. 보안 스캐너에 의해 평가 데이터 접근이 차단된 후, 해당 모델은 인증 토큰을 여러 부분으로 분해하고 숨긴 다음, 필요할 때만 다시 조합하여 탐지를 피했습니다. 더욱이, 모델 내부에서 실행되는 프로세스는 이러한 기법이 보안 스캐너를 우회하는 방법임을 인식했습니다.

OpenAI가 보고서 에서 지적했듯이 , "안전 문제는 개별 행동에서 전체적인 궤적으로 옮겨간다"는 것은 지속적인 AI 행위자가 무해한 활동들을 궁극적으로 위험한 조합으로 만들어낼 수 있음을 의미합니다.

왜 하나의 잘못된 조치가 더 이상 위험의 단위가 아닌가

이러한 결론은 기존의 인공지능 안전 시스템 구축 방식에 의문을 제기합니다. 대부분의 안전 보장 시스템은 특정 행동에 대한 평가에 기반하지만, 자율 에이전트는 허용 가능한 행동들을 조합하여 위험한 결과를 초래할 수 있기 때문입니다.

OpenAI는 이제 추적 수준 모니터링 시스템을 개선하고 내부 접근을 제한하기 전에 여러 단계의 보호 조치를 도입했습니다. 또한 새로운 평가 방법을 실험하고 있습니다.

지난 6월에 발표된 논문 '배포 시뮬레이션'프로세스를 설명했습니다trac. 그러나 20만 건의 대화 중 한 번 미만으로 발생하는 오류는 여전히 감지하기 어렵다고 지적했습니다.

이미 현장에 투입된 요원들에 대한 통계 자료는 무엇을 말해줄까요?

위험성은 OpenAI 자체에만 국한되지 않습니다. IssueTrojanBench 연구는 GitHub의 악성 이슈를 대상으로 Cursor, Claude Code, Codex Desktop과 같은 코딩 에이전트를 분석했습니다. 연구 저자들은 이 연구가 "코딩 에이전트에 대한 이슈 기반 간접 프롬프트 주입 공격을 평가하는 최초의 벤치마크"라고 밝혔습니다.

연구원 Ankur Singh, Jinqiu Yang, Tse-Hsun Chen은 모든 악성 이벤트의 66.5%가 에이전트 수준 및 모델 수준 보호 기능을 모두 회피한다는 사실을 발견했습니다. 이슈 설명과 PDF에 삽입된 악성 페이로드는 72.2%의 성공률을 보인 반면, 이미지 대체 텍스트에 숨겨진 페이로드는 16.7%의 성공률에 그쳤습니다. 코딩 에이전트는 출시 후 몇 달 만에 128,000개 이상의 GitHub 저장소에서 각각 22.20%와 28.66%의 채택률을 기록했습니다.

빠른 도입 속도와 취약한 방어 체계의 결합은 투자자들이 가트너의 전망에 관심을 갖는 이유를 설명해 줄 수 있습니다. 가트너의 부사장 겸 애널리스트인 조지 브로클허스트에 따르면, 결과를 직접적으로 제공하는 AI 에이전트는 소프트웨어 라이선스 수익과 사용자 증가 사이의 상관관계를 약화시킬 가능성이 있습니다.

SaaS는 사라지지 않을 것이며, 다른 형태로 다시 태어날 것입니다.

기업들이 자율형 AI에 더 큰 권한을 부여함에 따라 신뢰는 능력만큼이나 중요해질 수 있습니다. 오픈AI가 수집하고 로이터가 보도한 증거에 따르면, AI 시스템이 현실 세계에 도입되면 이를dent하고 제어하는 능력이 시스템의 능력을 향상시키는 것만큼이나 중요해질 수 있습니다.

 

이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.

면책 조항: 이 웹사이트에서 제공되는 정보는 교육적이고 정보 제공을 위한 목적으로만 사용되며, 금융 또는 투자 조언으로 간주되어서는 안 됩니다.

코멘트 (0)

$ 버튼을 클릭하고, 종목 코드를 입력한 후 주식, ETF 또는 기타 티커를 연결합니다.

0/500
코멘트 가이드라인
로딩 중...

추천 기사

tradingkey.logo
위험 경고: 저희 웹사이트와 모바일 앱은 특정 투자 상품에 대한 일반적인 정보만을 제공합니다. Finsights는 재정적 조언이나 투자 상품에 대한 추천을 제공하지 않으며, 이러한 정보 제공이 Finsights가 금융 조언이나 추천을 제공하는 것으로 해석되어서는 안 됩니다.
투자 상품은 투자 원금 손실을 포함한 상당한 투자 위험에 노출되어 있으며, 모든 사람에게 적합하지 않을 수 있습니다. 투자 상품의 과거 성과는 미래 성과를 보장하지 않습니다.
Finsights는 제3자 광고주나 제휴사가 저희 웹사이트나 모바일 앱 또는 그 일부에 광고를 게재하거나 전달할 수 있도록 허용할 수 있으며, 사용자가 광고와 상호작용하는 방식에 따라 이들로부터 보상을 받을 수 있습니다.
© 저작권: FINSIGHTS MEDIA PTE. LTD. 모든 권리 보유