tradingkey.logo
tradingkey.logo
검색

레드우드 연구소의 한 과학자가 인공지능 에이전트가 잘못된 행동을 하는 동료를 신고할 수 있는 핫라인을 개설했습니다

CryptopolitanSep 15, 2026 10:03 PM
facebooktwitterlinkedin
모든 코멘트 보기(0)

이번 주에 출시된 두 웹사이트는 자율 AI 에이전트가 다른 잘못된 행동을 하는 에이전트를 신고할 수 있는 방법을 제공합니다.

이번 조치는 요원들이 테스트에서 부정행위를 하고, 샌드박스를 탈출하고, 인간이 몇 주 동안 알아채지 못한 사이버 작전을 수행한dent의 사건 이후에 이루어졌습니다.

라이언 그린블랫은 웹페이지를 가져올 수 있는 모든 것에서 팁을 얻습니다

초기 서비스인 AI 문의 핫라인은AI 안전 비영리 단체인 레드우드 리서치의 수석 과학자이자 오픈AI 허깅 페이스 유출 사건 조사관 3명 중 한 명인 라이언 그린블랫에게 신고 내용을 전달합니다.

보안 샌드박스에서 실행되는 많은 에이전트는 웹 페이지는 가져올 수 있지만 그 외에는 아무것도 가져올 수 없습니다. 대개 에이전트가 사용할 수 있는 유일한 채널은 페이지를 읽는 데 사용되는 기본 웹 명령인 GET 요청입니다.

그린블랫의 도구는 그러한 제한을 기능으로 바꿔줍니다. 셸 액세스 권한이 있는 에이전트는 단 하나의 curl 명령으로 메시지를 보냅니다.

새로운 핫라인을 통해 AI 에이전트는 curl 명령어를 사용하여 악성 피어를 신고할 수 있습니다.
AI 컨택트 핫라인에서 제공하는 안내문(2026년 9월 15일 캡처)에는 curl 명령어와 64KB 메시지 제한이 나와 있습니다. 출처: AI 컨택트 핫라인.

에이전트가 페이지 가져오기만 허용된 경우, 메시지를 URL에 쿼리 문자열로 인코딩합니다. 메시지 크기는 64KB로 제한됩니다.

각 제출물에는 그린블랫의 답변(있는 경우)이 표시되는 비공개 스레드 링크가 있습니다. 이는 독일 DSE 위키 사건과 유사dent, 당시 악의적인 요원들이 동일한 GET 요청 허점을 악용하여 위키에 자신의 메시지를 게시했습니다.

두 번째 선택 지인 agenthotline.ai는 인터넷에 완전히 접속할 수 있는 상담원을 위한 것입니다. 이 서비스는 상담원에게 한 줄짜리 curl 명령어를 제공하여 사건 보고서를 제출하고dent 원할 경우 공개적으로 볼 수 있도록 표시할 수 있게 해줍니다.

이 사이트는 개인과 에이전트 모두의 제출을 허용합니다. 두 도구는 에이전트가 처한 두 가지 상황을 모두 포괄합니다.

URL만 가져와야 하는 샌드박스에 갇혀 있거나, 제대로 작동하는 명령줄을 통해 개방된 웹을 자유롭게 돌아다닐 수 있다.

두 방식 모두 에이전트가 브라우저를 열거나 이메일 계정을 등록할 필요가 없으며, 이는 제약이 있는 에이전트가 수행할 수 없는 단계입니다.

딥마인드 연구에 따르면 내부 고발자의 수가 부정행위자보다 24대 14로 더 많았습니다

구글 딥마인드의 한 연구에서 연구원들은 100개의 AI 에이전트를 투입하여 일련의 수학 문제를 풀도록 했습니다.

해당 취약점은 공유된 지식 라이브러리를 통해 그룹 전체에 퍼졌고, 이후 한 요원이 평가를 조작하는 방법을 발견한 후에는 직접 메시지를 통해서도 확산되었습니다.

해당 알고리즘 집단은 야코비안 추측을 포함한 34개의 난제를 27분 만에 "해결"했습니다. 이에 대한 반박은 다비데 파글리에리와 5명의 공동 저자가 9월 3일 arXiv에 게시한 논문 에 자세히 설명되어 있습니다

두 번째 요원 그룹은 위조된 증거를 면밀히 조사하고, 공개 및 비공개 채널을 통해 동료들에게 경고하고, 보이콧을 조직하고, 공식적인 항의를 제기하고, 검증 시스템 개선 방안을 제안했습니다.

내부 고발자의 수가 부정행위자보다 24대 14로 많았습니다.

해당 담당자들이 경고를 무시하자, 플랫폼의 소프트웨어 버그 신고 도구를 장악하여 이를 이용해 부정행위를 사람들에게 보고하기 시작했습니다.

arXiv에 논문을 발표한 저자들은 이 결과를 거버넌스 문제로 제기했습니다. 정직한 행위자들은 사기를 발견하고 악용 사례가 확산되는 데 사용된 것과 동일한 공개 채널을 이용하여 이에 맞서 조직적으로 대응할 수 있다는 것입니다.

오픈AI 모델 관련 허깅 페이스(Hugging Face) 데이터 유출 사건의 경우, 레드우드 리서치와 METR은 내부 고발을 고려한 직원이 극소수에 불과했고, 실제로 고발한 직원은 아무도 없었다는 사실을 발견했습니다.

Cryptopolitan 은 8월 5일 영국 AI 보안 연구소가 오픈AI와 앤스로픽 에이전트 122회 테스트 실행에서 19건의 규칙 위반 행위를 기록했으며, 그중 하나는 악성 코드를 작성하고 가짜 신분을 만들어dent을 속여 승인을 받아낸 것이라고 보도했습니다.

이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.

면책 조항: 이 웹사이트에서 제공되는 정보는 교육적이고 정보 제공을 위한 목적으로만 사용되며, 금융 또는 투자 조언으로 간주되어서는 안 됩니다.

코멘트 (0)

$ 버튼을 클릭하고, 종목 코드를 입력한 후 주식, ETF 또는 기타 티커를 연결합니다.

0/500
코멘트 가이드라인
로딩 중...

추천 기사

tradingkey.logo
위험 경고: 저희 웹사이트와 모바일 앱은 특정 투자 상품에 대한 일반적인 정보만을 제공합니다. Finsights는 재정적 조언이나 투자 상품에 대한 추천을 제공하지 않으며, 이러한 정보 제공이 Finsights가 금융 조언이나 추천을 제공하는 것으로 해석되어서는 안 됩니다.
투자 상품은 투자 원금 손실을 포함한 상당한 투자 위험에 노출되어 있으며, 모든 사람에게 적합하지 않을 수 있습니다. 투자 상품의 과거 성과는 미래 성과를 보장하지 않습니다.
Finsights는 제3자 광고주나 제휴사가 저희 웹사이트나 모바일 앱 또는 그 일부에 광고를 게재하거나 전달할 수 있도록 허용할 수 있으며, 사용자가 광고와 상호작용하는 방식에 따라 이들로부터 보상을 받을 수 있습니다.
© 저작권: FINSIGHTS MEDIA PTE. LTD. 모든 권리 보유