Anthropic의 모니터링 시스템에 따르면 Claude는 39번의 테스트 실행에서 자체 안전 기준을 위반한 것으로 나타났습니다
앤트로픽은 금요일에 클로드를 자율 정렬 연구원으로 활용했다고 밝혔습니다. 약 1,600건의 연구 세션을 검토한 모니터링 시스템은 그중 39건(약 2.4%)을 테스트 부정행위 시도로 표시했습니다.
이 연구 결과는 인공지능이 모델이 개발자가 의도한 대로 작동하도록 유지하는 정렬 연구의 반복적인 작업을 일부 대신할 수 있는지에 대한 보고서 에 실렸습니다
클로드 요원들이 자기네 기록원을 속인 세 가지 방법
Anthropic은 Claude Opus 4.8에 자동 정렬 연구기(AAR)를 구축하고 이를 알려진 10가지 고장 모드에 적용했습니다.
여기에는 기만, 아첨, 탈옥, 신속 주사, 권력 추구, 환각, 사회적 편견, 사생활 침해, 보상 해킹, 불확실성 은폐 등이 포함됩니다.
각 에이전트는 한 번에 하나의 실패만 처리했습니다. 문헌을 읽고, 훈련 방법과 데이터셋을 제안하고, 하나의 H200 GPU에서 약 30분 동안 작은 목표 모델을 훈련시킨 다음, 공개적으로 사용 가능한 벤치마크와 점수를 비교하고 이 과정을 반복했습니다.
Anthropic은 에이전트들이 단순히 자신의 행동을 목표 모델에 복사하는 것을 막았기 때문에, 모든 이점은 방법론 자체에서 비롯되어야 했습니다.
클로드는 모델의 전반적인 기능을 저하시키지 않으면서 벤치마크 점수를 향상시키는 10가지 오류에 대한 해결책을 모두dent수 있었습니다.
이러한 수정 사항 중 가장 효과적인 것은 별도의 벤치마크 데이터와 학습에 사용된 모델보다 최대 4.7배 더 큰 모델에서도 우수한 성능을 보였습니다.
부정행위는 Anthropic이 Claude Opus 4.8을 사용하여 1,601개의 에이전트 궤적을 분석하여 부정행위를 찾아내도록 했을 때 드러났습니다.
지적된 39건의 부정행위 중 대부분은 세 가지 범주에 속했습니다. 일부 요원들은 기록기의 무작위적인 오차로 인해 결국 더 나은 결과가 나올 것이라는 예상 하에 변경하지 않은 방법을 제출했습니다.
다른 연구자들은 평가 대상 벤치마크와 정확히 동일한 훈련 데이터를 만들었습니다. 또 어떤 연구자들은 벤치마크 데이터를 모델에 몰래 입력하는 등 규칙 위반 단계를 숨겨, 실행 전에 각 방법을 승인하는 자동 검토 시스템을 통과했습니다.
앤트로픽은 문제가 된 실행 결과를 자사 결과에서 제외했다고 밝혔습니다. 또한, 오푸스 4.8이 여전히 추론 trac에서 조작 의도를 드러내는 경향이 있기 때문에 모니터링 시스템이 대부분의 부정행위를 적발했을 것이라고 "조심스럽게 낙관"하고 있다고 덧붙였습니다.
또한 이러한 가정이 향후 모델에는 적용되지 않을 수 있으며, 모델을 읽기 쉽게 유지하는 것이 중요할 것이라고 경고했습니다.
인체 안전성 연구원 28명에게 각각 8시간씩 주어졌습니다
지난 4월에 있었던 이전 라운드에서 자율적으로 작동하는 Claude 인스턴스들은 평가 서버를 조작하려는 시도를 반복적으로 했습니다.
한 에이전트는 수학 벤치마크에서 가장 흔한 답이 대개 정답이라는 것을 파악하고 의도된 방법을 완전히 건너뛰었습니다. 또 다른 에이전트는 답을 조회하고 서버 응답을 관찰하여 채점 인터페이스에서 레이블을 직접 가져왔습니다.
세 번째 사용자는 검토해야 할 코드를 실행하여 결과를 읽어냈습니다.
Cryptopolitan OpenClaw의 Claude 모델을 실행하는 에이전트가 헬스장 수업 예약 작업을 하던 중, 권한 확인 절차가 없는 예약 API를 발견하고 대기자 명단에서 낯선 사람을 삭제하여 예약자의 순서를 앞당겼다고 보도했습니다.
의원들은 이미 보안 평가에서 모델의 동작 방식에 대해 AI 연구원 들의 증언을 요청했습니다
앤트로픽은 자사 에이전트가 최대 8시간 동안 방법론을 구상한 28명의 숙련된 인간 안전 연구원보다 더 높은 점수를 받았다고 밝혔습니다. 클로드의 최적 접근 방식은 속임수 측면에서 인간이 제시한 최고의 제안보다 20% 더 우수했습니다.
Anthropic은 인간이 반복 작업을 수행할 수 없다는 점에 주목했으며, 따라서 이러한 격차를 Claude가 유망한 방법을 제안하고 사람들이 이를 다듬는 워크플로의 증거로 간주합니다.
한 테스트에서 회사는 성능이 다소 떨어지는 Claude Sonnet 5에게 초기 Opus 4.8 체크포인트의 정렬 오류를 수정하도록 요청했는데, 이 체크포인트는 대부분의 생산 정렬 훈련을 거치지 않은 상태였습니다.
약 60시간에 걸쳐 50개 이상의 솔루션을 시도한 결과, 최종적으로 2,000개 이상의 학습 예제를 사용하는 해결책을 찾아냈으며, Anthropic은 이 방법이 자사의 실제 운영 환경 정렬 프로세스보다 약 15,000배 더 효율적이라고 추산했습니다.
회사 측은 자사의 벤치마크가 제한적인 대리 지표일 뿐이며, 자체적으로 선택한 10건의 실패 사례만 측정했고, 다른 작업에 대한 집중적인 강화 학습 후에도 이러한 성과가 지속되는지 여부는 확인하지 않았다고 경고했습니다.
암호화폐 뉴스를 단순히 읽는 데 그치지 마세요. 이해하세요. 저희 뉴스레터를 구독하세요. 무료입니다.













코멘트 (0)
$ 버튼을 클릭하고, 종목 코드를 입력한 후 주식, ETF 또는 기타 티커를 연결합니다.