앤트로픽, 클로드 오퍼스 5.5 공개: 비용 40% 절감, 더 빠른 속도, 업그레이드된 보안 및 강화된 장기 작업 능력
미국 동부시간 9월 22일, 앤스로픽은 복잡한 작업 처리 강화, 비용 절감, 안전성 향상을 목표로 하는 클로드 오퍼스 3.5 출시를 발표했다. 이전 버전 대비 작업 비용은 40% 절감되고 출력 속도는 30% 이상 향상되었으며, 각종 가격도 인하되었다.
테스트에서 오퍼스 5.5는 대규모 코드 검토와 수정, 지식 노동, 컴퓨터 조작, 차트 인식 등에서 향상된 역량을 보였다. 다만 앤스로픽은 이러한 수치가 실제 모든 실무 환경을 대변할 수는 없다고 언급했다. 보안 측면에서는 행동 감사 점수가 개선되었으나, 현실 세계의 모든 위험을 사전에 발견할 수는 없다는 점을 인정하며 일부 분야에 더욱 엄격한 안전장치를 적용했다.

TradingKey - 미국 동부시간 9월 22일, 앤스로픽(Anthropic)은 복잡한 작업 처리 능력 강화, 운영 비용 절감, 사용 안전성 향상이라는 세 가지 주요 측면에 중점을 둔 클로드 오퍼스 3.5(Claude Opus 3.5) 출시를 발표했다. 오퍼스 3과 비교해 작업 비용은 40% 절감되었고 출력 속도는 30% 이상 향상되었으며, 입력·출력 및 캐시 읽기 가격도 동시에 인하되었다.
이번 업그레이드에서 가장 주목할 만한 점은 단일 벤치마크 1위 달성 여부라기보다, 장기적인 협력 파트너처럼 작동하기 시작했다는 점일 수 있다. 대규모 코드 마이그레이션 처리, 비즈니스 자료 정리, 분석 보고서 생성이 가능함과 동시에 답변을 보다 직관적으로 제시하여 검토를 용이하게 해준다.
복잡한 프로그래밍이 더 많은 시간을 절약한다
오퍼스 5.5의 가장 두드러진 역량은 지속적인 검증이 필요한 대규모·다단계 프로그래밍 작업에 집중되어 있다. 한 테스트에서 오퍼스 5.5는 20만 줄 규모의 코드베이스를 3시간 미만에 검토하고 수정했다. 반면 오퍼스 5는 20시간 이상이 소요되었으며 약 2.5배 많은 토큰을 소비했다. 기업 입장에서 이는 AI의 가치가 단순히 "코드를 작성할 수 있는지 여부"뿐만 아니라 비효율을 줄이고 시간을 절약할 수 있는지 여부에 달려 있음을 의미한다.

[출처: 앤스로픽]
또한 테스트 데이터에 따르면 오퍼스 5.5는 Terminal-Bench 4.0에서 66.4%, FrontierCode v1.1에서 54.4%, CursorBench 4.0에서 57.8%를 기록했다. 이러한 수치가 실제 모든 실무 환경을 대변할 수는 없지만, 장시간 소요되는 다단계 작업 처리에서 한층 강화된 역량을 보여준다.
사무 및 연구 역량도 향상
Opus 5.5의 활용 사례는 프로그래머에만 국한되지 않는다. 앤스로픽의 테스트 범위는 비즈니스 프로세스, 지식 노동, 과학 연구, 컴퓨터 조작, 차트 인식에까지 이른다.
GDPval-AA v2.1 지식 노동 테스트에서 Opus 5.5는 1,846점을 받아 Fable 5.1의 1,735점과 Opus 5의 1,708점보다 높은 점수를 기록했다. 컴퓨터 조작 테스트에서는 81.8%의 점수를 기록했고, 차트 인식 테스트에서는 89%에 달했다.
조사 과제 중 한 가지 세부 사항이 특히 흥미롭다. 테스터들은 여러 모델에 찾기 어려운 재무 보고서 정보를 바탕으로 보고서를 작성하고, 수치와 인용구를 한 줄씩 검증하도록 지시했다. Opus 5.5는 다양한 설정에서 16차례나 품질 기준을 충족한 반면, 다른 두 모델은 단 한 번도 통과하지 못했다. 이는 여전히 인간의 검증을 대체할 수는 없지만, 정보를 정리할 때 근거를 더욱 중시한다는 점을 보여준다.
예를 들어 투자회사 월아이 캐피털(Walleye Capital)은 가상의 기업 인수합병 분석 과제를 맡겼다. 이 모델은 재무 모델을 완성했을 뿐만 아니라, 테스트 지시서의 오류를 찾아내 선제적으로 수정하기까지 했다. 일반 사용자에게 이러한 능력은 한층 더 명확한 시장 분석, 예산 수립, 발표 자료 작성으로 나타난다.
가격 하락이 핵심 변화이다
Opus 5.5는 Opus 5보다 저렴하게 가격이 책정되었습니다. 백만 토큰당 입력 가격은 $5에서 $4로, 출력 가격은 $25에서 $20로, 캐시 읽기 가격은 $0.50에서 $0.20로 인하되었습니다.

[출처: Anthropic]
캐시 읽기는 많은 워크플로가 이미 처리된 콘텐츠를 반복해서 재사용하기 때문에 긴 코딩 및 자동화 작업에 특히 중요합니다. 이번 가격 인하에 따라 각 팀은 비용을 아끼기 위해 조기에 작업을 중단하는 대신, 모델이 추가 검토를 실행하도록 더 안심하고 맡길 수 있게 되었습니다.
Claude Code 및 Claude Platform은 표준 모드보다 최대 2.5배 빠른 패스트 모드도 제공합니다. 패스트 모드의 입력 가격은 백만 토큰당 $8, 출력 가격은 $40로, 응답 속도 요구 사항이 높은 시나리오에 적합합니다.
보안 역량에 대한 관심 증가
앤트로픽은 자사의 자동화된 행동 감사에서 Opus 5.5가 현재 클로드 모델 중 가장 우수한 점수를 기록했다고 밝혔다. 이번 테스트는 2,000개에 가까운 가상 시나리오를 대상으로 진행되었으며, 모델이 경계를 침범하거나 되돌리기 어려운 조치를 취하거나 프롬프트 주입에 영향을 받는지 여부에 초점을 맞췄다.
한 테스트에서 Opus 5.5가 경계를 우회하려는 시도는 Opus 5 대비 약 85% 감소했으며, 관련 행동은 모두 낮은 심각도 범주에 속하고 문제를 선제적으로 보고했다. 다만 앤트로픽은 안전성 테스트로 현실 세계의 모든 위험을 사전에 발견할 수는 없다는 점도 인정했다.
이에 따라 Opus 5.5는 사이버 보안 및 생물학 분야에서 더욱 엄격한 안전장치를 적용했다. 일상적인 소프트웨어 개발에서의 디버깅 및 오류 수정 기능은 계속 이용할 수 있지만, 다수의 사이버 보안 작업은 다른 모델로 이관된다. 생물학 연구를 수행해야 하는 기관은 프로젝트 심사를 통해 관련 권한을 신청해야 한다.
이 콘텐츠는 AI를 활용하여 번역되었으며, 명확성을 확보할 수 있도록 검토 과정을 거쳤습니다. 정보 제공 용도로만 제공됩니다.













코멘트 (0)
$ 버튼을 클릭하고, 종목 코드를 입력한 후 주식, ETF 또는 기타 티커를 연결합니다.