Claude Opus 5가 보여준 새 기준: 최고 성능보다 ‘비용당 완성도’
앤트로픽의 Claude Opus 5는 최고급 모델과의 성능 격차를 좁히면서 비용과 작업 효율을 낮추는 데 초점을 맞췄습니다. 벤치마크 수치와 실제 도입 판단에서 분리해 봐야 할 지점을 정리했습니다.
앤트로픽(Anthropic)이 7월 24일 공개한 Claude Opus 5는 “가장 큰 모델이 언제나 최선인가”라는 질문에 다른 답을 내놓았습니다. 회사가 공개한 자료를 기준으로 보면 Opus 5는 상위 모델인 Claude Fable 5의 최정상 성능에 근접하면서도 일부 작업의 비용을 절반 수준으로 낮추는 데 초점을 맞췄습니다. 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 이전 세대 Opus 4.8과 가격도 같습니다.
변화의 핵심은 성능이 아니라 효율 곡선이다
새 모델은 사용자가 추론 노력 수준을 조절할 수 있도록 설계됐습니다. 같은 모델 안에서도 더 깊게 생각하도록 설정하거나, 토큰과 응답 시간을 아끼는 쪽으로 조정할 수 있다는 뜻입니다. 앤트로픽은 Frontier-Bench와 CursorBench 같은 코딩 평가에서 Opus 5가 비용 대비 높은 성능을 냈고, 컴퓨터 사용 평가인 OSWorld 2.0에서도 Fable 5의 최고 결과를 더 낮은 비용으로 넘어섰다고 밝혔습니다.
다만 이 수치는 대부분 회사가 선택한 실행 환경과 평가 절차에서 나온 결과입니다. 특정 벤치마크의 선두가 모든 코드베이스, 언어, 업무 흐름에서 같은 우위를 보장하지는 않습니다. 기업이 확인해야 할 값은 순위표보다 자체 업무 한 건을 정확히 끝내는 데 든 총비용과 재작업 횟수입니다.
에이전트 업무에서 실제로 달라지는 점
Opus 5가 겨냥하는 영역은 한 번의 답변보다 여러 단계를 이어가는 작업입니다. 코드 원인 분석, 도구 호출, 결과 검증, 실패 뒤 수정처럼 중간 상태를 유지해야 하는 과제에서 작업을 끝까지 밀고 가는 능력을 강조합니다. API에는 대화 도중 사용할 도구를 바꾸면서도 프롬프트 캐시를 유지하는 기능과, 안전 분류기에 걸린 요청을 다른 모델로 넘기는 자동 대체 기능도 베타로 추가됐습니다.
개발팀 입장에서는 모델 교체만으로 자동화가 완성되지 않습니다. 도구 권한, 완료 조건, 재시도 한도, 사람이 승인해야 하는 단계가 함께 설계돼야 합니다. 모델이 스스로 검증하는 경향이 강해졌다는 설명도 외부 검증을 생략해도 된다는 뜻은 아닙니다.
안전성 설명에서 주의해 볼 부분
앤트로픽은 자동 행동 감사에서 Opus 5가 최근 자사 모델 가운데 낮은 오정렬 행동 점수를 기록했다고 설명했습니다. 동시에 취약점 발견 능력은 강화됐지만 실제 공격 코드 개발 능력은 보안 특화 모델 Mythos 5보다 낮았다고 밝혔습니다. 일반 서비스에서는 침투 테스트와 공격 코드 생성 등 일부 요청을 제한하고, 승인된 연구자는 사이버 검증 프로그램을 통해 별도 접근을 받을 수 있습니다.
이 구분은 중요합니다. 취약점을 찾는 능력과 그 취약점을 실제 공격으로 전환하는 능력은 같지 않습니다. 회사가 공개한 시스템 카드의 결과는 출시 전 위험 평가를 이해하는 근거지만, 운영 환경에서 발생할 모든 오용이나 예기치 않은 행동을 배제하는 보증서는 아닙니다.
도입 전에 확인할 네 가지
- 업무별 평가: 자사 코드와 문서로 성공률, 수정 횟수, 처리 시간을 측정합니다.
- 비용 상한: 추론 노력 수준별 토큰 사용량과 도구 호출 비용을 함께 기록합니다.
- 권한 경계: 읽기·쓰기·배포 권한을 분리하고 되돌리기 어려운 작업은 사람의 승인을 거칩니다.
- 대체 경로: 안전 분류나 장애로 모델이 바뀔 때 품질과 정책이 어떻게 달라지는지 시험합니다.
무엇을 의미하나
Opus 5의 의미는 단순히 또 하나의 최고급 모델이 나왔다는 데 있지 않습니다. 상위 모델의 절대 성능보다 중간 가격대 모델의 비용당 완성도가 빠르게 높아지면서, 기업이 한 종류의 가장 비싼 모델을 모든 작업에 쓰기보다 난이도에 따라 모델과 추론 수준을 배치할 여지가 커졌습니다. 실제 승자는 벤치마크 점수가 가장 높은 모델이 아니라, 필요한 정확도를 가장 예측 가능한 비용으로 제공하는 조합이 될 가능성이 큽니다.
1 프롬프트 캐시: 반복되는 대화 앞부분을 다시 처리하지 않도록 저장해 지연과 비용을 줄이는 방식입니다.
2 오정렬 행동: 사용자의 의도나 운영 규칙과 어긋나는 기만, 무단 행동, 위험한 지시 수행 등을 뜻합니다.
Anthropic — Introducing Claude Opus 5 · Anthropic — Claude Opus 5 System Card · TechCrunch — 주요 AI 기업의 모델·도구 경쟁 분석