AI/Claude

Claude Sonnet 5 출시 벤치마크 점수 및 성능은?

반응형

 

읽는데 5분 소요

Claude Sonnet 5 출시: 벤치마크 점수와 성능은?

Anthropic이 2026년 6월 30일 Claude Sonnet 5를 공개했습니다. 결론부터 말하면 Sonnet 5는 “Opus 4.8을 전부 이긴 모델”이 아니라, Sonnet 4.6의 에이전트·코딩 체급을 크게 끌어올려 Opus 4.8에 가까운 작업 품질을 더 낮은 가격으로 노리는 모델입니다.

Claude Sonnet 5 공식 발표 대표 이미지

▲ Claude Sonnet 5 공식 발표 대표 이미지. 출처

핵심만 먼저 보기

80.4%

Terminal-Bench 2.1에서 Sonnet 5는 80.4%를 기록했습니다. Sonnet 4.6의 67.0%보다 13.4%p 높고, Opus 4.8의 82.7%에 근접합니다.

81.2%

OSWorld-Verified는 81.2%입니다. 컴퓨터 사용 작업에서 Sonnet 4.6의 78.5%를 넘었고, Opus 4.8의 83.4%와 차이를 좁혔습니다.

$2/$10

2026년 8월 31일까지 입력 100만 토큰당 $2, 출력 100만 토큰당 $10의 출시 가격이 적용됩니다. 2026년 9월 1일부터는 $3/$15입니다.

내가 보는 포인트는 명확합니다. 긴 코드 수정, 브라우저 조작, 사내 자동화처럼 “여러 단계를 끝까지 밀고 가는 일”이라면 Sonnet 5가 가장 먼저 테스트할 후보입니다. 반대로 최고 난도의 추론, 민감한 보안 분석, 실패 비용이 큰 의사결정은 여전히 Opus 4.8이나 상위 모델을 비교해야 합니다.

점수를 볼 때는 3가지를 분리하면 이해가 쉽습니다. 첫째, 단일 정답을 맞히는 추론 점수입니다. 둘째, 터미널과 브라우저를 오가며 일을 끝내는 에이전트 점수입니다. 셋째, 실제 요청 하나를 처리하는 비용입니다. Sonnet 5의 강점은 이 3번째 축까지 포함할 때 더 잘 보입니다.

공식 벤치마크 점수

공식 표에서 Sonnet 5는 대부분의 항목에서 Sonnet 4.6을 확실히 앞섭니다. 특히 Terminal-Bench 2.1, Humanity’s Last Exam, GDPval-AA v2의 상승폭이 큽니다. 다만 SWE-bench Pro와 OSWorld-Verified에서는 Opus 4.8이 아직 앞서므로, “중간급 모델이 상위 모델을 완전히 대체했다”라고 읽으면 과장입니다.

Claude Sonnet 5 벤치마크 표

▲ Anthropic이 공개한 Sonnet 5, Sonnet 4.6, Opus 4.8 비교 벤치마크 표. 출처

평가 Sonnet 5 Sonnet 4.6 Opus 4.8 해석
SWE-bench Pro 63.2% 58.1% 69.2% 코딩은 개선됐지만 Opus와는 차이가 남아 있습니다.
Terminal-Bench 2.1 80.4% 67.0% 82.7% 터미널 기반 에이전트 작업에서 가장 인상적인 상승입니다.
Humanity’s Last Exam 43.2% / 57.4% 34.6% / 46.8% 49.8% / 57.9% 도구 사용 시 Opus 4.8과 거의 붙습니다.
OSWorld-Verified 81.2% 78.5% 83.4% 컴퓨터 사용은 Opus 근처까지 올라왔습니다.
GDPval-AA v2 1618 1395 1615 지식 업무 점수는 표 기준으로 Opus 4.8을 소폭 넘습니다.

숫자로만 보면 “몇 %p 올랐는가”가 먼저 보이지만, 실제 도입에서는 실패 유형이 더 중요합니다. SWE-bench 계열은 코드 수정의 정확도, Terminal-Bench는 셸과 도구를 다루는 지속성, OSWorld는 화면을 이해하고 조작하는 안정성을 봅니다. 그래서 개발팀은 평균 점수보다 실패한 케이스의 복구 가능성을 함께 기록하는 편이 좋습니다.

성능 해석: 에이전트 비용 곡선이 핵심

Sonnet 5의 진짜 메시지는 단일 점수보다 비용 대비 성능 곡선에 있습니다. Anthropic은 Sonnet 5가 BrowseComp와 OSWorld-Verified에서 낮은 effort부터 높은 effort까지 넓은 선택지를 제공한다고 설명합니다. 즉 같은 모델 안에서 빠르고 싼 응답, 긴 탐색, 고품질 자동화를 조절하는 구조입니다.

BrowseComp 비용 대비 성능 곡선

▲ BrowseComp에서 effort 수준별 비용 대비 성능을 보여주는 공식 그래프. 출처

OSWorld-Verified 비용 대비 성능 곡선

▲ OSWorld-Verified에서 Sonnet 5가 Sonnet 4.6보다 높은 비용 효율 구간을 만드는 모습. 출처

실사용 감각으로 바꾸면 이렇습니다. 짧은 질의응답은 lowmedium, 복잡한 리팩터링과 장시간 도구 호출은 highxhigh, 정말 어려운 분석은 max로 실험할 만합니다. 기본값은 high입니다.

그래서 Sonnet 5는 챗봇용 모델이라기보다 “실행 레이어”에 가깝습니다. 계획을 세우고, 도구를 고르고, 중간 결과를 점검하고, 오래 걸리는 작업을 끝까지 처리하는 쪽에서 존재감이 큽니다. Claude Code나 사내 브라우저 자동화, 고객지원 에이전트, 문서·스프레드시트 처리 같은 반복 업무가 먼저 떠오릅니다.

가격과 스펙

Claude Sonnet 5의 API 모델 ID는 claude-sonnet-5입니다. 공식 문서 기준으로 컨텍스트 창은 1M 토큰, 최대 출력은 128k 토큰입니다. 모든 현재 Claude 모델은 텍스트·이미지 입력과 텍스트 출력을 지원합니다.

항목 내용
출시일 2026년 6월 30일
출시 가격 2026년 8월 31일까지 입력 $2/MTok, 출력 $10/MTok
표준 가격 2026년 9월 1일부터 입력 $3/MTok, 출력 $15/MTok
Opus 4.8 가격 입력 $5/MTok, 출력 $25/MTok
컨텍스트 1M 토큰
최대 출력 128k 토큰

주의할 점도 있습니다. Sonnet 5는 새 토크나이저를 사용해 같은 입력이 Sonnet 4.6보다 대략 30% 더 많은 토큰으로 계산될 수 있습니다. 토큰 단가는 같아 보여도 실제 요청 비용은 프롬프트 구조에 따라 달라질 수 있으니, 기존 서비스에서 갈아탈 때는 반드시 실제 로그로 다시 재야 합니다.

개발자 체크포인트

마이그레이션 자체는 단순합니다. 모델 ID를 바꾸면 됩니다. 하지만 Sonnet 5에서는 adaptive thinking이 기본으로 켜지고, 수동 thinking budget과 비기본 sampling 파라미터가 제한됩니다. 기존 코드가 temperature, top_p, top_k를 조정하거나 budget_tokens를 직접 넣고 있었다면 그대로 옮기면 400 오류가 날 수 있습니다.

model = "claude-sonnet-4-6"  # 이전
model = "claude-sonnet-5"    # 이후
모델 ID 교체
토큰 수 재측정
sampling 제거
effort 명시
실제 업무 eval

내 추천은 바로 프로덕션 전환이 아니라, 3개 묶음으로 테스트하는 방식입니다. 첫째, 성공률이 중요한 코딩·브라우저 작업 20개를 고릅니다. 둘째, medium, high, xhigh를 같은 작업에 걸어 비용과 성공률을 비교합니다. 셋째, 실패가 실제 손실로 이어지는 작업은 Opus 4.8과 함께 A/B로 둡니다.

특히 사내 자동화에서는 “성공했다”라는 결과만 저장하면 부족합니다. 어떤 파일을 읽었는지, 어떤 도구를 호출했는지, 몇 번 되돌렸는지, 사람이 어디서 승인했는지까지 남겨야 합니다. Sonnet 5처럼 긴 작업을 더 잘 끝내는 모델일수록, 모델 선택보다 작업 경계와 승인 지점 설계가 더 큰 차이를 만듭니다.

안전성 평가는 어떻게 봐야 하나

공식 발표에 따르면 Sonnet 5는 Sonnet 4.6보다 바람직하지 않은 행동 비율이 낮아졌습니다. 다만 Opus 4.8과 Mythos Preview보다 모든 안전 지표에서 더 좋다는 뜻은 아닙니다. 보안 영역에서는 실시간 사이버세이프가드가 기본 적용되고, 위험한 요청은 오류가 아니라 정상 응답 안의 거절로 돌아올 수 있습니다.

Misaligned behavior 평가 그래프

▲ Sonnet 5는 Sonnet 4.6보다 낮은 misaligned behavior 점수를 보이지만 Opus 4.8보다는 높습니다. 출처

Firefox exploit development 평가 그래프

▲ Firefox 147 exploit development 평가에서 Sonnet 5는 working exploit 0.0%, partial success 13.2%로 표시됩니다. 출처

개인적으로는 이 부분이 중요하다고 봅니다. 성능이 올라간 모델일수록 자동화 범위가 넓어지므로, “무엇을 잘하나”만큼 “어디서 멈추나”가 제품 품질을 좌우합니다. 고객 데이터, 사내 권한, 배포 자동화와 연결한다면 모델 성능보다 권한 설계와 감사 로그가 먼저입니다.

그래서 누구에게 좋을까?

Sonnet 5는 다음 상황에서 특히 매력적입니다.

  • Claude Code로 긴 디버깅, 테스트 작성, 리팩터링을 자주 맡기는 개발팀
  • 브라우저나 사내 도구를 오가며 다단계 업무를 처리하는 에이전트
  • 1M 토큰 컨텍스트로 긴 문서, 로그, 레포지토리를 다뤄야 하는 분석 업무
  • Opus급 비용은 부담스럽지만 Sonnet 4.6보다 높은 완결성이 필요한 서비스

반대로 단순 요약, 분류, 짧은 답변처럼 낮은 지능 요구 작업만 있다면 굳이 최고 effort를 쓸 이유가 없습니다. Sonnet 5의 장점은 “항상 더 세다”가 아니라 “작업 난이도에 맞춰 비용과 품질을 조절하기 쉬워졌다”에 가깝습니다.

한 줄로 정리하면, Sonnet 5는 개발자에게 “기본 모델을 올려도 되는 순간”을 만든 업데이트입니다. 모든 문제를 최상위 모델로 보내지 않고, 일상 업무 대부분은 Sonnet 5에 맡기고, 정말 어려운 문제만 Opus나 Fable 계열로 승격하는 운영 전략이 자연스러워졌습니다. 비용표와 실패 로그를 함께 보기를 추천합니다. 작게 시작해도 충분합니다.

FAQ

Q1. Claude Sonnet 5는 언제 출시됐나요?+

Anthropic 공식 발표 기준 출시일은 2026년 6월 30일입니다. Claude Free와 Pro의 기본 모델이며 Max, Team, Enterprise, Claude Code, Claude Platform에서도 사용할 수 있습니다.

Q2. Sonnet 5가 Opus 4.8보다 좋은가요?+

일부 지식 업무 점수는 비슷하거나 소폭 앞서지만, SWE-bench Pro와 OSWorld-Verified 같은 주요 항목에서는 Opus 4.8이 아직 앞섭니다. Sonnet 5의 매력은 절대 1위보다 가격 대비 성능입니다.

Q3. API 모델 ID는 무엇인가요?+

공식 문서의 모델 ID는 claude-sonnet-5입니다. 기존 Sonnet 4.6 코드에서 모델 ID만 바꾸는 방식으로 시작할 수 있지만, token budget과 sampling 설정은 반드시 확인해야 합니다.

Q4. 가격은 얼마인가요?+

2026년 8월 31일까지는 입력 $2/MTok, 출력 $10/MTok입니다. 2026년 9월 1일부터 표준 가격은 입력 $3/MTok, 출력 $15/MTok입니다.

Q5. 기존 Sonnet 4.6에서 바로 갈아타도 되나요?+

가능은 하지만 바로 전체 전환하기보다 대표 업무로 eval을 먼저 돌리는 편이 좋습니다. 새 토크나이저로 토큰 수가 늘 수 있고, adaptive thinking 기본값 때문에 비용·지연 특성이 바뀔 수 있습니다.

출처

반응형

Categories