Claude Sonnet 5, 가장 에이전트다운 Sonnet 모델
AI

Claude Sonnet 5, 가장 에이전트다운 Sonnet 모델

zaq · · 3 min read

Anthropic이 Claude Sonnet 5를 전면 출시했습니다. Opus 4.8에 근접하는 성능을 Sonnet 가격대에 제공하며, 코딩·도구 사용·자율 작업에서 Sonnet 4.6을 크게 웃돕니다.

한마디로 말하면, 몇 달 전만 해도 Opus급 모델이 필요했던 복잡한 에이전트 작업을 이제 Sonnet 가격으로 처리할 수 있게 됐습니다. 무료 사용자부터 엔터프라이즈까지 모든 플랜에서 사용 가능합니다.

성능은 어느 정도인가

Sonnet 5는 추론, 도구 사용, 코딩, 지식 작업 전반에서 Sonnet 4.6을 substantial하게 능가합니다. BrowseComp(에이전트 검색 평가)와 OSWorld-Verified(컴퓨터 사용 평가) 기준으로 Sonnet 4.6을 strict improvement하며, 중간 effort 수준에서 Opus 4.8과 비슷한 비용 효율을 보여줍니다. effort 레벨을 높이면 일부 작업에서 Opus 4.8과 동등한 성능까지 도달합니다.

조기 테스트 사용자들의 반응이 일관됩니다. "이전 Sonnet에서는 중간에 멈추던 복잡한 작업을 끝까지 완수한다", "명시적으로 요청하지 않아도 자체적으로 출력을 검사한다"는 피드백이 주를 이룹니다. Salesforce 업데이트 + 공지 발송 같은 2단계 작업을 처음부터 끝까지 처리한 사례도 나왔어요.

가격과 접근성

8월 31일까지 프로모션 가격인 입력 $2/Mtok, 출력 $10/Mtok로 제공됩니다. 이후 정가는 입력 $3/Mtok, 출력 $15/Mtok입니다. 무료 플랜과 Pro 플랜의 기본 모델이며, Claude Code와 Claude Platform에서도 바로 사용할 수 있습니다.

안전성 개선

안전 평가에서 Sonnet 5는 Sonnet 4.6 대비 전반적으로 낮은 수준의 바람직하지 않은 행동을 보였습니다. 에이전트 컨텍스트에서 더 안전하게 사용할 수 있고, 사이버보안 역량은 현재 Opus 모델보다 훨씬 낮게 측정됐습니다. 즉, 강력하면서도 안전한 밸런스가 핵심입니다.

실제로 언제 유용한가

멀티스텝 코딩, 디버깅, 도구 연동이 필요한 자동화 작업에서 Sonnet 5가 빛을 발합니다. 예를 들어 버그 조사를 맡기면, 재현 테스트를 작성하고 수정사항을 구현한 뒤 필요시 stash하는 식으로 자율적으로 동작합니다. 이전에는 중간에 멈추거나 추가 프롬프트가 필요했던 작업이 한 번에 끝납니다.

Opus 4.8과의 effort 조절 조합으로 비용과 성능 사이에서 유연한 선택이 가능합니다. 일상적인 자동화에는 medium effort, 중요한 작업에는 high effort로 전환하는 식으로 활용할 수 있습니다.

출처: https://www.anthropic.com/news/claude-sonnet-5