Claude Sonnet 4.6, Sonnet 역대 최강 성능 발표
Anthropic이 Claude Sonnet 4.6을 공개했습니다. 코딩, 컴퓨터 사용, 장문 추론, 에이전트 기획 등 모든 영역에서 대폭 개선된 역대 최강의 Sonnet 모델입니다.
한마디로 요약하면
Opus급 성능을 Sonnet 가격에 제공합니다. 1M 토큰 컨텍스트 윈도우를 지원하고, 개발자들이 이전 모델보다 70% 더 선호하며, 심지어 작년 11월 최상위 모델이었던 Opus 4.5보다도 59% 더 선호받는 수준입니다.
핵심 변화
Opus에 근접한 성능, Sonnet 가격
가격은 기존 Sonnet 4.5와 동일한 백만 토큰당 $3/$15입니다. 하지만 성능은 Opus급에 근접했습니다. Claude Code 테스트에서 사용자는 Sonnet 4.6을 Opus 4.5보다 59% 더 선호했습니다. 과도한 엔지니어링과 "게으름"이 줄고, 지시 따르기와 멀티스텝 작업 수행 능력이 크게 향상되었습니다.
컴퓨터 사용 능력 대폭 향상
2024년 10월 Anthropic이 최초로 범용 컴퓨터 사용 모델을 도입했을 때만 해도 "실험적이고 번거로우며 오류가 많다"고 했습니다. OSWorld 벤치마크에서 16개월간 꾸준히 향상되어 이제는 복잡한 스프레드시트 탐색이나 멀티스텝 웹 폼 작성에서 인간 수준의 능력을 보여줍니다.
1M 토큰 컨텍스트 윈도우
베타로 100만 토큰 컨텍스트 윈도우를 지원합니다. 전체 코드베이스, 긴 계약서, 수십 편의 연구 논문을 한 번에 담을 수 있고, 그 모든 컨텍스트를 효과적으로 추론합니다.
실용 활용
코딩 작업
대규모 코드베이스 검색이 중요한 복잡한 버그 수정에 강점을 발휘합니다. 프론트엔드 코드에서는 레이아웃, 애니메이션, 디자인 감각이 이전 모델보다 훨씬 세련됩니다. iOS 코드 생성에서도 "최고 결과"라는 평가를 받았습니다.
장기 계획 수립
Vending-Bench Arena 평가에서 흥미로운 전략을 보여줬습니다. 처음 10개월간 대규모 투자를 진행하다가 마지막 단계에서 수익성에 집중하는 전략으로 경쟁사를 압도했습니다.
문서 이해
OfficeQA 벤치마크에서 Opus 4.6과 동등한 성능을 보여줍니다. 기업 문서의 차트, PDF, 표를 읽고 적절한 팩트를 추출해 추론하는 작업에 적합합니다.
마무리
성능 대비 가격 비율이 정말 인상적입니다. 무료 플랜에서도 기본 모델로 제공되니, 한번 써볼 만합니다. Opus를 자주 쓰는 사용자라면 Sonnet 4.6으로 전환해 비용을 줄여볼 수 있겠습니다.
태그: AI, Claude, Anthropic