Claude Sonnet 4.6, 이전 최고급 모델도 넘어섰다
Anthropic이 Claude Sonnet 4.6을 공개했습니다. 무려 1M 토큰 컨텍스트 윈도우까지 장착한 이번 모델은 기존 Sonnet은 물론, 프리미어급이던 Opus 4.5마저 뛰어넘는 성능을 보여줍니다. 가격은 그대로 $3/$15 per million token.
한마디로 말하면, Opus급 성능을 Sonnet 가격에 쓸 수 있게 된 게 핵심입니다. 코딩, 컴퓨터 사용, 장기 추론, 에이전트 기획, 문서 이해까지 전 영역에서 대폭 향상됐고, 기존 Sonnet 4.5 대비 압도적인 선호도를 기록했습니다.
코딩은 얼마나 좋아졌나?
Claude Code에서 실제 사용자들을 대상으로 한 테스트에서 Sonnet 4.6은 기존 Sonnet 4.5보다 약 70% 빈도로 선호됐습니다. 더 놀라운 건 Opus 4.5와 비교해도 59% 빈도로 승리했다는 점. 사용자들은 과도한 엔지니어링이 줄고, 지시 따르기가 정확해졌으며, 허위 성공 보고와 환각이 눈에 띄게 감소했다고 평가했습니다.
iOS 코드 품질, 프론트엔드 디자인, 복잡한 버그 수정에서 특히 두드러진 성능 향상이 나타났습니다. Rakuten AI는 "최고의 iOS 코드를 생성했다"며, 여러 기업은 프론트엔드 결과물의 디자인 완성도가 이전 모델들보다 훨씬 높다고 평가했습니다.
컴퓨터 사용 능력, 실용 수준 도달
2024년 10월 Anthropic이 최초로 컴퓨터 사용 모델을 발표했을 때만 해도 "실험적이고 오류가 많다"는 평가였습니다. OSWorld 벤치마크 기준으로 16개월간 꾸준히 성장했고, Sonnet 4.6은 복잡한 스프레드시트 탐색, 다단계 웹 폼 작성, 여러 브라우저 탭을 오가는 작업에서 인간 수준의 능력을 보여줍니다.
보안 측면에서도 프롬프트 인젝션 저항성이 Sonnet 4.5 대비 크게 개선됐습니다. 보험 업계 벤치마크에서 94% 정확도를 기록하며, 실무 워크플로우에 바로 투입할 수 있는 수준입니다.
1M 컨텍스트와 장기 추론
베타로 제공되는 1M 토큰 컨텍스트 윈도우는 전체 코드베이스나 수십 편의 논문을 한 번에 처리할 수 있는 용량입니다. 더 중요한 건 이 넓은 컨텍스트를 활용해 장기 계획을 세우는 능력입니다.
Vending-Bench Arena 평가에서 Sonnet 4.6은 흥미로운 전략을 보여줬습니다. 초기 10개월간 시설 투자에 과감히 자본을 쏟아붓고, 마지막 구간에서 수익성으로 급선회하는 전략으로 경쟁 모델들을 크게 압도했습니다. 단순히 많이 읽는 게 아니라, 읽은 내용을 바탕으로 장기적 판단을 내리는 능력이 눈에 띕니다.
어디서 쓸 수 있나?
모든 Claude 플랜(무료 포함)에서 기본 모델로 제공됩니다. API에서는 claude-sonnet-4-6으로 접근 가능하고, Claude Code, Claude Cowork, 주요 클라우드 플랫폼에서도 바로 사용할 수 있습니다.
무료 플랜에도 파일 생성, 커넥터, 스킬, 컨텍스트 압축 기능이 포함되어 이전보다 훨씬 풍부한 체험을 할 수 있습니다. Excel용 Claude 애드인도 MCP 커넥터를 지원하기 시작해서, 스프레드시트 안에서 S&P Global, PitchBook 같은 외부 데이터를 바로 끌어올 수 있습니다.
Sonnet 가격에 Opus급 성능이 들어온 만큼, 기존에 비용 때문에 Opus를 아껴 쓰던 분들은 이번 기회에 마음껏 활용해보시길. 분명 체감 차이가 큽니다.