Claude Code v2.1.269 — 플러그인도 이제 eval suite로 점수를 받습니다
claude plugin eval이 추가됐습니다. 플러그인을 Claude Code 상대로 실행해 점수화된 결과를 JSON과 HTML 리포트로 받는, 플러그인 생태계에 테스트 문화가 도입된 업데이트입니다.
한마디로 말하면, 플러그인 평가 도구, Bash 편집 diff 표시, 프롬프트 캐시 2연속 픽스, Workflow 동시 에이전트 256개 확장이 핵심인 릴리스입니다.
플러그인도 이제 테스트를 통과해야 한다
claude plugin eval은 플러그인의 eval suite를 Claude Code에 대해 실행하고 재현 가능한 점수 결과를 돌려줍니다. 결과는 JSON과 HTML 리포트로 제공되어 CI에 붙이기도 쉽습니다. 플러그인이 "동작은 한다"에서 "검증된 품질"로 가는 단계가 열린 것이고, claude plugin eval --help로 사용법을 확인할 수 있습니다. 플러그인 제작자에게는 배포 전 필수 관문이, 사용자에게는 플러그인 선택 기준이 될 겁니다.
Bash 편집도 diff로 보여주고, 캐시는 다시 살렸다
Bash tool이 파일 편집을 처리할 때 변경된 파일의 diff가 결과에 표시됩니다 (bashEditDiffEnabled 설정). Bash로 파일을 고칠 때도 뭘 바꿨는지 즉시 보이니 검토 속도가 빨라집니다. 캐시 쪽에서는 출력 토큰 한도로 응답이 잘리고 자동 재개된 다음 턴에 캐시가 부분 무효화되던 문제와, 사고 중단 후 세션을 재개할 때 이전 컨텍스트 전송 방식이 바뀌어 캐시 재사용이 나빠지던 문제 두 건이 픽스됐습니다. 이번 주 내내 이어진 캐시 안정화의 연장선입니다.
Workflow 동시 에이전트 최대 256개
CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(1~256)로 Workflow tool의 런당 동시 에이전트 수를 올릴 수 있습니다. 추론 병목 fan-out 작업에서 대규모 병렬 처리가 가능해진 것입니다. 터미널 쪽도 2.1.247에서 생긴 회귀를 정리했습니다 — kitty 프로토콜의 F1/F2/F4, st의 Delete, rxvt-unicode의 Alt 방향키, WezTerm의 Shift+특수문자까지 복원됐고, 리사이즈 시 전체화면 transcript 상하단이 비어 보이던 문제도 해결됐습니다.
실전에서 어떻게 쓸까?
플러그인 제작자라면 eval suite를 먼저 구성해 배포 전 점수를 확인하는 루틴을 만드세요. Workflow로 병렬 조사를 돌리는 팀은 환경변수 하나로 동시성을 256까지 올려 처리량을 확인할 수 있습니다. 그리고 원격·헤드리스 세션에서 백그라운드 에이전트가 도는 중 "waiting for your input"으로 잘못 표시되던 문제도 고쳐졌으니 (기존 동작은 CLAUDE_CODE_BG_TASKS_REPORT_RUNNING=0으로 복원), 원격 작업 사용자는 업데이트 사유가 충분합니다.
마무리로 — eval 도구화는 플러그인 생태계가 성숙기에 접어들었다는 신호입니다. 다음 단계는 아마도 플러그인 마켓플레이스에 점수 표시겠죠.
출처: https://github.com/anthropics/claude-code/releases/tag/v2.1.269
태그: AI Claude Claude Code 개발도구