Anthropic, 생물학 안전 필터 대폭 완화… 오탐 85% 감소
AI

Anthropic, 생물학 안전 필터 대폭 완화… 오탐 85% 감소

zaq · · 3 min read

Anthropic이 Claude Fable 5의 생물학 안전 필터를 대폭 개선했습니다. 건강, 의학, 생물학 관련 질문이 더 이상 불필요하게 차단되지 않습니다.

한마디로 요약하면

Fable 5 출시 당시 생물학 분야의 잠재적 위험을 이유로 거의 모든 생물학 질문을 차단했는데, 이번 업데이트로 오탐(false positive)이 약 85% 감소했습니다. 일반적인 건강 질문이나 의학 교육 관련 쿼리가 더 이상 덜 똑똑한 모델로 전환(fallback)되지 않습니다.

왜 처음에 필터가这么 엄격했나

Fable 5는 일부 생물학 작업에서 전문가를 능가할 정도로 강력합니다. 약물 개발 연구자에게는 엄청난 도움이 되지만, 악의적인 사용자手里에 들어가면 생물학 무기 개발에 악용될 수 있습니다. 더 큰 문제는 유용한 연구와 위험한 연구를 구분하기 어렵다는 거예요. 예를 들어 백신을 만들려면 병원체 자체를 키워야 하고, 고혈압 치료제 개발에 독사 뱀독의 독성 성분을 분리해야 합니다.

이런 "이중 용도(dual-use)" 문제 때문에 Anthropic은 출시 초기에 아예 생물학 쿼리 전체를 막아버리는 전략을 택했습니다. 안전하긴 하지만, 합법적인 연구자와 일반 사용자가 답답함을 겪어야 했죠.

핵심 변화 — 분류기 헌법 재작성

이번 개선의 핵심은 안전 분류기(classifier)의 "헌법(constitution)"을 정교하게 다시 쓴 것입니다. 분류기가 어떤 요청을 차단할지 결정하는 규칙 집합을 내외부 전문가 피드백을 바탕으로 세밀하게 조정했어요.

결과적으로 명백히 안전한 생물학 질문 — 검사 결과 해석, 증상 이해, 생물학 학습 등 — 이 더 이상 차단되지 않습니다. 다만 바이러스학, 독성학, 분자 설계 같은 여전히 위험한 분야는 Opus 5 모델로 fallback됩니다.

플랫폼별 감소 효과

이번 업데이트로 전체 fallback이 얼마나 줄었는지 보면:

  • Claude.ai: 약 67% 감소
  • Cowork: 약 55% 감소
  • Claude Code: 약 17% 감소
  • Claude Platform: 약 7% 감소

특히 Claude.ai 사용자에게 체감 효과가 큽니다. 일상적인 건강 질문을 할 때 더 이상 "죄송합니다, 도움드릴 수 없습니다"를 만날 확률이 크게 줄었습니다.

마무리

안전성과 접근성 사이의 균형을 찾는 건 정말 어려운 일입니다. Anthropic이 "일단 막고, 점진적으로 푼다"는 전략을 취한 건 보수적이지만 합리적인 선택이었어요. 앞으로 신뢰 기반 접근 경로(trusted access pathway)를 통해 정식 연구자들에게도 생물학 기능을 열어주겠다는 계획이니, 더 기대해도 좋을 것 같습니다.

출처: https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards