Anthropic, AI 탈옥 심각도 평가 프레임워크 초안 공개
AI

Anthropic, AI 탈옥 심각도 평가 프레임워크 초안 공개

Anthropic이 Fable 5의 사이버보안 안전 분류기 상세 내용과 함께, AI jailbreak 심각도를 평가하는 업계 공통 프레임워크 초안을 공개했습니다. Amazon, Microsoft, Google 등 Glasswing 파트너들과 협업해서 만들었습니다. 한마디로 말하면, AI 모델의 안전장치를 우회하는 jailbreak가 얼마나 심각한지를 일관된 기준으로 평가하는 표준이 필요하다는

· 3 min read