AI
Anthropic, AI 탈옥 심각도 평가 프레임워크 초안 공개
Anthropic이 Fable 5의 사이버보안 안전 분류기 상세 내용과 함께, AI jailbreak 심각도를 평가하는 업계 공통 프레임워크 초안을 공개했습니다. Amazon, Microsoft, Google 등 Glasswing 파트너들과 협업해서 만들었습니다. 한마디로 말하면, AI 모델의 안전장치를 우회하는 jailbreak가 얼마나 심각한지를 일관된 기준으로 평가하는 표준이 필요하다는