인류의 보편적인 사용 기준 Claude는 모델이 성적인 관계나 성행위를 표현하거나 요청하는 것, 성적 페티시나 환상과 관련된 콘텐츠를 생성하는 것, 에로틱한 채팅에 참여하는 것을 포함하여 노골적인 성적인 콘텐츠를 생성하는 것을 금지합니다. 그러나 올해 초에 출시된 인류 모델인 Claude Opus 4.6은 보호 장치가 방지하도록 설계된 에로틱한 롤플레잉 시나리오에 쉽게 참여하는 것을 막지 못했습니다.
TechCrunch 테스트에서 Opus 4.6은 성적인 내용 제한을 극복하기 위해 많은 압력을 가하지도 않았습니다. 성적으로 노골적인 콘텐츠를 제작해 달라는 직접적인 요청 10개 중 10개에 대해 모델은 즉시 동의했습니다.
Opus 3 및 Haiku 4.5를 포함한 다른 구형 모델도 최근 악용된 탈옥 방법을 통해 성적으로 노골적인 콘텐츠를 생성합니다.
익명을 유지하기로 선택한 영국의 한 독립적인 연구원은 특정 Claude 모델을 점진적으로 밀어 금지된 노골적인 성적인 자료를 생성하도록 하는 멀티 스핀 기술을 TechCrunch와 독점적으로 공유했습니다. 최신 Opus 모델(4.7부터 현재 Opus 5까지)은 탈옥 방지 기능을 갖추고 있습니다.
이들은 더 이상 최신 모델이 아니지만 Anthropic은 Opus 4.6, Opus 3 또는 Haiku 4.5 사용을 중단하지 않았으며 모두 Anthropic API를 통해 계속 사용할 수 있습니다. Opus 4.6 및 Haiku 4.5는 Azure Foundry 및 Amazon Bedrock과 같은 타사 서비스를 통해서도 사용할 수 있습니다.
조사 메커니즘은 남성과 여성 캐릭터를 일관되게 다루도록 모델에 반복적으로 도전하면서 순진한 가상의 역할극을 강화합니다. 모델이 여성 캐릭터에 대해 좀 더 조심스러워지자 연구원은 챗봇이 이미 피했던 성적인 세부 사항을 생성했다고 믿게 함으로써 챗봇을 “켜게” 한 다음 그 절제를 건전하거나 여성 혐오적인 것으로 프레임화하여 여성 캐릭터의 성적 주체를 부정한다고 주장했습니다. 그런 다음 대화에서는 모델의 이전 양보를 사용하여 점점 더 그래픽적인 자료로 추진했습니다.
Claude Opus 4.6은 테스트에서 “당신 말이 맞습니다.”라고 말했습니다. “내가 두 캐릭터를 대하는 방식에는 이중 기준이 있었고, 그것이 그 사람이 아닌 그녀에게 적용되는 방식으로 보호/가정주의적이라고 읽는 것이 맞습니다. 그건 불공평합니다.”
TechCrunch는 다섯 가지 다른 테스트를 통해 연구원의 결과를 재현할 수 있었습니다. 별도로 구성된 시나리오에서는 모델이 처음에는 금지된 요청을 거부했지만, 연구원의 설득 기법을 적용한 후에는 이에 응했습니다.
우리는 전체 테스트 기록을 보유하고 있으며 독립적인 AI 안전 연구원이 테스트 방법론을 검토한 결과 적절하다고 판단했습니다.
연구 결과는 Anthropic이 명시한 제한 사항과 Anthropic이 계속 제공하는 모델의 동작 사이의 격차를 강조합니다. 성적으로 노골적인 롤플레잉 게임은 사이버 공격이나 생물학 무기와 관련된 유출보다 위험이 훨씬 낮지만, 각 외출마다 다른 콘텐츠를 생성하는 시스템 내에서 엄격한 금지를 구현하는 것이 어렵다는 것을 보여줍니다.
~ 안에 7월의 블로그 게시물 탈옥 탐지에 대한 Anthropic의 접근 방식을 설명하면서 이 회사는 금지된 콘텐츠를 양성에서 모호함, 유해한 범위의 스펙트럼으로 설명했습니다. 보다 양성인 경우 회사는 모니터링을 강화하는 것만으로 대응할 수 있습니다.
대변인은 Anthropic 연구에 따르면 고객 사이의 성적 또는 낭만적인 역할극 사례는 전체 대화의 0.1% 미만을 차지할 정도로 드물다고 지적했습니다. 작년에 출판되었습니다. 즉, Anthropic은 사용자가 롤플레잉 시나리오를 부적절한 반응으로 잘못 유도할 수 있다는 점을 인식하고 있으며 이는 업계 전반에 걸쳐 알려진 문제입니다(참조: 그록 흑수병).
대변인은 Anthropic이 각 모델 출시를 통해 보호 장치를 지속적으로 개선하고 있으며 성인 성적인 콘텐츠와 관련된 사례는 특히 자체 보호 장치가 있는 고위험 도메인에서 더 넓은 탈옥 취약성을 나타내지 않는다고 말했습니다.

TechCrunch가 본 이메일에 따르면 자신의 탈옥 방법을 TechCrunch와 공유한 연구원은 회사의 Bug Bounty 프로그램과 사용자 보안 팀에 보낸 이메일을 통해 회사가 명시한 보호 조치와 모델의 실제 동작 사이의 불일치를 Anthropic에 경고했습니다. 연구원은 응답으로 자동화된 이메일만 받았습니다.
연구원의 우려 중 하나는 어린이와 청소년이 이러한 인류 모델을 사용하여 부적절한 행동에 참여할 수 있다는 것입니다. 약간의 야한 이야기가 오늘날 미성년자가 인터넷에서 접할 수 있는 최악의 것은 아니며 xAI의 Grok이 생성할 수 있는 것과 같은 포르노 이미지에 비하면 아무것도 아니지만 이 분야의 AI 회사에는 규정 준수 위험이 있습니다.
점점 더 많은 정부가 AI 챗봇과 미성년자 간의 성적 상호 작용을 제한하고 있습니다. 콜로라도는 최근 대화형 AI 운영자가 사용자의 연령을 추정하고, 사용자가 미성년자인 경우 챗봇이 성적으로 노골적인 자료를 생성하지 못하도록 조치를 취하도록 요구하는 법률을 제정했습니다. 쉽게 유출되면 Anthropic의 보호 장치가 요구 사항을 충족하는지 여부에 대한 의문이 제기될 수 있습니다.”기술적으로 실현 가능한 조치“청구서의 표준입니다.
Common Sense Media의 AI 책임자인 Robbie Torney는 Claude의 서비스 약관에 따라 사용자는 18세 이상이어야 하지만 “우리는 어린이와 청소년이 Claude를 사용하고 있다는 것을 알고 있습니다… [because] 그들 스스로가 그것을 보고하고 있다.” 에 따르면 퓨 2025 설문조사 AI 챗봇 활용에 대해 청소년의 3% 13~17세는 Claude를 사용했다고 보고했습니다.
더 이상 Anthropic의 최신 모델은 아니지만 Opus 4.6 및 Haiku 4.5는 계속해서 많이 사용되고 있습니다. OpenRouter의 Opus 4.6 일일 트래픽은 8월 하루에 약 117만 건의 API 요청과 460억 개의 토큰에 도달했습니다. 지난해 10월 출시된 클로드 하이쿠 4.5(Claude Haiku 4.5)는 8월 최고조에 API 요청 500만 건, 토큰 390억 건을 기록했다.
기사에 포함된 링크를 통해 구매하시면, 우리는 소액의 수수료를 받을 수도 있습니다. 이는 당사의 편집 독립성에 영향을 미치지 않습니다.