AI 보안 장벽이 공격적인 사이버 보안 연구원의 작업을 방해하는 방법

몇 달 동안 거대 AI 기업들은 악의적인 해커가 자사 모델을 사용하는 것을 제한하기 위해 특별 심사 프로그램과 엄격한 장벽을 고안해 왔습니다. 그러나 이러한 제한은 이제 공격적인 사이버 보안 연구원뿐만 아니라 합법적인 네트워크 방어자의 작업을 방해하고 있습니다.

지난 6월 미국 정부는 수출 통제 제한 부과 Anthropic, Mythos 및 Fable의 과장된 AI 모델에 대해 설명합니다. 이러한 움직임은 사용자가 악의적인 사이버 공격을 생성하고 실행하는 데 보안 장벽을 사용하는 것을 방지하도록 설계된 모델의 보안 장벽을 우회하는 것이 가능하다고 주장하는 보고서에 의해 적어도 부분적으로 동기가 부여되었습니다.

사건이 실제로 동기가 있었는지 여부에 관계없이 누출에 대한 두려움사실은 Anthropo가 반복적으로 시장에 내놓았습니다 다음과 같은 신화 일종의 사이버 최후의 심판 기계 이는 신중하게 심사된 사용자에게만 제공될 수 있으며, 심지어 엄격한 보안 장벽이 적용되는 경우에도 마찬가지입니다. (Fable 5 및 Mythos 5에 대한 수출 통제는 이후 해제되었습니다. Fable 5는 7월 1일에 일반 액세스로 돌아왔습니다. Mythos 5는 정부 검토 프로세스의 일환으로 심사를 받은 미국 조직에만 다시 도입되었습니다.)

이러한 유형의 제어는 Mythos에만 국한되지 않습니다. 다른 모델과 함께 Anthropic과 OpenAI는 심사를 신청할 수 있는 사이버 보안 연구원 프로그램을 제공하고, 승인되면 사이버 보안 제한이 더 적은 모델에 액세스할 수 있습니다. OpenAI 사이버 신뢰할 수 있는 액세스 프로그램 그리고 인류학적 사이버 검증 프로그램.

이러한 보안 장벽은 특히 시스템에서 알려지지 않은 취약점을 찾아 범죄자보다 먼저 이를 악용하는 방법을 고안하는 연구자들에 의해 널리 비판을 받아 왔습니다.

최근 사이버 보안 팟캐스트에 출연한 유명한 보안 연구원인 Mark Dowd는 다음과 같이 말했습니다. 속담 “이렇게 크고 무작위적인 회사들이 무엇이 안전하고 무엇이 안전하지 않은지에 대해 독단적인 결정을 내리는 것이 정말 마음에 들지 않습니다.”

Dowd는 수십 년을 보냈습니다. “제로데이”를 찾아서 판매하세요 (이전에 알려지지 않은 소프트웨어 결함 및 이를 활용하는 악용)을 소프트웨어 제조업체에 보고하여 패치를 적용하는 대신 서구 정부에 전달합니다. 정부는 취약점이 공개되어 있기 때문에 취약점에 대해 프리미엄을 지불하며 이는 정보 작전에 유용합니다.

Dowd는 자신의 직업이 그를 편견으로 만들 수 있음을 인정했지만 그는 혼자가 아닙니다. 공격적인 사이버 보안(시스템의 약점을 사전에 조사) 분야에서 일하는 몇몇 사람들은 AI 도구를 사용하고 보안 장벽을 관리하는 방법을 TechCrunch에 설명했습니다.

거대 보안 컨설팅 NCC 그룹의 수석 과학자인 크리스 앤레이는 AI 모델에 버그 악용을 요청하는 것은 그것이 고칠 가치가 있는 실제 취약점인지 확인하는 핵심 단계라고 말했습니다. 그러나 가드레일이 모델에게 질문에 대한 직접적인 답변을 거부하도록 유도한다면 가드레일은 수비수들에게 상처를 입힌다고 그는 말했습니다.

Anley는 “전체 공격 대 방어 부분과 보안 장벽이 작용하는 곳입니다. 메시지로서의 ‘이 코드를 수정하세요’는 방어를 위한 필수 메커니즘일 뿐만 아니라 코드 기반에서 심각한 취약점을 찾기 위한 로드맵이기도 하기 때문입니다.”라고 말했습니다. “그래서 동시에 같은 도구는 공격 도구이기도 하고 방어 도구이기도 한데, 이 둘은 정말 버릴 수 없는 것입니다.”

그것은 “망치와 같다”고 그는 계속했다. “망치 없이는 집을 지을 수 없습니다. 망치는 분명 도구이지만, 환원할 수 없는 무기이기도 합니다.”

그와 그의 동료들은 이러한 장애물에 부딪힐 때 때로는 가드레일이 없는 오픈 소스 AI 모델로 눈을 돌리곤 합니다.

알려지지 않은 취약점을 개발, 획득, 정부 기관에 판매하는 것으로 유명한 회사인 Crowdfense의 최고 기술 책임자인 Paolo Stagno는 Dowd의 의견에 동의하며 AI 회사는 검증된 프로그램과 가드레일을 통해 “본질적으로 고객을 보살핌이 필요한 어린이처럼 대합니다”라고 말했습니다.

Stagno는 그와 그의 동료들이 프론티어 모델을 사용하지만 리버스 엔지니어링에만 사용한다고 말했습니다. 그는 AI를 사용하여 취약점을 찾거나 공격을 생성하는 것을 피한다고 말했습니다. 왜냐하면 해당 작업을 클라우드 기반 모델에 적용하면 민감한 취약점 데이터가 유출되거나 향후 교육 실행에 흡수될 위험이 있기 때문입니다. 그 단계에서는 모델 외부의 데이터 공유에 의존하지 않기 때문에 로컬에서 실행되는 오픈 소스 모델을 사용한다고 그는 말했습니다.

제로데이를 찾고 익스플로잇을 개발하는 보안 연구원인 Giuseppe Cali는 보안 장벽이 그의 작업을 방해하지 않는다고 말했습니다. 공격적인 작업에 AI를 사용하지 않기 때문입니다. 대신 이를 초기 리버스 엔지니어링에 사용하여 분석 중인 코드를 이해하고 지원 도구를 만듭니다. 이를 위해 AI 도구를 사용하면 프로세스 속도를 높이고 취약점 발견에 집중할 수 있다고 그는 말했습니다.

칼리는 “나는 여전히 오류 발견과 무기 사용에 대한 책임을 맡고 싶다”며 “내일 모든 장벽이 제거되더라도 그것은 변하지 않을 것”이라고 말했다. “나는 내 벌레가 부럽고 이 게임을 너무 좋아해서 모델들이 나를 대신해 플레이하게 할 수 없었습니다.”

언론과의 인터뷰 권한이 없기 때문에 익명을 요구한 한 스마트폰 부품 제조업체의 연구원은 자신의 고용주가 Anthropic의 CVP 프로그램에 참여하지 않으며 결과적으로 보안 장벽이 너무 엄격하기 때문에 Anthropic 도구가 취약점을 찾는 데 거의 유용하지 않다고 말했습니다.

“우리가 보안과 관련된 일을 하고 있다는 사실이 밝혀지면 그냥 멈추고 사용할 수 없게 됩니다.”라고 그 사람은 말했습니다.

사이버 보안 회사인 RemoteThreat의 CEO이자 공격적인 보안과 AI에 초점을 맞춘 이벤트인 Offensive AI Con의 창립자인 Chris Thompson은 최첨단 AI 모델에 대한 경험을 바탕으로 가드레일이 일관되지 않고 매일 다르게 작동할 수 있다고 말했습니다. 이는 조사된 Anthropic 및 OpenAI 프로그램의 더 넓은 범위 내에서도 마찬가지입니다.

톰슨은 “실질적인 영향은 핵심 보안 프로그램 작업보다 모델 협상에 많은 시간을 할애한다는 것”이라고 말했다. “취약점을 분석하고 악용 가능성을 통해 추론하는 대신 일관성 없는 결과를 얻는 이유 또는 모델이 결과를 과도하게 삭제하는 이유를 찾으려고 노력하고 있습니다.”

결과적으로 연구자들은 연구나 사용 제한 없이 로컬에서 실행할 수 있는 무료로 다운로드 가능한 모델인 GLM과 같은 오픈 소스 중국 모델에 의존하거나 사용하도록 강요받고 있다고 Thompson은 말했습니다.

그는 “미국 정부 시스템에서 외국 소유 시스템으로 이동하는 책임 있는 연구원들이 있습니다”라고 말했습니다. “내 생각에는 이런 가드레일을 설치하는 것이 좋은 것보다 더 해로운 것 같아요.”

제한을 더욱 강화하는 대신 Thompson은 첨단 AI 연구소에 프로그램을 공개하고 책임감 있는 액세스를 제공하며 도구를 남용하는 사람들에게 책임을 물을 것을 촉구했습니다. 그렇지 않으면 옹호자들은 AI 경쟁에서 패할 것이라고 그는 주장했다.

톰슨은 “거대한 폭풍이 다가오고 있다. 이전과는 비교할 수 없는 속도와 규모로 엄청난 공격의 물결이 일어날 것”이라고 말했다. “그러나 변화를 만들려고 노력하는 합법적인 보안 컨설팅 회사와 연구원들은 지금 당장 억압받고 있습니다.”

기사에 포함된 링크를 통해 구매하시면, 우리는 소액의 수수료를 받을 수도 있습니다. 이는 당사의 편집 독립성에 영향을 미치지 않습니다.