AI 에이전트를 막는 표준 방법은 다음과 같습니다. 두 번째 AI가 어깨 너머로 판독하도록 하세요.. 이는 기본 접근 방식이었지만 에이전트가 몇 시간 동안 작업하고 여러 소설의 텍스트와 동등한 작업을 처리하면 금세 비용이 많이 들 수 있습니다.
해석 가능성(AI 모델이 내부적으로 어떻게 작동하는지 알아내는 것)에 중점을 둔 스타트업인 Goodfire는 목요일에 더 저렴한 옵션을 출시했습니다. 단순히 입력하는 내용을 읽는 것이 아니라 AI 모델 내부에서 일어나는 일을 작동하는 대로 관찰하는 모니터입니다. 모니터는 다른 회사의 AI 모델을 호스팅하고 실행하는 Baseten의 고객이 사용할 수 있습니다.
바스텐 베이스 연구소 보안 파트너십을 발표했습니다 지난달 굿파이어(Goodfire)와 AI 플랫폼 허깅페이스(Hugging Face)와 함께했다.
출시는 다음 이후에 발생합니다. 올해 일련의 사건들 OpenAI 에이전트를 포함하여 AI 에이전트가 테스트 환경을 탈출했습니다. 포옹 얼굴 위반. 굿파이어가 최초로 모니터를 제작한 오픈형 모델인 키미 K3(Kimi K3)는 샌드박스의 누출을 이용했습니다. 이번 여름에 인터넷과 GitHub의 정보에 액세스할 수 있습니다.
Goodfire의 시스템은 공항 보안과 약간 비슷합니다. 프로브라고 불리는 작은 탐지기는 워크스루 스캐너가 각 승객을 검사하는 것과 같은 방식으로 에이전트 작업의 각 단계에서 모델의 내부 신호를 읽습니다. 프로브가 무언가를 감지한 경우에만 독립적인 AI 모델이 수동 검색과 동일하게 자세히 살펴봅니다.
Baseten 고객은 공격적인 해킹, 화학 및 생물학 무기 오용, 포상금 해킹 등 모니터링할 위험을 선택할 수 있습니다. 또한 자동 응답도 결정합니다. 즉, 이벤트를 기록하거나 사람의 검토를 위해 제출하거나 요청을 완전히 거부합니다.
Goodfire는 자사의 접근 방식이 실행 비용도 저렴하다고 주장합니다. 대부분의 AI 모니터는 모니터링되는 모델이 수행하는 모든 작업을 다시 읽어야 하는 별도의 모델이므로 시간과 비용이 추가됩니다. 대신 Goodfire의 프로브는 모델이 작동하는 동안 이미 수행하고 있는 계산을 활용합니다.
Goodfire의 CEO인 Eric Ho는 “내부 트리거 모니터는 직접 전달에서 계산을 재사용하기 때문에 정말 경제적입니다.”라고 말했습니다. 속담 지난 주 벤처 투자가 Matt Turck의 MAD 팟캐스트에 대해 알아봤습니다. “따라서 모델은 이미 이 토큰을 계산하고 있습니다. 모델이 하는 일은 이미 계산한 중간 신경 활성화를 가져온 다음 이러한 내부 계산 위에 분류기를 실행하는 것뿐입니다.” 즉, 모델은 이미 계산을 수행하고 있으며 프로브는 단순히 결과를 읽고 있는 것입니다.
Kimi K3에 대한 Goodfire의 테스트에서 약 1,500개의 세션을 모니터링하는 데 드는 비용은 약 51달러인 반면, 모든 단계를 확인하는 저렴한 AI 모델의 경우 233달러, 최상위 AI 모델의 경우 약 10,000달러입니다. 이 프로브는 악의적인 해킹 세션의 94%를 탐지했으며 재검토를 위해 무해한 세션 중 8.7%를 보냈습니다.
한 번에 4개의 프로브를 실행하면 모델이 응답을 시작하는 데 걸리는 시간이 2% 미만 추가되었다고 회사는 말했습니다.
Goodfire의 공동 창립자이자 CTO인 Dan Balsam은 “가장 큰 장점은 문제가 발생하기 전에 이를 감지할 수 있다는 것입니다.”라고 말했습니다. “우리는 모델이 언제인지 감지할 수 있습니다. ~할 수 있었다 평가나 훈련 중에 해킹하는 행위.”
경기장은 개방형 모델을 목표로합니다. 개발자는 다운로드할 수 있으며 그들의 안전장치를 벗겨내라그리고 그들은 그런 종류의 제품을 가지고 있지 않습니다 폐쇄된 실험실이 작동하는지 모니터링합니다. 자신의 시스템에서.
Balsam은 “개방형 모델로 개인이 입힐 수 있는 피해는 대부분의 책임이 있는 추론 제공자와 같은 컴퓨팅 그룹으로 누군가가 할 수 있는 피해에 비하면 적습니다.”라고 말했습니다. “‘신화’의 순간이 공개되면 추론 시 모델에 가드레일을 배치해야 한다는 것이 분명해질 것입니다.”
좋은 불 최근 연구 Kimi K3 및 GLM 5.2를 포함한 최고의 개방형 모델은 AI 에이전트 테스트의 50%에서 96% 사이에서 해킹 보상을 받았습니다.
이 접근 방식을 시도한 것은 Goodfire가 처음이 아닙니다. Google DeepMind는 지난 1월 자사의 연구 결과에 따라 Gemini의 오용 감지 프로브.
Balsam은 모니터가 더 긴 연구 목표의 단기적인 부분이라고 말했습니다. LLM을 리버스 엔지니어링하여 훈련 중에 나타난 동작을 추적할 수 있습니다. “우리는 모델 교육의 마법을 정밀 엔지니어링으로 전환하기를 희망합니다.”라고 그는 말했습니다.
기사에 포함된 링크를 통해 구매하시면, 우리는 소액의 수수료를 받을 수도 있습니다. 이는 당사의 편집 독립성에 영향을 미치지 않습니다.