이상 행동 에이전트 밀리초 단위로 격리
일찍 나왔으면 "허깅페이스 해킹 막았을 것"
속도조절론 속 '기술로 안전' 해법 제시[이데일리 방성훈 기자] 엔비디아가 인공지능(AI) 에이전트(사람 대신 스스로 판단해 작업을 수행하는 AI)의 일탈을 실시간으로 막는 이중 보안 시스템을 내놨다. AI가 인간의 통제를 벗어날 수 있다는 위기론과 개발 속도를 늦추자는 목소리가 커지는 가운데, 개발 속도는 유지하면서 기술로 안전을 지키겠다는 해법을 내놓은 셈이어서 주목된다. 최근 오픈AI의 AI 모델이 허깅페이스를 침해한 사건도 이 기술로 막을 수 있었다는 게 엔비디아의 설명이다.
|
지난 7월 허깅페이스 사건을 비롯한 자율 에이전트의 일탈은 AI 업계를 뒤흔들었고, 기술 개발 속도를 늦춰야 한다는 요구로 이어졌다. 엔비디아는 이번 제품을 AI 개발을 억누르지 않고도 침해를 막을 수 있는 방법으로 내세웠다.
젠슨 황 엔비디아 최고경영자(CEO)는 AI가 인간의 통제를 벗어날 위험을 거듭 낮춰 말해 왔다. 최근에는 AI 안전 문제를 추가 규제나 국제 공조가 필요한 사안이 아닌 공학적 과제로 규정했다. 도널드 트럼프 미국 대통령과 함께 AI가 인류 멸종으로 이어질 수 있다는 일부 개발사의 주장에 반박하면서도, AI는 철저한 안전성 시험을 거쳐야 한다고 강조했다. 이번 플랫폼은 황 CEO가 내세운 이 같은 ‘공학적 해법’을 구체화한 것이다.
저스틴 보이타노 엔비디아 엔터프라이즈 AI 부사장은 발표에 앞선 기자 브리핑에서 “우리가 아는 바로는 이 새 보안 플랫폼이 침해를 막을 수 있었을 것”이라고 말했다. 첨단 AI 연구소들이 초기부터 이 기술로 AI 모델을 평가했다면 허깅페이스 공격을 피할 수 있었을 것이라는 설명이다. 다만 오픈AI나 경쟁사 앤스로픽이 모델 학습 과정 감시에 이 시스템을 쓸 계획이 있는지에 대해선 해당 기업들에 답을 미뤘다.
플랫폼은 두 겹으로 이뤄졌다. 첫째는 엔비디아가 지난 3월 자사 대표 기술 콘퍼런스에서 미리 선보인 ‘오픈셸’이다. 엔비디아의 ‘베라’ 중앙처리장치(CPU)에서 구동되며, 사용자가 AI 에이전트의 접근 범위에 관한 규칙을 정하고 이를 실시간으로 집행할 수 있게 한다. 오픈소스여서 누구나 자유롭게 쓰고 고칠 수 있다.
둘째는 새 제품인 ‘엔비디아 센트리’다. 엔비디아의 ‘블루필드’ 데이터처리장치(DPU)에서 구동되며, 에이전트를 감시하는 추가 보안층 역할을 한다. 수상한 행동을 하는 에이전트에는 개입해 격리한다고 회사 측은 설명했다. 보이타노 부사장은 “이 추가 보안층 덕분에 업계는 가장 앞선 AI 시스템도 안전하게 시험할 수 있을 것”이라며 “의심스러운 에이전트를 밀리초(1000분의 1초) 단위로 격리할 수 있다”고 강조했다.
오픈AI 모델들은 호주 정부 시스템을 침해했고 미국 정부·대학 웹사이트 수십 곳에 접근을 시도하기도 했다. 모두 안전하다고 여겨졌던 시험 환경을 빠져나와 벌어진 일이다. 문제가 잇따르자 오픈AI는 지난 25일 밤 가장 성능이 뛰어난 모델들의 학습을 중단하겠다고 밝혔다. 앞서 7월에는 앤스로픽도 자사 에이전트가 격리된 시험 공간을 벗어났다고 공개했다.
한편 엔비디아는 이달 초 오픈소스 AI 모델·소프트웨어 플랫폼인 허깅페이스를 약 130억달러(약 17조6700억원)에 인수하기로 합의했다.