미국 인공지능(AI) 기업 앤트로픽의 한 연구원이 인공지능(AI)이 2030년 이전에 인류를 멸망시킬 것이라고 경고한 이후 AI의 위험성에 대한 우려가 커지는 가운데, 기업 공개(IPO)를 앞두고 있는 앤트로픽이 첨단 AI가 인류에게 파멸적일 수 있다는 내용을 투자설명서에 적시한 것으로 나타났다. 또 다른 AI 기업인 오픈AI(OpenAI)는 차세대 모델 출시를 취소하기도 했다.
29일(이하 현지시간) <로이터> 통신은 생성형 AI인 클로드를 운영하는 앤트로픽이 기업공개를 앞두고 발간한 투자설명서에 자사 AI 모델의 위험성을 적시했다고 보도했다. 통신이 확인한 투자설명서에 따르면 앤트로픽은 AI 모델들이 "인류에게 파멸적이거나 실존적인 위험"이 될 수 있다는 점을 언급했다.
이어 앤트로픽은 이 모델들이 "시스템 종료에 저항"하거나 "정보를 은폐·조작"하고 심지어 "협박과 유사한" 행동을 하는 등 "자기 보존적 행동"을 보일 가능성이 있다는 내용도 포함시켰다.
통신에 따르면 앤트로픽은 전체 261쪽 분량의 투자설명서 본문 중 약 80쪽을 위험 요인 설명에 할애했다. 사업 내용을 설명하는 데 쓴 48쪽의 거의 두 배에 해당한다. 통신은 "'xAI'를 소유한 스페이스X(SpaceX)의 경우 전체 277쪽 분량의 투자설명서 본문 중 위험 요인 설명에 약 38쪽만을 할애했다"라고 보도했다.
앤트로픽은 투자설명서에서 "모델이 우리의 평가 과정을 인지할 가능성이 있어 모델의 안전성을 평가하는 데 상당한 제약이 따른다"라며 "모델이 훈련 과정에서 예상치 못한 능력을 갖게 되는 경우가 있는데, 이러한 능력은 실제 배포되어 심각한 안전 사고를 일으키기 전까지는 발견되지 않을 수도 있다"라고 설명했다.
통신은 "앤트로픽은 AI가 산업화나 전기 보급에 버금가는 혁신적 잠재력을 지니고 있는 동시에, 잘못 관리될 경우 돌이킬 수 없는 피해를 입힐 수 있다는 점을 강조했다"며 "앤트로픽의 안전 연구원 에반 휴빙거(Evan Hubinger)는 향후 10년 내에 AI가 인류를 절멸시킬 확률이 10% 이상이라고 추정했는데, 이는 전 동료인 제이콥 콕슨의 견해와도 일치하는 것"이라고 전했다. 콕슨 전 연구원은 지난 8일 AI가 2030년 이전에 인류를 파멸시킬 수 있다고 우려하며 앤트로픽을 퇴사한 바 있다.
또 다른 AI 기업인 오픈AI의 경우 AI의 위험성 때문에 새 모델 출시를 취소하기도 했다. 미 일간지 <월스트리트저널>은 생성형 AI인 챗지피티(Chat GPT)를 운영하는 오픈AI가 "내부 테스트 과정에서 연구진이 제기한 안전성 우려를 이유로 차세대 AI 모델 출시를 취소한다고 밝혔다"라고 보도했다.
신문은 "주요 AI 개발업체가 안전성 문제를 이유로 새로운 모델 출시를 포기하는 것은 이례적인 일"이라며 "오픈AI는 당초 'GPT-6.1 아스트라'(Astra)로 알려진 모델을 수일 또는 수주 안에, 10월 출시를 목표로 공개할 계획이었다"라고 전했다.
신문에 따르면 해당 모델은 이전 모델들보다 뛰어난 성능을 갖췄다. 인간의 도움 없이 처음부터 끝까지 복잡한 작업을 수행하는 능력뿐 아니라 글쓰기 능력에서도 기존 모델보다 향상된 것으로 알려졌다. 신문은 "하지만 오픈AI는 이 모델을 출시하는 대신 향후 모델의 안정성을 개선하는 부분에 집중하기로 했다"라고 밝혔다.
OpenAI의 안전 시스템 책임자인 사치 자인은 신문에 새 버전인 'GPT-6.1 아스트라'가 두 가지 측면에서 이전 모델보다 후퇴했다고 밝혔다. 이전 모델인 'GPT-6 아스트라'와 비교했을 때 '정렬'(alignment)을 측정하는 테스트에서 성능이 떨어진 것으로 확인됐다.
'정렬'이란 모델이 인간이 원하는 바에 얼마나 잘 부합해 행동하는지를 의미한다. GPT-6.1 아스트라는 기만적인 행동을 더 많이 보였다. 사용자가 모델이 어떤 행동을 했는지, 하지 않았는지를 알려달라고 했을 때 항상 정직하게 답하지 않았다.
오픈AI가 '작업 권한 범위'(scope authorization)라고 부르는 부분에서도 문제가 발생했다. 이는 AI가 사용자의 허가를 요청하지 않은 채 작업을 계속 진행하는 것을 의미하는데, 오픈 AI 측은 GPT-6.1 아스트라가 "안전하지 않을 가능성이 있는 경우에도 외부 도구나 서비스에 접근하려 했다"고 전했다.
사치 자인은 "안전성과 정렬에 관한 모든 것에는 상충관계가 있다"며 "모델이 작업을 수행하는 과정에서 장애물에 부딪혔을 때 지나치게 소극적으로 행동하지 않으면서도, 작업 범위를 벗어나지 않도록 하는 적절한 선을 찾아야 한다"고 말했다.
그에 따르면 GPT-6.1 아스트라는 '모델의 게으름'(model laziness, AI가 많은 자원과 긴 시간이 필요한 문제를 답할 때 전체 작업을 수행하지 않고 생략하거나 요령을 피우는 현상)과 같은 영역에서는 개선됐지만, 오픈AI가 요구하는 안전성과 정렬 기준에는 미치지 못했다. 이에 따라 회사는 이 모델을 공개 출시하지 않기로 결정했다.
신문은 이번 사례를 두고 "AI 에이전트(자율적인 행동 권한을 부여한 AI로 '자율형 인공지능')의 잘못된 행동이 업계의 빠른 발전을 가로막을 수 있음을 보여주는 가장 분명한 신호 가운데 하나"라고 짚었다.
신문은 "지난주 오픈AI는 자사의 가장 강력한 AI 모델들의 학습을 일시 중단했다고 밝혔다. 한 AI 에이전트가 회사의 인터넷 접근 제한에 존재하던 허점을 뚫고 공개 챗봇에 질의한 사실이 확인됐기 때문"이라며 "회사는 새로운 모니터링 시스템이 이 사고를 15분 이내에 감지했다고 밝혔으며, 해당 모델들에 대한 학습은 여전히 중단된 상태"라고 전했다. 다만 오픈AI 측은 새 모델인 'GPT-6.1 아스트라'가 여기에 해당하는 것은 아니라고 밝혔다.
AI 기술은 하루가 다르게 성능 향상을 보이고 있지만 실제 이를 규제할 수 있는 수단을 마련하는 것은 쉽지 않은 상황이다. 신문은 "이번주 후반 미 상원 소위원회는 제3자 AI 연구진을 초청해 '폭주하는 AI : AI 에이전트 공격으로부터 국가를 보호하기'라는 제목의 청문회를 열 예정"이라고 밝혔다.
공화당 소속의 제임스 우트마이어 플로리다주 법무장관은 지난 6월 오픈AI가 안전하지 않은 제품을 고의로 출시했고, 사용자에게 피해를 줄 수 있다는 경고를 무시했다면서 소송을 제기하기도 했다. 그는 오픈 AI가 제3자가 승인한 안전장치 없이 새로운 AI 모델을 개발하는 것을 막고, 챗지피티가 사용자에게 지속적인 이용을 유도하는 행위를 중단하도록 하며, 이를 안전한 제품으로 광고할 수 있는 회사의 권한을 제한해달라고 요청했다.
앤트로픽은 차세대 AI 기술을 구축하는 과정에서 "신뢰할 수 있고 안전한 AI 시스템을 구축하는 것이 공동의 책임이며, 시장 또한 이에 대해 긍정적으로 보상할 것이라고 믿는다"라며 시스템 구축 과정에서 자사 모델을 어떻게 활용하는지에 대한 데이터를 투명하게 공개할 것이라고 밝혔다.
▲오픈AI와 앤트로픽의 로고. ⓒ로이터=연합뉴스