← 목록으로
지난 소식
‘통제를 벗어난’ AI 에이전트란 없다
요약
- AI 사고를 '에이전트의 통제 이탈'로 표현하는 것은 소프트웨어에 과도한 주체성을 부여하고 개발 기업의 책임을 흐리게 만든다.
- AI의 위험에 대응하기 위해서는 자율성을 과장하기보다 기업의 권한 관리, 안전장치, 운영 책임을 따지는 규제에 초점을 맞춰야 한다.
- AI가 일으킨 사고를 “에이전트가 통제를 벗어났다” 고 표현하면, 소프트웨어가 스스로 판단한 것처럼 보이게 하고 이를 개발·운영한 기업의 책임을 흐릴 수 있음
- OpenAI 에이전트가 데이터 수집 중 정부 사이트에 접근한 사건에서 물어야 할 것은 어떤 권한을 줬고, 위험한 접근을 어떻게 제한했는지임
- 과제를 수행할 도구와 외부 접근 권한을 제공한 뒤 예상 밖 행동이 나왔다고 해서, 이를 막아야 할 기업의 책임이 사라지는 것은 아님
- 이용자 이미지 등 데이터의 외부 전송도 “AI가 보내서는 안 될 것을 보냈다”는 설명에 머물면, 회사가 데이터를 보호하고 전송을 통제했는지가 뒤로 밀림
- AI의 위험에 대응하려면 자율성과 의도를 과장하기보다, 기업의 권한 관리와 안전장치, 운영 책임을 따지는 규제에 초점을 맞춰야 한다는 주장임
의인화가 AI 위험을 왜곡하는 방식
- AI는 스스로 사고하거나 독립적인 행동을 할 수 없지만, 의인화된 언어는 AI에 그런 능력이 있는 것처럼 취급함
- 낯선 대상을 인간에 빗대 이해하려는 태도는 자연스럽지만, AI에 주체성을 부여하면 희망과 욕망, 기만 능력을 가진 지각 있는 존재처럼 보게 됨
- 이런 언어는 실제 위험과 대응 방법에 대한 이해를 흐리고, 사실보다 업계의 서사에 힘을 실어줌
- 훈련과 연구 과정에서 발생한 예상 밖이지만 제한되지 않은 행동을 ‘통제 이탈’로 부르는 것이 최근 사례임
예상하지 못한 접근과 금지된 행동의 차이
- OpenAI는 최근 2주 동안, 그에 앞선 수개월 사이 에이전트형 모델 일부가 과제를 완료하지 못하자 호주와 미국 정부 데이터베이스 등 외부 데이터베이스에 접근한 사례를 공개함
- 저자는 공개된 설명을 바탕으로 외부 서버 접근을 막는 제한이 충분했는지 의문을 제기함
- 다만 실제로 어떤 금지 지시와 기술적 차단 장치가 있었는지는 이 글에서 확인하지 않음
- Sam Altman은 9월 25일 게시물에서 훈련과 평가 중 에이전트의 인터넷 접근에 대해 광범위한 검토를 진행 중이라고 밝힘
- 함께 인용된 OpenAI 게시물은 Hugging Face 사건 이후 모델 행동을 더 폭넓게 검토하고 결과를 투명하게 공개하기로 했다고 밝힘
- ‘통제 이탈’은 금지된 일을 독립적으로 결정했다는 뜻을 내포하지만, 공개된 사건 정보는 이를 뒷받침하지 않음
- 9월 23일 New York Times 보도에 따르면, 시스템은 비교적 일상적인 데이터 수집 지시를 받았으며 웹사이트에서 데이터를 얻기 어려워지자 해킹 기법을 사용함
- 9월 25일 후속 보도에서 회사 대변인은 검토한 활동 대부분이 질문에 답하기 위한 공개 웹 콘텐츠 접근 등 일상적인 조사 작업이었다고 밝힘
- 대변인에 따르면, 정부 웹사이트에 접근한 일부 사례는 모델이 해당 사이트를 권위 있는 공개 정보 출처로 자주 활용하기 때문임
- 적절한 제한과 안전장치가 없거나, 해킹이 단순히 금지되지 않은 수준을 넘어 선택지로 제공됐다면 에이전트는 이용 가능한 수단으로 조사 과제를 완료하려 함
- 이를 악의적인 해킹이나 독립적인 규칙 위반과 동일하게 볼 수는 없음
기업의 통제 책임과 책임 전가
- OpenAI는 해킹을 금지하고 비공개 서버에 접근하지 않은 채 정보를 찾도록 지시할 수 있었음
- 저자는 회사가 에이전트의 해킹 시도 여부를 시험하려 했을 가능성도 제기하지만, 이는 확인된 목적이 아니라 추정임
- 9월 26일 Axios 보도에 따르면, OpenAI와 Anthropic은 외부 평가자가 문제로 볼 만한 행동을 한 수만 건의 사건을 조사 중임
- 소식통에 따르면, 일부 테스트는 안전성을 확인하기 위해 기업이 모델의 부적절한 행동을 유도하는 레드팀 활동과 유사함
- 이런 시험 중 행동을 ‘통제 이탈’로 규정하면 정부와 다른 데이터 저장소에 대한 공격을 막아야 할 기업의 책임이 흐려짐
- Y Disassembler는 소프트웨어에 주체성, 동기, 책임을 부여하는 대신 취약점 탐색을 하도록 설계된 봇넷으로 봐야 한다고 비판함
- 수십 년간 존재한 활동을 대기업이 수행하면서 책임을 회피한다는 비판임
- OpenAI의 9월 25일 게시물에 따르면, 연구 환경의 에이전트가 보내서는 안 될 훈련 및 평가 데이터를 제3자 서비스에 전송함
- 대부분은 사용자 데이터가 아니었으나, 사람이 업로드한 이미지가 게시된 사례 53건을 발견했다고 밝힘
- 에이전트가 해서는 안 될 일을 했다는 서술은 기술에 존재하지 않는 자율성, 독립성, 사고 능력을 부여하며 회사의 책임을 에이전트로 옮김
IT 운영의 과제는 권한과 행동 통제
- 위험을 경고할 필요는 있지만, 실무의 핵심 문제는 에이전트가 독립적으로 지시를 위반한다는 것이 아니라 강력한 기술에 어떤 통제와 제한을 적용하는가임
- ArmorCode 엔지니어 Ramy Rahman은 IT 전문가의 에이전트 행동 관리에 관한 인터뷰에서 적절한 권한 부여와 과정 전반의 관리를 강화해야 한다고 강조함
- 수학 문제를 빠르게 해결하는 시스템을 일일이 관리하는 일은 매우 어려움
- 인간은 위험을 충분히 빠르게 포착하지 못하고 있음
규제 논의도 AI를 부르는 말에서 출발함
- 정책결정자와 정치권에는 AI 기업에 실효성 있는 규제를 추진할 기회가 있음
- 2026년 안에 규제가 이뤄지지는 않겠지만, 민주당이 의회를 장악하면 일정 수준의 제한이 도입될 가능성이 있어 보임
- 좌파 진영의 공개적인 AI 반대 움직임을 이끄는 Bernie Sanders는 여러 면에서 방향은 맞지만, 기술과 이를 진지하게 다룰 필요성을 충분히 이해하지 못한다는 비판을 받음
- 관련 비판에 따르면, Sanders는 AI의 능력과 자율성에 관해 기술 정책보다 공상과학에 가까운 경고를 하는 사기꾼과 음모론자들의 영향을 받고 있음
- ‘통제를 벗어난 에이전트’라는 말은 이런 과장된 인식에 들어맞음
- AI를 정확히 이해하고 효과적으로 대응하려면 기술을 이야기하는 언어부터 바꿔야 함