← 목록으로

Stripe의 사내 업무용 AI 플랫폼, Kai

요약
  • 스트라이프가 영업, 재무, 규정 준수 등 비개발 부서의 사내 지식 업무를 돕기 위해 구축한 AI 플랫폼 'Kai'는 직원들의 높은 사용률을 기록하며 업무 효율성을 크게 높였다.
  • Kai는 공통 플랫폼과 부서별 전문성을 결합하여 API, AgentStudio, 실행 환경의 3개 계층으로 구성되었으며, 철저한 보안 데이터 격리와 장시간 작업 상태 유지를 지원한다.
  • Stripe는 영업 전 고객 조사, 재무 분석, 규정 준수 검토 등을 돕는 사내 AI 플랫폼 Kai를 구축했으며, 발표 시점 기준 직원 83%가 매주 사용하고 있음
  • 기존 도구로 만든 4,000개 이상의 에이전트는 비슷한 프롬프트를 중복 작성하고 품질과 유지보수를 관리하기 어려워, 공통 플랫폼과 부서별 전문성을 결합하는 구조로 전환함
  • 각 부서가 업무에 맞는 에이전트와 스킬을 직접 만들고 관리하며, 직원은 웹 앱과 Slack, 기존 사내 도구에서 같은 에이전트를 활용할 수 있음
  • API, AgentStudio, 실행 환경의 3개 계층으로 구성되어 1,000개 이상의 스킬과 도구를 연결하고 긴 작업의 상태를 유지하며, 사용자가 접근 권한을 갖고 있어도 서로 무관한 고객 데이터가 같은 세션에 섞이지 않도록 격리함
  • Stripe 내부 비교에서 같은 영업 담당자가 Kai를 사용한 주에는 미사용 주보다 영업 활동이 2배, 계약 성사 건수가 39% 많았으며, 연간 약 2만 5,000시간을 행정 업무에서 매출 창출 업무로 전환하는 데 기여함
지식 업무에 별도 플랫폼이 필요했던 이유
  • Claude Code와 Codex 같은 코딩 에이전트가 엔지니어링을 바꿨지만, 영업 담당자, 재무 분석가, 기술 계정 관리자 등 비개발자의 업무와 Stripe의 데이터 보안 요건을 함께 충족하는 기존 도구는 없었음
    • 필요한 업무에는 데이터 웨어하우스 조회, 영업 통화 전 고객 계정 조사, 인시던트 분류, 매출 시나리오 모델링, 규정 준수 검토 준비 등이 있었음
  • 코딩은 언어와 변경 사항이 달라도 파일 수정, 테스트 실행, 커밋이라는 비교적 일정한 작업 구조를 가지므로 하나의 에이전트 아키텍처가 잘 작동함
    • 지식 업무는 과제마다 도구, 데이터, 결과물, ‘완료’의 정의가 달라 동일한 구조로 다루기 어려움
  • Kai 이전에는 NoCode Agent Builder와 코딩 에이전트라는 두 가지 선택지가 있었음
    • NoCode Agent Builder로 누구나 도구를 사용하는 업무별 에이전트를 배포할 수 있었고, 4,000개 이상이 만들어짐
    • 팀마다 개념적으로 비슷한 프롬프트를 서로 다른 품질로 작성했고, 작은 에이전트가 늘어나면서 모니터링과 유지보수가 어려워짐
    • 일부 비개발자는 코딩 에이전트를 쓰기 위해 업무 방식을 바꿨지만, 보안 우려와 함께 비개발자를 지원한 경험이 없던 코드 품질 팀의 지원 부담이 발생함
전문성 분산, 업무 도구 통합, 맥락 기반 가드레일
  • 플랫폼 팀이 모든 업무를 대신 설계하지 않고, 각 부서의 전문가가 자신의 업무 지식과 판단 기준을 에이전트에 반영하도록 해야 했음
    • 청구 관련 에스컬레이션 처리나 매출 시나리오 모델링의 전문가는 에이전트 인프라 팀이 아니라 GTM, 재무, 마케팅, 법무, 데이터 과학 등 수십 개 영역에 분산돼 있음
    • 각 영역의 도구, 데이터 소스, 업무 흐름, 품질 판단 기준에 제품과 국가별 차이까지 더해지므로, Kai는 사용자가 이런 복잡성을 의식하지 않고 작업할 수 있어야 함
  • 에이전트는 별도 앱으로 사용자를 이동시키기보다 업무가 이루어지는 곳에 내장돼야 함
    • 재무팀의 운영 예산 모델링 앱에서는 앱을 벗어나지 않고 맥락 파악, 관련 문서 조사, 유효한 변경안 제안, 변경점 요약이 가능해야 함
    • 독립형 앱은 기존 업무 흐름을 끊고, 인터페이스마다 별도 에이전트를 만들면 유지보수가 분산되고 여러 도구를 오가는 사용자의 경험이 분절됨
  • 지식 업무에는 컴파일러, 테스트, git처럼 빠르게 검증하거나 되돌릴 수 있는 장치가 거의 없어 가드레일을 별도로 구축해야 함
    • Stripe에서는 서로 무관한 두 고객의 데이터를 하나의 분석에 결합하면 안 됨
    • 사용자가 두 고객의 데이터에 각각 접근할 권한이 있더라도 같은 세션에 함께 나타나서는 안 됨
    • 격리 기준은 직원의 접근 권한만 확인하는 것이 아니라, 지금 처리하는 업무에 필요한 데이터만 에이전트에 제공해야 함
3개 계층으로 구성한 Kai
  • 하나의 거대한 에이전트에 모든 제약을 담기도, 각 도메인 팀이 안전하고 성능 좋은 호스팅 인프라를 독립적으로 구축하기도 어려워 API, AgentStudio, 실행 환경으로 역할을 나눔
  • 인터페이스 독립적인 API가 웹 앱, Slack 연동, 내부 도구에 동일한 에이전트를 제공함
    • 에이전트의 기본 단위는 애플리케이션이 아니라 서비스이며, 각 인터페이스는 이를 목적에 맞게 보여주는 화면임
    • 대부분의 직원은 별도 인프라 설정 없이 입사 첫날부터 사내 호스팅 웹 앱을 사용함
    • 내부 도구에 API로 Kai를 내장할 수 있고, Chrome 확장 프로그램으로 웹 기반 서드파티 도구에서도 기능을 제공함
    • 비즈니스 인텔리전스 플랫폼에서 작업 중인 직원도 기존 앱 안에서 Kai에 질문할 수 있음
  • AgentStudio는 도메인 담당자가 스킬, 맞춤형 Kai 에이전트, 도구 구성을 만들고 테스트하며 모니터링하는 제어 계층임
    • GTM 팀은 자체 업무에 맞춘 에이전트를 소유하며, 관련 스킬을 기본으로 불러오고 자체 데이터 소스에 연결해 사용자가 기대하는 형식으로 결과를 출력함
    • 스킬은 도메인 전문가가 관리하는 영역별로 정리됨
    • 각 자산의 사용량과 품질 신호를 함께 제공하므로 플랫폼 팀에 요청하지 않고도 작동 상태를 확인할 수 있음
보안 실행 환경과 긴 세션 처리
  • 에이전트 하네스, 샌드박스, 워크플로 오케스트레이션, 접근 제어 프레임워크는 Stripe의 외부 제품용 에이전트와 공유함
    • 내부 지식 업무도 외부 제품과 동일한 민감 데이터를 다루고 같은 사용자를 지원하므로 동일한 보안 및 규정 준수 기준이 필요함
    • 공통 기반을 개선하면 내부 에이전트와 제품 에이전트가 동시에 혜택을 얻음
  • 하네스는 LangChain의 deepagents 로 구축했으며, Kubernetes에서 세션별 보안 샌드박스와 멀티테넌트 가상 파일 시스템을 사용함
    • 에이전트는 가상 파일 시스템에서 산출물을 생성하고 수정함
    • 분석과 데이터 처리에는 안전한 코드 실행 샌드박스를 사용함
  • 장시간 작업의 상태 유지를 지원하며, 최근 한 세션은 932턴에 도달함
    • 한 대화에서 수백 턴과 수백 번의 도구 및 LLM 호출을 수행해도 시간 초과나 컨텍스트 윈도 초과 없이 작업을 이어갈 수 있음
    • 지식 업무는 단일 질문보다 이전 결과 위에 추론을 쌓는 반복 작업이 많아 세션 상태를 안정적으로 유지하는 것이 중요함
  • Kai는 1,000개 이상의 스킬과 도구에 연결됨
    • 주요 지표를 추적하는 비즈니스 인텔리전스 대시보드, 내부 프로젝트 관리 도구, Zoom, Google Workspace 등을 포함함
    • 코딩 에이전트에는 폴더 구조라는 자연스러운 맥락 구분이 있지만 Kai에는 그런 사전 구조가 없음
    • 적절한 스킬과 맥락을 선택하기 위해 RAG/LLM 혼합 접근법 등을 사용하며, 구체적인 방법은 후속 게시물에서 공개할 예정임
도입 현황과 업무별 성과
  • 4월 출시 후 2주 안에 직원 대다수가 Kai를 사용했고, 현재 주간 활성 사용자 비율은 83% 임
    • 마케팅, 영업, 고객 성공 관리자, 기술 계정 관리자를 포함하는 GTM 조직은 거의 전원이 사용함
    • 대부분의 세션은 심층 조사, 특정 산출물 제작, 내외부 공유 전 결과물 다듬기 등 여러 턴의 작업으로 구성됨
  • GTM 신규 입사자는 Kai를 2.7배 더 많이 사용하며, 같은 코호트에서 집중 사용자의 성사 계약 가치는 저사용자보다 80% 높음
  • 영업 담당자별 사용 주와 미사용 주를 비교하면 Kai 사용 주의 성과가 높았음
    • 영업 활동은 2배, 생성한 영업 기회는 17%, 매출 기회는 26%, 계약 성사 건수는 39% 증가함
    • 전체적으로 연간 25,000시간을 행정 업무에서 매출 창출 업무로 옮기는 데 기여함
  • 재무와 운영에서는 정리되지 않은 데이터 분석, 정기 요약 생성, 흩어진 맥락을 활용 가능한 산출물로 만드는 데 사용함
  • 엔지니어링에서는 시스템 질문, 실행 요청을 위한 조사, 로그 분석, 계획 초안 작성, 전문 에이전트와 스킬 호출에 활용함
  • 전사적으로 매일 5,000개 이상의 세션이 데이터 분석을 중심으로 진행됨
    • 데이터 품질과 분석 계층에 관한 적절한 맥락을 연결하면 대부분의 질문에서 기본적으로 올바른 응답을 확보할 수 있는 수준에 도달함
  • 사용자들은 AI를 적극적으로 활용할 자신감과 Kai의 정확성에 대한 만족을 전함
    • 한 비개발자는 소개 세션 직후 Asana, Slack, Jira의 정보를 하나로 모으는 자동 요약 프로세스 제작에 협업함
아직 남은 개선 과제
  • 상태 관리 개선을 위해 LLM에 보내는 활성 맥락과 S3 또는 가상 파일 시스템에 저장하는 확장 맥락을 지속적으로 조정 중임
    • 범용 에이전트가 도구를 반복 호출하고 큰 문서를 가져오면서 많은 상태 정보가 쌓이는 문제를 다룸
  • 자기 성찰과 개선 루프를 개발 중임
    • Kai가 특정 스킬을 사용한 실행 추적을 검토하고, 개선안을 제안하고 테스트한 뒤 스킬 소유자에게 검토할 변경 사항을 제출하도록 할 계획임
  • 협업 기능도 확대할 계획임
    • 현재 세션 안에 갇혀 있는 맥락을 다른 세션과 공유하고, 여러 사람과 에이전트가 같은 산출물을 함께 다룰 수 있도록 하려 함
  • Kai는 코딩 에이전트가 엔지니어에게 제공한 AI 활용 효과를 지식 근로자로 확대했지만, 생산성 향상의 상한은 아직 알 수 없으며 개발은 초기 단계에 있음
그냥 목록으로
원문 보기 ↗