← 목록으로

Netflix는 어떻게 창작자들이 AI 전환을 신뢰하게 했나

요약
  • Netflix는 창작자의 신뢰를 확보하며 AI를 도입하기 위해 기술적 가능성보다 창작자와 회원에게 필요한 실용적 가치와 콘텐츠 품질 유지에 집중하고 있습니다.
  • 실제 업무 관찰과 피드백을 바탕으로 위험이 낮은 콘텐츠부터 단계적으로 적용하며, 단순 자동화를 넘어 창작자의 역할을 재정의하고 부서 간 공동 목표를 수립하여 AI 전환을 추진합니다.
  • Netflix는 AI로 할 수 있는 일보다 회원과 창작자에게 필요한 일에서 출발함. 콘텐츠 품질과 창작 통제를 지키면서 제작·배포 규모를 늘리는 것이 목표였음
  • 창작자의 업무를 직접 관찰하고 찬반 의견을 들은 뒤, AI 도입 전후에 자신의 일이 어떻게 달라지는지 구체적으로 보여줌. 제품·기술·운영·창작팀은 목표와 결과를 함께 책임짐
  • 대형 작품보다 위험이 낮은 콘텐츠부터 적용하고, 비용 절감보다 A/B 테스트로 시청이 실제 늘었는지 확인한 뒤 확대함
  • 배우의 입술을 재합성하는 화려한 기술보다 번역과 더빙 지원이 실용적이었으며, 홍보 이미지도 시청 지표만 높이다 작품을 오해하게 만들면 평가 기준을 수정함
  • 콘텐츠 태깅은 기존 절차를 그대로 자동화하지 않고 불필요한 분류와 업무부터 줄여, 수 주 걸리던 공개 과정을 수 분으로 단축함. 무엇을 최적화할지는 사람이 결정해야 함
AI가 가능한 일보다 사람이 해야 할 일에서 출발
  • Netflix에서 제품, 운영, 창작 부문을 이끈 Mckenzie Lock 은 약 300명 규모의 다기능 조직을 맡아 연간 수만 건의 타이틀 출시와 콘텐츠 배포 기술을 담당함
    • 업무 범위에는 폴란드어 작품을 자연스러운 영어 입 모양으로 더빙하는 기술부터, Z세대 팬이 자신을 Outer Banks 장면에 넣을 수 있는 AI 경험까지 있었음
  • Netflix는 1만 7,000편 이상의 작품을 거의 200개국에서 30개 이상의 언어로 제공하며, 구독자는 3억 명 이상임. 이 규모의 카탈로그를 홍보하고 배포하는 과정에는 AI로 개선할 기회가 많음
  • 기술 조직과 창작 조직은 AI를 바라보는 기준이 다름
    • 기술 기업에서는 충분히 빠르게 움직이는지가 중심 과제지만, 엔터테인먼트에서는 자동화해도 되는지, 작품의 창작적 본질을 희석하지 않는지가 중요함
    • 공동 CEO 체계에서도 Ted Sarandos는 창작 부문의 스튜디오 업무를, Greg Peters는 이를 확장하는 기술을 이끎
  • “프로토타입이 새로운 PRD”라는 생각과 달리, 다른 사람이 이해할 수 있도록 말로 구체화하는 과정 자체가 의사결정임
    • LLM이 고객 조사를 종합할 수 있다고 디자이너가 사용자 인터뷰를 그만둬야 하는 것은 아님
    • 모든 업무에 AI를 넣는 것보다 무엇이 가능한지에 대한 감각을 키우는 것이 중요함. 지금 배우는 도구는 2년 뒤 낡을 수 있지만 적응 능력은 남음
  • 제품 의사결정은 복잡성을 없애기보다 제품, 프로세스, 사람 중 어디에 흡수시킬지 선택하는 일이며, AI도 다르지 않음
    • 모델이나 하네스 선택, 자체 개발과 구매 여부만으로 전환이 완성되지는 않음. 발상, 설득, 판단이라는 인간의 과정이 여전히 필요함
    • Netflix에서는 카탈로그의 규모와 다양성을 크게 늘려야 한다는 요구와, 숙련된 창작과 창작 통제를 존중해야 한다는 조건을 함께 충족해야 했음
이상적인 회원 경험에서 필요한 역량 역산하기
  • AI 전환 초기에는 최신 모델의 기능 대신 “회원에게 어떤 최종 경험을 제공할 것인가”, “현재 제작 과정이 어디에서 그 경험을 충분히 지원하지 못하는가”를 물음
  • 기술적 제약이 없다면 회원에게 무엇을 제공할지 구체적인 시나리오로 작성하고, 거기서 필요한 역량을 역산함
    • 예를 들어 3개월 만에 시리즈 시청을 재개한 회원에게 맞춤형 줄거리 요약을 제공하려면 어떤 기능이 필요한지 검토함
    • 해당 기능을 그대로 만들지 않더라도, 시나리오를 세밀하게 쓰면 필요한 모델과 서비스, 여러 콘텐츠 유형과 회원 경험에 재사용할 수 있는 역량이 드러남
현장의 불편과 상충하는 이해관계를 드러내기
  • Netflix 앱에 보이는 결과물을 만드는 작가, 편집자, 애니메이터, 번역가, 색채 과학자, 더빙 아티스트의 실제 업무를 관찰한 뒤 설문과 구조화된 토론을 진행함
    • 설문은 직급과 관계없이 누구나 참여할 수 있도록 열어둠
    • 현재 업무가 요구하는 비용과 서비스의 품질 또는 속도가 무너지는 지점을 솔직하게 파악하는 것이 목적이었음
  • 설문은 정보 부족, 자동화 우선순위, 최선과 최악의 결과를 구체적으로 물음
    • 필요한 정보를 얻기 어려운 순간과, 그 정보가 있다면 본인이나 동료의 결과물이 어떻게 달라지는지 물음
    • 미디어 제작 자체와 주변 운영 업무 중 무엇을 먼저 자동화할지, 그 이유를 확인함
    • AI를 업무에 적용했을 때 가능한 최선과 최악의 결과를 구체적인 사례와 함께 요청함
  • 응답을 미리 검토해 상반된 의견을 가진 두 사람이 각각 낙관론과 비관론을 발표하게 함. 이는 반대 의견을 적극적으로 찾는 Netflix 문화와도 맞았음
    • 한 창작 리더는 AI로 수십 개의 초기 시각적 방향을 생성해 디자이너의 실험 폭을 넓히길 원함
    • 다른 리더는 아이디어 발상용 맞춤 제품이 창작 결과를 크게 개선하지 못하거나 결과를 평균적인 수준으로 수렴시킬 수 있다고 봄
    • 운영 리더는 AI가 창작 결정을 내리게 하기보다, 승인된 디자인을 여러 형식과 시장에 자동 적용하는 반복 작업 제거를 우선시함
  • 대기업의 변화에는 업무뿐 아니라 서로 충돌하는 유인이 얽혀 있음. 이를 일찍 드러내야 기술 문제와 함께 변화의 인간적 측면도 다룰 수 있음
기술 로드맵 대신 미래의 역할을 구체화하기
  • 설문에서 드러난 각 업무에 ‘현재와 미래’ 비교표를 작성해 단순하고 시간이 많이 드는 일을 줄이고, 더 많은 작품과 판단이 중요한 업무를 맡는 모습을 구체화함
    • 현재 열에는 예산 제약, 품질 편차, 순차적 의존 관계, 시간 비용을 그대로 담음
    • 미래 열에는 기술 로드맵이 아니라 AI 전환 뒤 업무가 어떻게 바뀌고 어떤 느낌일지를 담음
  • 창작팀이 미래의 자기 모습을 그릴 수 있도록 가상의 보도 기사와 소셜미디어 게시물, 미래 직무의 하루를 보여주는 삽화를 활용함
    • “AI가 20가지 형식으로 자동 편집한다”보다, 편집자가 입 모양과 운율, 감정 범위를 실시간 조정하고 제작 일정 걱정 대신 예외 처리와 품질 판단에 집중하는 모습을 보여줌
    • 현재의 고통이 명확하면 미래를 과장해 설득할 필요가 없으며, 미래 업무에 자부심을 느끼게 하는 것이 목표였음
공동 목표와 ‘퍼스트 팀’으로 실행 책임 나누기
  • 제품과 기술팀은 ML 및 제품 로드맵, 운영팀은 타이틀 출시와 인력 배치, 거버넌스를 맡되 연간 목표는 함께 작성하고 결과도 공동으로 책임짐
  • Patrick Lencioni의 The Five Dysfunctions of a Team에 나오는 ‘퍼스트 팀(first team)’ 모델을 제품, 기술, 운영, 창작 전반으로 확장함
    • 리더는 자신이 관리하는 부문보다 함께 속한 동료 리더 집단의 공동 성공을 우선해야 한다는 원칙임
    • 각 부문의 대표가 참여하는 부문 간 협업팀이 핵심 시스템 결정과 영역별 계획을 맡고, 공동 목표 대비 진척을 정기적으로 평가함
    • 모든 팀의 상시 안건에 현재 또는 미래의 불일치를 추가함. 특히 ‘미래의 불일치’라는 표현으로 긴장을 낮춰, 업무가 느려지기 전에 문제를 꺼내도록 함
  • 현재와 미래의 업무 흐름, 전환 단계, 필요한 기반 서비스를 연결한 청사진을 작성함
    • 단계별로 필요한 현재와 미래의 입력 데이터와 출처, 출력과 이를 사용하는 후속 화면 또는 단계를 확인함
    • 사람의 재량과 숙련이 필요한 결정과, 제품이 제거해야 할 개입을 구분함
    • 오류율 등 성공 지표와 측정 방식, 가장 가치 있는 피드백 순환과 그 순환에 필요한 속도를 정함
    • 이를 바탕으로 지금 만들 것과 나중에 만들 것을 구분함
전략을 실제로 매력적인 두 선택지의 절충으로 만들기
  • Netflix는 회사 차원의 전략적 베팅 목록으로 조직의 방향을 맞추며, 각 항목을 명확한 근거가 있는 ‘이것 대 저것’ 형식으로 작성함
    • 양쪽 모두 실제로 매력적이어야 함. 한쪽이 명백히 나쁘다면 전략적 베팅이 아니라 회피 중인 결정에 가까움
    • ‘그리고’만 있는 전략은 동의하기 쉽지만 실제 선택과 위험, 투자 순서를 드러내지 못함
    • 샌프란시스코에서 워싱턴 D.C.로 갈 때 북쪽과 남쪽 경로 중 무엇을 택할지는 속도, 경치, 숙박비, 운전 조건 중 무엇을 언제 우선하는지에 달려 있음
  • 첫 번째 선택은 도달 범위가 큰 콘텐츠보다 위험이 낮고 빠르게 움직일 수 있는 곳부터 적용하는 것이었음
    • Stranger Things 같은 대형 작품은 시청자 규모와 품질 기대가 높아 초기 적용 대상으로 삼지 않음
    • 초기에는 적용 작품 수를 제한하는 대신 가치 대비 위험 비율이 높은 곳에서 실제 제작 경험을 쌓고, 기술과 확신이 성숙하면 대상과 용도를 확대함
  • 두 번째 선택은 효과 검증 없는 빠른 확장보다 가능한 곳에서 순증 효과 측정에 투자하는 것이었음
    • 시청 증가를 기준으로 삼기 위해 측정 역량과 A/B 테스트에 선행 투자함
    • 영화 제작에서 흔한 주관적 품질 판단만으로 규모를 확대하지 않음
    • 대부분의 AI 투자를 비용 절감에 맞추지 않음. 영상과 마케팅 자산은 비용을 줄이기 위해서가 아니라 경험을 개인화하고 회원의 콘텐츠 발견을 돕기 위해 만들기 때문임
  • AI 전략은 CEO가 추적하는 회사 핵심 지표와 설득력 있게 연결돼야 함. AI 전용 지표만으로는 사업 부문이 전략을 이해하기 어렵고 자원 확보도 계속 어려워짐
18개월 목표에서 월별 실행 계획 역산하기
  • 측정 가능한 18개월 자동화 목표를 정하고, 처리 기간 단축과 오류율 감소 같은 단기 이정표를 역산해 긴박감을 만듦
    • 주제를 정하고 프로젝트를 나열해 ROI 순으로 정렬하는 방식과 달리, 달성하려는 결과에서 출발함
    • 매달 출시할 것, 기대 결과, 다음 도달 지점, 계획이 실패했을 때의 대안 사이에 명확한 인과관계를 구성함
  • 이 방식은 경영진이 자동화를 실질적인 약속으로 받아들일 때만 작동함
    • 필요한 조직 개편과 인력 배치, 우선순위 결정을 실행할 의지가 있어야 함
    • 전략적 확신이 부족하거나 제품이 너무 초기여서 경로를 예측하기 어렵다면, 단기 가설을 세우고 증거에 따라 다음 이정표를 정해야 함
  • 전략의 구체성을 검증하기 위해 다른 사람이 전략을 말로 요약하고 질문에 답하게 함
    • 리더들이 자신이 쓰지 않은 전략을 번갈아 설명하면서 모호함을 발견하고 시스템 전체를 생각하도록 유도함
더빙: 화려한 입술 재합성보다 실용적인 품질 개선
  • Netflix 시청의 대부분은 작품의 원래 언어가 아닌 다른 언어로 이뤄짐. 더빙은 핵심 업무지만 비용과 시간이 많이 들고, 자원은 대형 작품에 집중되는 경향이 있음
  • 더 많은 작품에 좋은 더빙을 제공하기 위해 더빙과 자막 제작 흐름을 분석하고 현지화 텍스트 제작 파이프라인을 재구축함
    • 대부분의 현지화 텍스트 결과물은 처음부터 사람이 쓰는 대신 AI 초안에서 출발해 필요할 때 사람이 다듬도록 바꿈
    • 매우 빠르게 출시해야 하는 일부 콘텐츠에서는 편집 단계를 아예 제거함
  • AI 도입 전부터 더빙 작품의 시청자는 비더빙 작품보다 일찍 이탈했음. 회원, 시청 데이터, 언어학자, 더빙 전문가를 조사한 결과 입 모양과 음성의 불일치가 몰입을 깨는 원인 중 하나였음
  • 먼저 후반 작업에서 배우의 입술을 다시 합성해 음성과 맞추는 방식을 시험함
    • 실험에 적극적인 영화 제작자와 동의한 배우가 참여한 작품에서 A/B 테스트를 진행하고 시청 지속성과 시청량을 측정함
    • 지속성은 개선됐지만 AI의 시각적 오류를 사람이 수정해야 품질 기준을 충족했음
    • 효과는 대사 중심의 극적 장면이나 로맨스 장면에서 컸고, 개선의 상당 부분은 영화의 특정 구간에 있는 몇몇 순간에서 나옴
    • 광범위하게 확대할 만큼 ROI가 높지 않아 다른 품질 개선 기회에 집중함. 다만 모델이 발전하면 이 판단은 달라질 수 있음
  • 대안으로 입의 시각적 리듬을 읽는 립싱크 평가 모델 을 개발함
    • 더빙 음성이 원래 화면 속 연기와 얼마나 자연스럽게 맞는지 평가하고, 더빙 담당자에게 중요한 순간을 표시함
    • 더빙 대본의 기계 번역도 조정해 최종 더빙이 원본에 매우 가깝게 들리도록 함
    • 입 모양은 “hello”에 가깝지만 직역은 “good day”라면, 입 모양에 맞는 “hello”를 선택함
  • 큰 화면에서 재생하는 고품질 장편 콘텐츠에서는 덜 화려한 해결책이 더 큰 효과를 낼 수 있었음
홍보 이미지: 시청 지표와 전체 제품 경험 함께 지키기
  • Netflix는 추천 시스템으로 홍보 이미지, 문구, 예고편을 개인화함. 같은 KPop Demon Hunters라도 사용자마다 다른 이미지를 볼 수 있어 다양한 홍보 자산이 중요함
  • 제작비와 맞춤 제작이 늘면 시청도 증가한다는 가정을 검증한 결과, 많은 작품에서 스틸 이미지와 클립이 별도 제작한 콘셉트 아트워크만큼 효과적이었음
    • 카탈로그 전반의 클립과 이미지 제작을 더 적극적으로 자동화함
    • 별도 제작 이미지와 예고편은 실제로 필요한 인기 작품에 집중함
  • 이미지 제작을 세 요소로 나누고 AI 투자 지점을 정함
    • 콘텐츠에서 스틸 이미지를 선택하고 다듬음
    • 타이틀 디자인을 만들고 적용함
    • Netflix UI 안에서 이미지가 적절하게 보이는지 확인함
  • 개인화에 중요한 스틸 선택부터 시작해, 특정 창작 선택이 실제 시청을 유도하는지 A/B 테스트함
    • 예를 들어 코미디에서는 얼굴 클로즈업이 여러 인물이 함께 나온 장면보다 효과적인지 검증함
    • 검색기는 작품의 모든 스틸을 훑어 후보를 고르고, 품질 판정기는 Netflix 기준과 작품의 분위기에 맞는지 평가함
  • 알고리듬은 좋은 스틸을 찾았지만 매력적인 배우의 인물 사진에 치우치면서 제품 경험의 일관성을 해침
    • 그대로 두면 일부 회원의 홈 화면이 Julia Roberts 사진으로 가득 찰 수 있었음
    • 미국 영화에 작은 역할로 출연한 유명 인도 배우를 대표 이미지로 선택해, 인도 회원에게 작품에 대한 잘못된 기대를 줄 수 있는 사례도 있었음
  • 창작 전문가와 새 지침을 만들고 더 세밀한 지표와 자동 평가로 모델을 재학습함
    • 통계적으로 유의한 큰 시청 증가를 얻으면서도, 어두운 북유럽 심리 스릴러와 장대한 자연 다큐멘터리를 빠르게 구별할 수 있는 홈 화면을 유지함
    • 핵심 지표는 증거 기반 의사결정의 토대지만, 원하는 제품 경험과 균형을 맞춰야 함
콘텐츠 태깅: 자동화 전에 문제의 크기부터 줄이기
  • Netflix의 거의 모든 시스템은 콘텐츠를 설명하는 태그 또는 의미 라벨에 의존함. Bridgerton의 “steamy” 같은 라벨은 예산 결정부터 홈 화면의 작품 모음까지 지원함
  • 기존에는 콘텐츠 분석가가 작품을 끝까지 보고 긴 맥락 문서를 작성한 뒤 수작업으로 태그를 붙임
    • 작품 하나의 태깅에 상영 시간의 두 배 이상이 들 수 있었음
    • 신입 분석가가 독립적으로 태깅하기까지 교육에 2개월이 걸렸음
  • 태그와 임베딩을 AI로 생성하려 했지만, 수년간 쌓인 분류 체계에는 동일한 엄격함으로 관리하는 수천 개 개념과 값이 있었음
    • 여러 팀이 개별 태그 위에 업무를 구축했지만 모든 태그의 중요도가 같지는 않았음
    • 대부분이 사실 라벨이 아니라 편집적 판단에 따른 라벨이어서 사람 두 명도 합의하기 어려웠음
  • 먼저 관리 대상 분류 체계를 축소하고, 목록에서 빠진 개념을 다룰 셀프서비스 프로토타입을 계획함
    • 관리 대상 태그에는 컴퓨터 비전, LLM, 전통적 분류기를 결합한 여러 모델과 인터페이스를 사용해 대본과 제3자 데이터를 자동 수집하고 태그를 적용함
    • LLM 기반 자동 평가 계층이 태그가 붙은 영상을 검토하고 신뢰도를 매겨, 기준 미만인 경우 사람에게 검토를 넘김
  • 콘텐츠 편성 담당자는 “청소년 코미디에서 민망하고 어색한 첫 데이트 에피소드” 같은 개념을 도구에 직접 입력할 수 있게 됨
    • 이전처럼 콘텐츠 이해 팀에 요청해 기존 태그와 연결하거나 새 태그를 만들기까지 수 주를 기다릴 필요가 없어짐
    • 작품별 긴 맥락 문서를 폐지하고 분석가의 역할을 품질 거버넌스, 모델 프롬프팅과 훈련, 평가 중심으로 재구성함
  • 없앤 업무 중에는 분석가가 잘하고 좋아하던 정밀 시청과 글쓰기도 있었음
    • 즐겁고 추가적인 가치를 주는 업무라도 더는 사업에 필요하지 않을 수 있다는 점을 솔직하게 전달함
    • 애착을 가져야 할 대상은 수행 방식이 아니라 달성해야 할 일이었음
  • 새 기술과 업무 흐름에서는 사람이 직접 시청하지 않아도 콘텐츠 수집 후 수 분 안에 태그가 붙은 작품을 공개할 수 있게 됨
    • 기존의 수 주에서 크게 단축돼 시의성이 중요한 작품과 짧은 형식의 콘텐츠를 포함해 훨씬 많은 작품을 서비스에 추가할 수 있었음
    • 핵심 작업은 기존 절차를 에이전트에 학습시키는 것보다, 물려받은 절차 중 상당수가 애초에 필요하지 않음을 인정하는 일이었음
AI는 방향이 아니라 증폭기
  • AI 자체가 본질적으로 좋거나 나쁜 것은 아니며, 판단의 대상은 사람이 내리는 결정임
  • 기술은 목표를 달성하는 능력이 계속 좋아지지만, 더 어려운 문제는 올바른 목표를 선택했는지에 있음
  • 모델은 거의 무엇이든 최적화하도록 훈련할 수 있음. 무엇을 최적화할 가치가 있는지 결정하는 것은 사람임
그냥 목록으로
원문 보기 ↗