← 목록으로

GLM 5.3 Flash로 한 달간 코딩하기

요약
  • 한 달간 GLM 5.3 Flash 모델을 활용해 웹사이트 개발 및 UI 작업 등 실무 코딩을 수행한 실험 결과, 저렴한 Flash급 모델로도 일상적인 개발이 충분히 가능하다는 것을 확인했다.
  • 실험을 통해 토큰 수뿐만 아니라 비용과 에너지 사용량을 기준으로 한 효율적인 모델 관리의 필요성을 강조했으며, 향후 비용 대비 성과를 중심으로 모델 활용을 최적화할 계획이다.
  • GLM 5.3 Flash만으로 한 달간 개발하는 실험에서 Wagtail과 웹사이트 개발, UI 작업, 문서 작성 등을 수행했으며, 해당 모델 사용 비용은 68달러였음
  • 100만 토큰 컨텍스트와 이미지 이해로 긴 코딩 작업과 스크린샷 기반 개발을 처리했지만, 서비스 지연과 다른 모델 실험 때문에 전체 20억 토큰 중 절반만 이 모델에 사용함
  • 프로토타입을 만들 때 비싼 모델을 잘못 선택해 거의 하룻밤에 150달러를 사용함. 모델과 에이전트 구성을 신중하게 골랐다면 비슷한 결과를 약 5분의 1 비용으로 얻을 수 있었을 것으로 봄
  • GLM 5.3 Flash 사용에 따른 에너지는 약 4kWh였지만, 다른 모델까지 포함하면 월간 사용량은 목표 10kWh를 넘는 약 35kWh에 달함
  • 일상 개발은 저렴한 Flash급 모델 한두 개로도 충분히 가능했으며, 연구개발 예산을 따로 두고 토큰 수보다 비용·에너지·실제 성과를 기준으로 사용량을 관리할 필요가 있음
단일 오픈 모델 도전과 실제 사용량
  • 9월 한 달 동안 효율적인 오픈 모델 하나만 사용하기에 도전했으며, 목표 모델은 GLM 5.3 Flash였음
  • 사용량은 에이전트 엔지니어링 권장 사항에 포함된 AgentsView로 추적함
    • 첫 보름은 목표 모델만 사용하는 데 성공함
    • 해당 모델 사용량은 비용 68달러, 에너지 약 4kWh, 탄소 배출량 365g으로 예산 범위 안이었음
    • 후반부에는 다른 모델에 10억 토큰을 사용함
  • 최종적으로 목표 모델의 비중은 전체 20억 토큰 중 10억 토큰, 50% 에 그쳐 단일 모델 도전은 실패함
    • 전체 에너지 사용량도 목표였던 10kWh 대신 약 35kWh에 달함
바이브 코딩 프로토타입의 비용
  • 실험적인 Wagtail MCP 서버는 바이브 코딩으로 만든 프로토타입임
    • 바이브 코딩은 평소 지향하는 개발 방식은 아니지만, 프로토타입에는 적합했음
    • 다만 부적절한 모델 선택으로 거의 하룻밤 사이에 4억 5,000만 토큰, 150달러, 5kWh를 사용함
  • MCP 서버 자체는 잘 작동하고 기능을 보여주는 좋은 데모도 확보했지만, 큰 노력을 더하지 않고도 비슷한 결과를 비용 약 5분의 1로 얻을 수 있었을 가능성이 높음
  • 프로토타입에도 별도 예산을 잡고, 모델 선택과 에이전트 활용 패턴을 더 신중하게 결정할 필요가 있음
추론 인프라 가용성과 모델 전환
  • 오픈 웨이트 모델과 추론 공급자 비교를 거쳐 선택한 공급자들은 대부분 잘 작동했지만, 인기가 높고 GPU를 대량 확보한 대형 AI 연구소만큼의 처리 용량은 갖추지 못함
  • 특히 추론 서비스의 응답 속도 저하를 경험함
    • 관련 작업에 적합한 모델들의 파레토 프런티어에서 높은 위치를 차지해 수요가 몰렸을 가능성이 높음
    • 비교 대상은 유럽 데이터센터에서 이용 가능하다고 확인된 오픈 모델로 한정했으며, 다른 지역의 추론도 허용하면 파레토 프런티어가 달라질 수 있음
  • 가용성 문제로 DeepSeek V4.1 Flash와 Qwen 3.8 Flash 등 유사 모델로 전환해야 했음
    • 전환 자체는 매우 간단했지만, 계획하지 않았던 일이었음
연구개발에는 여러 모델의 실험이 필요함
  • 일상적인 엔지니어링에 모델 하나를 쓰는 것과 별개로, 공급자의 신제품을 따라가며 다양한 모델을 계속 시험할 필요가 있었음
  • Wagtail 작업 벤치마크를 시작하면서 여러 모델에 걸친 성능 데이터가 특히 중요해짐
    • 구체적인 데이터가 있어야 더 적은 자원을 쓰는 선택지로 사람들을 안내하기 쉬움
    • 에이전트 스킬과 새 Wagtail CLI 프로토타입으로 이런 선택지의 실용성을 높일 수 있음
    • CLI 프로토타입은 에이전트와 잘 작동하도록 만드는 것이 목적임
GLM 5.3 Flash가 잘 수행한 작업
  • GLM 5.3 Flash 자체의 성능은 훌륭했으며, 앞으로도 연구개발을 제외한 전체 작업의 50% 이상을 차지하는 일상적인 실무에서는 도전을 이어갈 계획임
  • 단일 모델 중심 개발에 적합한 특성을 갖춤
    • 100만 토큰 컨텍스트 창으로 긴 코딩 작업을 수행할 수 있음
    • 이미지 처리 지원으로 스크린샷을 바탕으로 개발하거나 시각적 품질 검증을 할 수 있음
    • 여러 공급자가 제공하므로 공급자 간 경쟁의 이점을 누릴 수 있음
  • 실제로 Wagtail 자체와 Wagtail 기반 사이트 개발, UI 작업, AI 연구개발, 일부 문서 작성, 다수의 평가에 폭넓게 사용함
10월의 개선 계획과 측정 기준
  • 지속적인 로컬 사용량 측정과 보고를 수행할 계획임
    • 토큰뿐 아니라 에너지 사용량과 지출을 추적하고, 가능하면 실제로 긍정적인 성과를 얼마나 만들었는지도 살펴볼 필요가 있음
  • 실험 예산을 일상 업무 예산과 함께 확보하고, 어떤 프로토타입을 어떤 방식으로 만들 가치가 있는지 더 신중하게 결정할 계획임
  • 프롬프트 선택과 멀티 에이전트 기법을 개선할 필요가 있음
    • 조율, 탐색, 구현, 검토 에이전트의 역할을 구분하고 목표 범위를 제한하는 방식이 포함됨
    • 고난도 기술은 아니지만 추가로 익혀야 할 영역임
  • 더 효율적인 기법과 모델을 계속 탐색할 계획임
    • Jev 스타일의 의사결정 확산 모델은 그만큼 효율적으로 실행될 수 있다면 유망함
    • 최신 플래그십 모델들도 효율성 면에서 올바른 방향으로 나아가는 것으로 보임
  • 일상적인 개발에서는 저렴한 Flash급 모델 한두 개에 집중하는 방식이 충분히 실용적임
    • 10월에는 효율적인 모델이 AI 추론 작업의 대부분을 담당하도록 하는 것을 목표로 삼음
    • 기준은 토큰 수보다 비용이나 에너지 사용량이어야 함
    • 이후 진행 상황은 11월 Wagtail Space 2026에서 공유할 예정임
그냥 목록으로
원문 보기 ↗