← 목록으로

일일이 과금하기엔 너무 저렴한 토큰

요약
  • AI 사용 비용이 지속적으로 하락하면서 토큰 사용량보다 원하는 품질을 얻는 것이 중요해지고 있으며, AI가 컴퓨팅의 기본 인프라로 자리 잡고 있습니다.
  • 하드웨어와 추론 소프트웨어의 개선으로 같은 작업을 수행하는 데 드는 비용이 급감하면서 비개발자도 소프트웨어를 쉽게 만들 수 있는 환경이 조성되고 있습니다.
  • AI 사용 비용이 계속 내려가면, 토큰을 얼마나 쓰느냐보다 원하는 품질을 얻을 수 있느냐가 중요해지고 AI는 별도 제품을 넘어 컴퓨팅의 기본 인프라로 들어갈 수 있음
  • 최상위 모델의 토큰 단가가 항상 내려가는 것은 아니지만, 모델과 GPU, 추론 소프트웨어의 개선으로 같은 일을 끝내는 데 드는 비용은 줄어들고 있음
  • 이미 Jev 같은 특화 모델을 이용해 자연어 조건으로 텍스트를 검색하거나 PR의 우선순위를 정하는 도구가 등장했으며, 저렴한 AI를 기존 도구 안에 넣는 활용이 늘어날 수 있음
  • 어려운 작업에는 고성능 유료 모델을, 일상적인 작업에는 저렴한 모델을 사용하는 시장에서 소프트웨어의 경쟁력도 코드 자체보다 제품 품질과 운영, 보안으로 옮겨갈 수 있음
  • 사용자에게는 기존 제품을 쓰거나 대안을 찾는 것 외에 “LLM에 만들어 달라고 하기”라는 선택지가 생겼으며, 비개발자도 자신에게 맞는 소프트웨어를 만들기 쉬워짐
저렴한 지능이 인프라가 되는 시나리오
  • 머신러닝 지능을 사용하는 비용은 매년 여러 자릿수 규모로 하락하고 있으며, 둔화 조짐이 없다는 전제에서 저렴한 지능이 보편화될 수 있음
    • 향후 1~2년 안에 LLM이 제품을 넘어 컴퓨팅 전반의 인프라에 통합될 가능성이 있음
    • 3~6년 안에는 현재 최첨단 수준의 LLM을 일반적인 하드웨어에서 로컬로 실행할 가능성이 있음
    • 가까운 시기에 사용량 자체보다 품질과 접근성이 AI 사용의 제약이 될 수 있음
  • 여기서 AI는 LLM만 뜻하지 않으며, Jev처럼 텍스트를 생성하지 않지만 능력 면에서 비교할 만한 머신러닝 분류기도 포함함
  • 개선 효과는 독점 모델, 호스팅되는 공개 가중치 모델, 로컬 모델에 동일하게 적용되지 않음
    • 독점 모델의 예는 GPT-6 Astra, 공개 가중치 모델의 예는 GLM-5.3-flash이며, 공개 가중치 모델도 Z.ai 같은 서비스에서 호스팅할 수 있음
    • 로컬 실행용 모델은 대체로 더 작으며, Muse Glimmer와 Qwen3 Coder가 그 예임
모든 AI에 영향을 주는 하드웨어와 모델 개선
  • GPU 전력 효율은 세대가 바뀔 때마다 지수적으로 개선되고 있음
    • Epoch AI 하드웨어 데이터의 시간 대비 GFLOP/J 추세는 효율이 약 2년마다 두 배가 되는 흐름을 보임
    • 1960년대 무어의 법칙 이후 보기 어려웠던 수준의 효율 증가임
  • 모델 가격에서 중요한 구분은 토큰당 비용과 과제당 비용임
    • 토큰은 단어의 일부로, 단어 하나를 표현하는 데 대략 1.5토큰이 필요하며 공급자는 입력과 출력 토큰에 각각 요금을 부과함
    • 최첨단 모델의 토큰당 가격은 일관되게 하락하지 않지만, 과제를 처음부터 끝까지 완료하는 비용은 줄고 있음
    • 작은 모델은 토큰당 가격이 낮아도 더 오래 추론하거나 초안을 수정하느라 같은 과제에 더 많은 토큰을 쓸 수 있음
  • Artificial Analysis의 과제당 비용 비교는 벤치마크 품질과 수행 비용 사이의 파레토 경계 를 보여 줌
    • 2026년 도표에서 Claude Fable-5.1은 비싸고 지능이 높은 쪽, GPT-5.6 Luna는 저렴하고 지능이 낮은 쪽에 위치함
    • 경계 아래의 모델은 해당 기준에서 선택할 이유가 적지만, 다른 평가 기준이 있다면 달라질 수 있음
    • 예외로 중국 모델의 대만 수도 답변 제한, 미국 모델의 선거 연설 작성 제한처럼 특정 응답의 허용 여부가 선택 기준이 될 수 있음
  • 2025년 연말 보고서의 연초/중반/연말 비교에서는 같은 품질의 작업 비용이 낮아지고, 같은 비용으로 가능한 작업 수준이 높아짐
    • 2026년 도표와 비교하면 지능 축의 범위는 비슷하고 저가 모델의 품질 저하 폭은 줄어든 반면, 비용 축은 약 100배 저렴해짐
추론 엔진의 서빙 효율 개선
  • 추론 엔진은 학습된 모델과 입력 텍스트를 받아 GPU에서 실행하는 소프트웨어이며, 아직 미성숙한 상태에서 빠르게 개선되고 있음
    • 엔진에 따라 연간 10~50% 의 개선이 나타남
    • 대량의 토큰을 한 번에 처리하는 오프라인 추론보다, 불규칙하게 들어오는 요청에 빠르게 응답하는 서빙의 효율이 더 빠르게 개선되고 있음
    • 아래 수치는 모두 오프라인이 아닌 서빙 작업 기준임
  • 오픈소스 엔진 vLLM 은 에너지 소비 비교에서 약 15개월 동안 40%의 효율 개선을 보임
    • 비교 대상은 2024년 9월의 0.5.4와 2025년 12월의 0.11.1이며, 배치 크기에 따른 토큰당 에너지 소비량을 비교함
    • 여러 연속 릴리스의 효율을 깔끔하게 비교한 자료는 없지만, 성능 개선 기록도 빠른 발전을 보이며 v2에서 v3로의 성능 향상은 에너지 효율 개선과 대략 비례함
  • NVIDIA의 MLPerf 스택 도 2.0에서 2.1로 바뀌며 최대 50% 효율 개선을 보임
  • Intel은 MLPerf 6.0과 6.1 사이의 소프트웨어 최적화 만으로 처리량이 2.4배 늘어나는 결과를 공개함
    • 이는 에너지 효율이 아닌 처리량 측정이므로 직접 비교할 수 없음
    • 다만 하드웨어가 고정된 상태에서 소프트웨어만 바뀌었으므로, 상당 부분이 효율 개선에도 반영됐을 가능성이 있음
호스팅 AI의 연산 효율과 MoE
  • 초기 밀집 모델은 모든 입력에 대해 모델의 모든 부분을 활성화하지만, 전문가 혼합(MoE) 은 불필요한 전문 계층을 비활성화해 같은 출력 품질에 필요한 연산량을 줄임
  • 관련 연구의 비교에서는 파라미터가 6B에서 0.8B로 약 7배 작아져도 같은 벤치마크 성능을 달성할 수 있음
    • 같은 품질에 필요한 모델 비용과 메모리 사용량이 줄어듦
    • 실제로는 같은 품질에 연산을 덜 쓰기보다 같은 연산량으로 더 좋은 출력을 얻는 데 활용되므로, 토큰/J보다 품질/J가 빠르게 개선됨
  • 로컬 실행에서는 MoE의 이점이 제한적이며, 사용하려는 전문가를 메모리에 보관해야 하기 때문임
    • mlx-flash처럼 필요한 계층을 그때그때 메모리에 불러오는 프로젝트는 있지만, 이는 실행을 가능하게 할 뿐 빠르게 만들지는 못함
로컬 AI의 메모리 제약과 Mamba
  • 로컬 LLM의 큰 제약은 막대한 RAM 요구량이며, AI 기업들의 구매로 인한 메모리와 저장장치 수급 압박도 있음
    • 최근 모델은 필요한 RAM을 5분의 1 이하로 줄이고 있음
  • 전통적인 Transformer는 입력 전체에 대한 정보를 계층별로 보관하는 반면, Mamba 는 일부 정보가 손실된 입력 요약을 기억함
    • 코딩 에이전트의 컨텍스트 압축을 모델 내부에서 스트리밍 방식으로 수행하는 것과 비슷하며, 그만큼 효율적임
    • URL을 정확히 기억해 가져오는 작업처럼 세부 정보를 유지해야 하는 경우가 있으므로 Mamba만으로 모든 문제를 해결할 수는 없음
  • Mamba-Transformer 혼합 모델은 같은 토큰 수를 처리하는 데 필요한 메모리를 크게 줄임
    • Nemotron-H-47B는 가중치를 4비트로 양자화하면 32GB VRAM에 100만 토큰 이상을 담을 수 있음
    • 비슷한 품질의 Llama-3.1 60B는 같은 토큰 수에 거의 120GB가 필요하며, 양자화를 사용하지 않으면 요구량은 더 커짐
    • 양자화는 기본 16비트 부동소수점 표현을 8비트나 4비트로 줄이는 방식이며, 비교적 제한적인 품질 손실로 모델을 더 작고 빠르게 만듦
특화 판단 모델 Jev와 Laya
  • 특정 예/아니요 판단에 AI를 한정하면 비용을 약 100배 줄일 수 있음
  • TypeSafe AI의 Jev 는 텍스트를 생성하지 않고 미리 정한 선택지 가운데 판단함
    • 예를 들어 셸 명령이 시스템 프롬프트를 위반하거나 파괴적인 변경을 하는지 물으면 0~100% 확률로 응답함
  • System One + Jev의 입력 가격은 100만 토큰당 0.042달러, 즉 10억 토큰당 42달러이며, 출력은 계량 과금할 필요가 없을 만큼 저렴해 무료임
    • 비교 대상인 기존 LLM의 입력 가격은 100만 토큰당 0.20~10달러이고, 출력은 입력보다 약 5배 비쌈
    • 토큰을 약 3분의 2단어, 책 한 권을 평균 8만 단어로 잡으면 책 다섯 권을 읽는 데 약 3센트이며, 42달러로 역사상 쓰인 모든 책의 약 1만 분의 1을 읽는 규모임
    • TypeSafe는 현재 가격이 보조금에 의존하지 않는다고 입증할 수는 없으며, 장기적인 지속 가능성은 시간이 지나야 증명할 수 있다고 인정함
    • 회사는 향후 가격이 오르기보다 내려갈 것으로 예상함
  • jgrep 은 Jev를 직접 호출해 텍스트가 자연어 조건에 맞는지 판단하는 개발 도구임
    • 새 AI 모델 발표나 출시를 알리는 제목을 찾는 식의 검색이 가능함
    • 약 200ms, 약 0.001센트로 확률을 반환하며, 줄을 동시에 판단하되 입력 순서대로 출력해 파일과 tail -f 모두에 사용할 수 있음
    • Hacker News 제목 994개를 조건 하나로 평가했을 때 4.6초와 0.012달러가 들었으며, 조건 세 개를 동시에 평가해도 소요 시간은 같았음
  • Jev triage 는 열린 풀 리퀘스트를 우선순위대로 보여 주는 TUI임
    • 라벨이 아닌 모든 댓글을 읽어 우선순위를 정하며, 전담 분류 팀을 대체하지는 않지만 보조 도구로 쓸 수 있음
  • Laya 는 독점 모델인 Jev와 달리 공개 가중치 모델이며, 로컬에서 실행할 만큼 작음
    • 미세 조정하면 Jev보다 빠르고 정확할 수도 있지만, 완성된 제품이 아닌 코드베이스에 가까움
    • 호스팅 서비스가 없어 직접 설정해야 하고, 미세 조정하지 않으면 성능이 낮아 머신러닝 지식이 필요함
    • 컨텍스트가 최대 512바이트라 큰 입력을 처리하는 데 제약이 있음
  • Jev와 Laya는 아키텍처 차원의 개선 여지가 여전히 크다는 점과 머신러닝이 가까운 미래에 확장 한계에 도달하지 않을 것이라는 전망을 뒷받침함
비용 하락을 종합하면
  • 모델, 하드웨어, 엔진 개선을 합쳐 지난 1년의 토큰 비용 하락을 약 2.5자릿수 규모로 추산함
    • 모델의 과제당 비용 효율은 약 100배 개선됨
    • 하드웨어의 토큰당 에너지 효율은 약 1.3배 높아짐
    • 추론 엔진의 토큰당 에너지 효율은 약 1.4배로 늘어남
  • 토큰 가격 외에도 메모리 효율과 특화 작업 비용이 개선되고 있음
    • 새 아키텍처는 같은 RAM에 5배 이상의 토큰을 담아 더 지능적인 모델의 로컬 실행을 가능하게 함
    • Jev와 Laya 같은 특화 모델은 비용을 추가로 10~100배 낮출 수 있음
  • 이 기술들은 아직 미성숙해 더 나아질 가능성이 크며, 개선 효과가 체감하는 지점까지는 아직 멀어 보임
토큰이 도구 호출보다 저렴해질 때
  • 모델 비용과 일반 연산의 전기요금을 페르미 추정 으로 비교하면, 몇 년 안에 모델이 일부 도구 실행보다 저렴해지는 상황도 생각할 수 있음
    • 가격 자료에서 GPT-5.6 Luna는 100만 토큰당 약 0.30달러이며, 도구 호출을 결정할 때마다 1만 토큰을 쓴다고 가정하면 턴당 약 3분의 1센트임
    • 전기요금은 뉴욕과 네덜란드 기준 kWh당 약 25센트, MacBook Air 소비전력은 유휴 상태 10W, 높은 부하에서 30W로 가정함
  • 도구 실행의 추정 전기요금은 다음과 같음
    • grep: 10W로 0.1초 실행하면 0.000007센트, Luna 한 턴보다 약 4.5자릿수 저렴함
    • HTML 파싱: 10W로 1초 실행하면 0.00007센트, 약 3.5자릿수 저렴함
    • cargo build: 30W로 30초 실행하면 0.00625센트, 약 1.5자릿수 저렴함
    • 다만 MacBook Air는 이례적으로 효율적인 하드웨어이며, 처리량 중심으로 조정된 서버는 같은 도구 실행에 약 10배의 전력을 쓸 가능성이 있음
  • 모델이 도구보다 저렴해지면 도구 안에 모델을 넣는 방식이 매력적이 됨
    • jgrep이 이미 그 예이며, 향후 더 넓은 컴퓨팅 인프라에 적용될 수 있음
    • 머신러닝 기반 적응형 빌드 스케줄러는 지금도 가능하지만 상당한 전문성이 필요하며, 범용 모델로 구현할 수 있게 되면 통합이 더 쉬워질 수 있음
공급 측 제번스의 역설과 투자 회수
  • 모델 실행 비용이 낮아지면 투자한 금액당 수익이 커져 기업이 연산 인프라를 더 구축 할 수 있음
    • 효율이 좋아질수록 전체 사용량이 늘어나는 제번스의 역설 에 해당함
    • 가격이 내려가 더 많이 사용하려는 현상은 교통망 논의에서도 자주 등장하는 유발 수요임
  • 저렴한 토큰이 곧 공급자의 수익성 상실이나 거품 붕괴를 뜻하지는 않음

    • 토큰 하나의 가격이 낮아도 추론 사업은 수익성이 있을 수 있음
    • OpenAI와 Anthropic은 다른 대다수 AI 연구소보다 상당히 앞서 있으며, 사용량이 저렴해지는 것과 품질이 저렴해지는 것은 별개임
    • 가장 어려운 과제는 최첨단 연구소의 연산을 구매하고, 일반적인 과제는 공개 가중치 모델이나 이들과 경쟁하는 대폭 할인 요금제를 사용하는 시장이 될 수 있음
    • 공개 가중치 모델이 OpenAI와 Anthropic을 따라잡을지는 아직 열린 문제임
    • 따라잡는다면 투자자가 손해를 보고 미국 경제에도 파급될 수 있음
    • 다만 그 경우에도 NVIDIA의 성장과 기업의 AI 사용은 이어지고 AI 가격은 더 낮아질 수 있어, 기술의 근본적인 흐름은 달라지지 않을 것으로 보임
수요 측 제번스의 역설과 소프트웨어 시장
  • 저렴한 연산을 어디에 쓸지는 불확실하며, 다음 변화들은 가능한 시나리오이지 모두 실현 가능성이 높다는 뜻은 아님
  • 사이버 보안 악화 로 기업들이 공격을 피하기 위해 Cloudflare Access나 내부 전용 AWS/Azure 서비스 같은 호스팅 서비스에 더 의존할 수 있음
  • 연산 자원 자체의 우위가 커져 Oxide Computer Company, AWS, Cloudflare와 대형 클라우드 사업자가 이익을 볼 수 있음
    • 범용 EC2뿐 아니라 추론에 최적화된 특수 GPU 임대가 늘어날 수 있으며, runpod 같은 서비스에서 이미 나타나고 있음
  • 소프트웨어 개발에서 어려운 부분이 알고리듬보다 제품 요구사항, 테스트, 사용자 인터페이스 설계로 이동할 수 있음
    • 고용시장도 크게 달라질 수 있으며, 이상적으로는 QA와 UI/UX 직군이 다시 늘어날 수 있음
  • 소프트웨어 임대 판매는 줄고 운영과 보안의 가치가 커질 수 있음

    • 코드베이스 자체는 경쟁 장벽이 되기 어려워질 수 있음
    • Amazon Managed Streaming for Apache Kafka 같은 서비스는 늘고, JetBrains IDEs나 Blackboard 같은 제품은 줄어들 가능성이 있음
사용자의 네 번째 선택지와 맞춤형 소프트웨어
  • 기존에는 소프트웨어를 사용하거나, 사용하지 않거나, 비슷한 다른 제품을 사용하는 세 가지 선택지가 있었지만, 이제는 LLM에 직접 만들도록 요청하는 선택지가 추가됨
    • 결과물의 품질은 더 좋을 수도 나쁠 수도 있지만, 이전에 없던 선택지가 생긴 것임
    • 기업은 단순히 기능을 가능하게 해 주는 데 그치지 않고 품질로 경쟁해야 함
  • 규제 산업의 기존 사업자는 자유 경쟁 시장보다 큰 이점을 유지할 수 있음
    • 전자의무기록 서비스는 의사가 손으로 감당하기 어려운 양의 기록을 법적으로 보관해야 하므로, 제품이 불편해도 아예 사용하지 않는 선택이 어려움
    • 여기에 전환 비용이 더해지면 소수 기존 사업자가 품질과 무관하게 시장을 장악하는 과점이 생길 수 있음
  • 개인에게 정확히 맞춘 변형 가능한 소프트웨어 를 만들기는 훨씬 쉬워질 수 있음
    • 비개발자에게는 불과 5년 전만 해도 Apple Shortcuts, Salesforce, Excel 스프레드시트 같은 제한적인 영역 밖에서는 상상하기 어려웠던 일임
  • 다음에 무엇이 올지는 알 수 없지만, 저렴한 연산뿐 아니라 저렴한 지능이 존재하는 세계를 전제로 준비할 필요가 있음
그냥 목록으로
원문 보기 ↗