← 목록으로

판단 전용 모델 Laya 실측 – 정확도 78%, 틀린 답에도 confidence 0.9 (파인 튜닝전에 데이터)

요약
  • 개인 노트 중복 판단을 위해 오픈소스 판단 전용 모델 Laya를 실측한 결과, 78%의 정확도를 보였으나 신뢰도(confidence) 캘리브레이션에 문제가 있어 기존 OpenAI API 방식을 유지하기로 했다.
  • Laya는 GPU가 없는 환경에서 호출당 평균 1.3초의 속도를 보였으며, 파인튜닝을 위해서는 대규모 데이터가 필요해 현재 단계에서는 채택되지 않았다.

LLM 대신 "합칠까 말까" 같은 저차원 판단만 확률과 함께 돌려주는 System One 모델 중, 오픈소스 Laya를 개인 Obsidian 플러그인의 중복 노트 판단(지금은 OpenAI API로 처리)에 붙일 수 있는지 직접 실측한 기록. 원조인 TypeSafe Jev는 계정 접근이 아직 열리지 않아 공식 문서로만 비교함

● 어떤 모델인가

  • 텍스트를 생성하지 않고, 상황(state)과 타입이 정해진 질문을 주면 choice / score / noul 세 가지 형태로 확률과 함께 답만 돌려줌
  • Jev는 프로프라이어터리(2026-09-15 얼리 액세스), Laya는 ModernBERT-large 기반 421M 파라미터, Apache 2.0

● 써보기 전에 두 번 헛다리

  • 허깅페이스의 Laya "GGUF" 파일은 llama.cpp 표준 GGUF가 아니라 ggmlc라는 별도 컴파일러 산출물이라 Ollama·LM Studio에서 안 열림
  • README 내용까지 똑같은 he-jev/laya(스타 7개)는 미러였고, 원본은 NandhaKishorM/laya(스타 27,891개)

● 속도: 광고한 33ms는 GPU 수치

  • GPU 없는 12코어 PC에서 콜드 로딩 23초, 로드 후 메모리 2.7GB, 호출당 평균 1.3초
  • README의 33ms·39.5ms는 Tesla T4 GPU 기준이었음

● 정확도: 23건 중 18건(78%)

  • 실제로 생겼던 중복 노트 17쌍(정답 "같음") + 직접 만든 "제목만 같고 다른 개념" 6쌍
  • 진짜 중복 17건 중 14건, 합성 케이스 6건 중 4건 정답

● 진짜 문제는 정확도가 아니라 캘리브레이션

  • 맞힌 답 중에도 confidence 0.01~0.016처럼 동전 던지기 수준이 많았음
  • 완전히 다른 노트를 "같다"고 틀리면서 confidence 0.802, 0.896을 붙인 경우가 있었음
  • 모델 로드 시점에 이미 "이 체크포인트는 temperature 값이 손상돼 confidence를 믿을 수 없다"는 경고가 떠 있었음 — "확률을 믿고 임계값으로 자동 게이팅"이라는 System One 모델의 전제가 무너진 상태

● 파인튜닝하면? 병목은 GPU가 아니라 데이터

  • 공식 절차는 Kaggle 무료 2×T4에서 RLCD로 학습하고 최대 400개를 떼어 temperature를 다시 맞추는 방식이라 GPU는 문제가 아님
  • 필요한 건 "state + 질문 + teacher 모델의 선택지별 확률 분포"이고 데모만 1,200건(질문 6,000개), 벤치마크는 3만 건 규모 — 손에 있는 실측 케이스는 23개

● Jev는 반대로 파인튜닝 자체가 불가

  • 고객 데이터로 파인튜닝·LoRA 불가, 모든 계정이 같은 가중치 공유, 커스터마이징은 state·instructions·criteria 프롬프트 레벨뿐

● 결론

  • Laya는 지금 단계에선 채택하지 않고 기존 OpenAI API 판단 유지, Jev는 계정 접근이 열리면 재검토
  • 78%라는 숫자만 봤으면 "써볼 만하다"고 넘어갔을 것 — 확신 값은 답 하나하나를 열어봐야 하고, 벤치마크 숫자는 어떤 조건(GPU/CPU)에서 나온 건지까지 봐야 함
그냥 목록으로
원문 보기 ↗