LLM 대신 "합칠까 말까" 같은 저차원 판단만 확률과 함께 돌려주는 System One 모델 중, 오픈소스 Laya를 개인 Obsidian 플러그인의 중복 노트 판단(지금은 OpenAI API로 처리)에 붙일 수 있는지 직접 실측한 기록. 원조인 TypeSafe Jev는 계정 접근이 아직 열리지 않아 공식 문서로만 비교함
● 어떤 모델인가
- 텍스트를 생성하지 않고, 상황(state)과 타입이 정해진 질문을 주면 choice / score / noul 세 가지 형태로 확률과 함께 답만 돌려줌
- Jev는 프로프라이어터리(2026-09-15 얼리 액세스), Laya는 ModernBERT-large 기반 421M 파라미터, Apache 2.0
● 써보기 전에 두 번 헛다리
- 허깅페이스의 Laya "GGUF" 파일은 llama.cpp 표준 GGUF가 아니라 ggmlc라는 별도 컴파일러 산출물이라 Ollama·LM Studio에서 안 열림
- README 내용까지 똑같은 he-jev/laya(스타 7개)는 미러였고, 원본은 NandhaKishorM/laya(스타 27,891개)
● 속도: 광고한 33ms는 GPU 수치
- GPU 없는 12코어 PC에서 콜드 로딩 23초, 로드 후 메모리 2.7GB, 호출당 평균 1.3초
- README의 33ms·39.5ms는 Tesla T4 GPU 기준이었음
● 정확도: 23건 중 18건(78%)
- 실제로 생겼던 중복 노트 17쌍(정답 "같음") + 직접 만든 "제목만 같고 다른 개념" 6쌍
- 진짜 중복 17건 중 14건, 합성 케이스 6건 중 4건 정답
● 진짜 문제는 정확도가 아니라 캘리브레이션
- 맞힌 답 중에도 confidence 0.01~0.016처럼 동전 던지기 수준이 많았음
- 완전히 다른 노트를 "같다"고 틀리면서 confidence 0.802, 0.896을 붙인 경우가 있었음
- 모델 로드 시점에 이미 "이 체크포인트는 temperature 값이 손상돼 confidence를 믿을 수 없다"는 경고가 떠 있었음 — "확률을 믿고 임계값으로 자동 게이팅"이라는 System One 모델의 전제가 무너진 상태
● 파인튜닝하면? 병목은 GPU가 아니라 데이터
- 공식 절차는 Kaggle 무료 2×T4에서 RLCD로 학습하고 최대 400개를 떼어 temperature를 다시 맞추는 방식이라 GPU는 문제가 아님
- 필요한 건 "state + 질문 + teacher 모델의 선택지별 확률 분포"이고 데모만 1,200건(질문 6,000개), 벤치마크는 3만 건 규모 — 손에 있는 실측 케이스는 23개
● Jev는 반대로 파인튜닝 자체가 불가
- 고객 데이터로 파인튜닝·LoRA 불가, 모든 계정이 같은 가중치 공유, 커스터마이징은 state·instructions·criteria 프롬프트 레벨뿐
● 결론
- Laya는 지금 단계에선 채택하지 않고 기존 OpenAI API 판단 유지, Jev는 계정 접근이 열리면 재검토
- 78%라는 숫자만 봤으면 "써볼 만하다"고 넘어갔을 것 — 확신 값은 답 하나하나를 열어봐야 하고, 벤치마크 숫자는 어떤 조건(GPU/CPU)에서 나온 건지까지 봐야 함