- Jev는 작업마다 별도 분류기를 학습하지 않고도 이메일 분류부터 게임의 행동 선택까지 처리하며, 대형 생성형 LLM보다 빠르고 저렴한 의사결정을 지향함
- 텍스트 분류는 Bag-of-Words에서 RNN, CNN, Transformer로 발전해 왔으며, 좁고 명확한 작업에서는 여전히 저렴한 전용 분류기가 유효함
- IMDb 영화 리뷰 25,000개를 별도 미세 조정 없이 분류해 정확도 96.47%, 총비용 약 0.65달러를 기록함. 테스트 데이터의 학습 포함 여부는 공개되지 않음
- Jev와 비슷한 API를 만드는 것과 다양한 작업에서 잘 작동하는 모델을 만드는 것은 다름. 차별점은 새로운 분류 개념보다 폭넓은 작업에 바로 적용할 수 있는 성능에 있음
- 분류 결과를 자동 처리에 활용하려면 출력 확률이 실제 정답 가능성과 맞아야 함. 확률 보정은 정확도와 별개로, 어떤 판단을 자동 실행하고 어떤 판단을 사람에게 넘길지 결정하는 데 중요함
- Jev는 TypeSafe AI가 공개한 독점 모델로, 별도 미세 조정 없이 다양한 분류 작업을 처리함
- 최신 GPT와 공개 가중치 LLM도 같은 종류의 작업을 수행하며 더 일반적인 의사결정까지 가능하지만, Jev는 분류 작업의 속도와 비용에서 강점이 있음
- 좁고 명확하게 정의된 문제에서는 전용 분류기보다 정확하거나 빠르거나 저렴하지 않을 수 있지만, 작업별 전용 모델보다 범용성이 높음
- TypeSafe AI는 의사결정 성능이 GPT-5.6 Luna와 대등하면서 훨씬 빠르고 저렴하다고 주장함
- 지원 티켓과 이메일 분류뿐 아니라 Choice API를 이용한 실시간 Tetris도 시연됨
- 작업마다 학습 데이터를 모으고 분류기를 미세 조정하지 않아도 된다는 점은, 다양한 텍스트를 생성하는 범용 채팅 모델이었던 ChatGPT의 등장과 비슷한 매력을 분류 영역에 제공함
- Bag-of-Words는 길이가 다른 텍스트를 고정 크기 벡터로 바꿔 나이브 베이즈, 로지스틱 회귀, SVM, 랜덤 포레스트, XGBoost 같은 전통적인 분류기에 입력하는 방식임
- 뉴스 기사 분류와 이메일 스팸 필터링 등에 쓰이며, Gmail의 초기 스팸 필터도 이 표현과 나이브 베이즈를 사용했다고 알려져 있음
- 2014년 나이브 베이즈 튜토리얼에서 이 접근법을 자세히 확인할 수 있음
- 학습 데이터의 고유 단어로 어휘 사전을 만들고, 각 단어에 벡터 위치를 할당해 문서 내 등장 횟수를 기록함
- 의미 기여가 작은 “a”, “the” 같은 불용어는 선택적으로 제거할 수 있음
- 어휘가 50,000개라면 입력이 10단어든 300,000단어든 벡터 크기는 50,000이며, 대부분의 원소는 0임
- 원시 빈도 대신 TF-IDF 같은 정규화 방식을 사용할 수도 있음
- 레이블이 있는 데이터로 학습하면, 로지스틱 회귀는 특정 단어와 빈도가 스팸 같은 클래스의 확률을 높이거나 낮추도록 가중치를 학습함
- 특정 단어가 강한 단서를 주는 문제에서는 계산 비용이 낮고 충분히 정확한 결과를 빠르게 얻을 수 있음
- 가장 큰 한계는 단어 순서를 잃는 것임
- “개가 사람을 문다”와 “사람이 개를 문다”에 해당하는 영어 문장은 같은 벡터가 됨
- 단어 쌍이나 더 긴 연속 단어인 n-gram을 특징으로 추가하면 국소적인 순서를 일부 보존하지만 어휘 크기가 증가함
- 위험도가 낮은 응용과 초기 기준선에는 여전히 유용하며, 로지스틱 회귀 구현은 균형 잡힌 IMDb 영화 리뷰 데이터셋에서 정확도 89.9% 를 기록함
- Bag-of-Words를 다층 퍼셉트론에 넣을 수도 있지만, 문장 구조와 단어 순서의 손실은 그대로 남음. CNN과 RNN은 단어 임베딩을 입력받아 이 한계를 피할 수 있음
- 단어 임베딩은 문서 전체를 단어 빈도로 표현하는 대신, 개별 단어를 학습된 수치의 밀집 벡터로 표현함
- Word2Vec이나 GloVe로 모델 외부에서 학습하거나, 신경망의 임베딩 계층을 함께 학습하고 조정할 수 있음
- 전통적인 임베딩은 조회 시 문맥에 독립적이므로 “river bank”와 “bank account”의 “bank”에 같은 벡터를 사용함
- Working with Text Data는 단어와 토큰 임베딩을 다루며, 일반적으로 단어 하나를 토큰 하나로 다루는 Word2Vec과 서브워드 토큰을 사용하는 LLM의 차이도 이해할 수 있음
- Understanding the Difference Between Embedding Layers and Linear Layers는 임베딩이 선형 계층 및 행렬 곱과 수학적으로 동등해지는 조건을 다룸
- RNN은 단어를 하나씩 읽고 현재 임베딩과 이전 은닉 상태를 결합함
- 고정 크기 은닉 상태가 지금까지 처리한 텍스트를 요약하며, 단어 순서가 바뀌면 상태 갱신 순서도 달라짐
- 매 단계에서 같은 계층을 재사용하므로 가변 길이 입력을 처리할 수 있음
- 학습의 어려움을 줄이기 위해 학습 가능한 게이트로 정보 보존과 갱신을 제어하는 변형들이 등장함
- LSTM은 1997년, GRU는 2014년에 등장했으며, 2024년에는 xLSTM이 공개됨
- 상태 공간 모델도 고정 크기 상태를 순차 갱신하는 아이디어에 기반함. Transformer 어텐션보다 저렴하지만, 상태의 정보 보존 용량과 순차 처리 요구가 병목으로 남음
- 어텐션은 Transformer보다 먼저 RNN을 위해 개발됐으며, 2017년 Transformer 등장 이후 많은 NLP 작업에서 RNN이 점차 대체됨
- 관련 흐름은 Understanding Large Language Models에서 확인할 수 있음
- 처음부터 학습한 LSTM 분류기는 IMDb에서 정확도 85.66% 로, Bag-of-Words와 로지스틱 회귀의 89.9%보다 낮았으며 높은 학습 정확도에 비해 상당한 과적합이 나타남
- 더 큰 데이터로 사전 학습한 뒤 목표 데이터에 미세 조정하는 전이 학습은 결과를 크게 개선할 수 있음. 2018년 ULMFiT는 IMDb 테스트 정확도 95.4% 를 달성함
- 텍스트 CNN은 이미지 패치에 필터를 적용하는 것처럼 인접한 단어 임베딩 구간에 학습된 필터를 적용함
- “the movie had surprisingly good acting”에 크기 3 필터를 한 단어씩 이동하면 “the movie had”, “movie had surprisingly”, “had surprisingly good”, “surprisingly good acting”의 네 구간을 처리함
- 분류 헤드 앞에서 특징 맵을 평탄화하면 정보를 보존하지만 입력 길이에 따라 벡터 크기가 달라짐. 전역 최대 풀링을 쓰면 입력 길이에 독립적인 표현을 만들 수 있음
- 위치별 필터 계산을 병렬화할 수 있어 RNN의 단계별 의존성을 피함
- IMDb CNN 구현은 정확도 90.07% 를 기록했으나, 성능은 아키텍처에 크게 좌우됨
- 컴퓨터 비전에서도 ImageNet top-1 정확도는 AlexNet 약 62.5%, ConvNeXt V2-H 88.9%처럼 크게 달라짐
- 2017년 Attention Is All You Need의 원래 Transformer는 번역용 인코더-디코더였지만 텍스트 분류에도 적용할 수 있음
- 초기에는 Google 중심의 인코더 계열 BERT와 OpenAI 중심의 디코더 계열 GPT가 두 흐름을 형성함
- BERT 계열은 분류에 자연스럽게 맞으며, 생성에 강한 GPT 계열도 제로샷/퓨샷 분류가 가능함
- 대규모 텍스트로 사전 학습한 모델을 목표 데이터에 미세 조정하는 접근을 활용할 수 있음
- BERT 계열은 첫 위치의 분류 토큰을 이용해 분류기를 미세 조정함
- 2018년 BERT 이후에도 개선이 이어졌으며, 2024년 ModernBERT는 적은 미세 조정 노력으로 IMDb에서 약 95% 를 기록함
- 분류 실험 코드는 공개돼 있으며, 하이퍼파라미터 조정으로 추가 1~2% 개선 여지가 있을 수 있음
- GPT 계열에 직접 분류를 요청할 수도 있지만, 특정 도메인에서 구조화된 출력을 원한다면 취약하고 비효율적일 수 있음
- 전체 어휘를 출력하는 계층을 작은 분류 헤드로 교체할 수 있음
- 자기회귀 어텐션 마스크 때문에 분류에 사용하는 토큰이 전체 입력 정보를 볼 수 있도록 설계해야 함
- 구현상의 세부 사항은 Building an AI Text Detector From Scratch에서 다룸
- GPT 계열은 Qwen 3 0.6B부터 Kimi, GLM, DeepSeek까지 현대적인 공개 가중치 모델 선택지가 많음
- 10억 개가 넘는 파라미터를 분류에 사용하는 것은 효율 면에서 과할 수 있음
- GPT-2 124M은 IMDb에서 약 92% 를 기록했으며, 더 크고 새로운 Qwen3 같은 모델은 더 좋은 성능을 낼 가능성이 있음
- 2019년 Google의 T5는 인코더-디코더 구조를 활용함
- 번역 데이터로 지도 학습한 원래 Transformer와 달리, 레이블 없는 텍스트의 일부 구간을 가리고 디코더가 복원하는 구간 손상(span corruption) 방식으로 사전 학습함
- 분류 헤드를 추가하거나 디코더가 “positive”, “negative” 같은 레이블을 직접 생성하는 텍스트 간 분류를 수행할 수 있음
- GPT 계열은 별도 학습 없이도 텍스트 간 분류를 잘하는 경우가 많지만, T5는 목표 도메인에 맞춰 추가 미세 조정하는 것이 일반적임
- 최근 인코더-디코더 변형으로 DeepSeek V4.1 Flash도 있으나, T5의 양방향 인코더와 달리 인과적 인코더를 사용함
- Jev는 터미널의 curl이나 Python API로 사용할 수 있으며, 세 가지 주요 API를 제공함
- Choice API: 명시적인 후보 중 하나를 선택하는 이진/다중 클래스 분류에 적합함
- Noul API: 질문에 대한 “yes” 확률을 반환하며, 이진 분류 또는 여러 질문을 통한 다중 레이블 분류에 적합함
- Score API: 0, 1, 2처럼 평가 기준의 단계에 따른 점수를 반환하는 순서형 분류에 적합함
- Choice는 선택한 레이블과 클래스별 확률 외에 confidence를 반환함
- confidence는 확률 분포가 얼마나 집중돼 있는지를 요약하며, 선택된 클래스의 확률과는 다른 값임
- 문서에 따르면 반환 확률은 잘 보정돼 있음
- Noul에 금융, 정치, 기술 관련 여부를 각각 질문하면 독립적인 확률을 얻으며, 이 확률들의 합이 1일 필요는 없음
- 텍스트에 여러 레이블을 붙일 때는 Noul이 적합하고, 최종 답이 하나라면 Choice가 편리함
- 같은 리뷰 예시에서도 긍정 확률은 Choice 1.0, Noul 0.98로 달랐음
- IMDb 테스트 리뷰 25,000개를 분류한 결과는 다음과 같음
- Choice: 정확도 96.47%, 정답 24,117개, 실행 시간 22분 24초, 입력 15,456,663토큰, 총비용 0.6492달러를 기록함
- Noul: 정확도 96.20%, 정답 24,050개, 실행 시간 23분 3초, 입력 15,106,663토큰, 총비용 0.6345달러를 기록함
- 두 API의 작은 성능 및 시간 차이는 무작위 변동일 수 있으며, Choice를 같은 테스트 데이터에 다시 실행해도 결과가 조금 달랐음
- 대규모 모델 서빙에서는 배치에 따라 GPU 커널의 부동소수점 연산 순서가 달라져 비결정성이 발생할 수 있음. 관련 내용은 Thinking Machines의 분석에서 다룸
- 결과는 좋지만, IMDb 테스트셋이 Jev 학습에 포함됐는지는 알 수 없음
- 비교한 ModernBERT는 DGX Spark에서 미세 조정 23분, 테스트 평가 7분이 걸렸으며, 가장 좋은 설정은 Jev와 비슷한 정확도를 보임
- 추가 하이퍼파라미터 조정으로 1~2% 개선 여지가 있을 수 있고, 양자화나 더 빠른 하드웨어로 추론 시간을 줄일 수 있음
- 다만 영화 리뷰에 맞춘 모델은 추가 미세 조정 없이 Tetris나 다른 작업을 처리하지 못함
- 일회성 작업에는 저렴한 LLM을 쓰고 반복 작업에는 전용 분류기를 학습하는 기존 선택 사이에서, Jev는 LLM 비용과 미세 조정 수고를 함께 줄일 수 있음
- 매우 대량으로 처리하며 특정 작업의 속도와 정확도를 극대화하려면 여전히 전용 모델 미세 조정이 타당함
- ModernBERT나 GPT 계열에 Jev 형태의 API를 붙이고 여러 분류 작업으로 미세 조정하는 것은 비교적 간단함
- 그러나 Tetris를 포함한 낯선 작업까지 잘 처리하려면 광범위한 학습과 평가가 필요함
- 가변 개수의 선택지를 지원하려면 BERT, GPT, T5에 출력 노드가 하나인 점수 헤드를 붙일 수 있음
- 고객 티켓의 “billing”, “technical”, “account” 같은 후보마다 입력 텍스트, 작업 지시, 후보 설명을 함께 넣음
- 같은 헤드가 각 후보 표현을 하나의 스칼라 점수로 바꾸고, 후보 점수 전체에 소프트맥스(softmax)를 적용해 확률과 최종 선택을 얻음
- 후보 수가 바뀌어도 학습된 가중치와 편향은 그대로 유지됨
- 헤드에 전달할 표현은 어텐션 구조에 따라 달라짐
- BERT는 마지막 계층의 [CLS] 은닉 상태를 사용하며, 선택적으로 풀링 계층을 거침
- GPT는 앞선 텍스트, 지시, 후보 설명을 모두 볼 수 있는 마지막 비패딩 토큰의 은닉 상태를 주로 사용함
- 모델 본체와 점수 헤드를 교차 엔트로피 손실로 함께 미세 조정하면, 아키텍처 변경 없이 선택지 수와 설명을 바꿀 수 있음. 낯선 작업에서의 성능은 학습 데이터에 달려 있음
- 같은 방식은 RNN과 CNN에도 적용할 수 있지만, Transformer는 대규모 사전 학습의 이점을 잘 활용하고 어텐션으로 문맥 정보를 활용하므로 작업별 미세 조정 없는 일반화에 더 유리할 가능성이 있음
- Jev의 아키텍처, 학습 알고리듬, 구체적인 데이터 구성은 공개되지 않음
- 낮은 지연 시간을 근거로 ModernBERT와 비슷한 작은 모델일 수 있다는 추측은 있지만 확인된 사실은 아님
- 전문 팀이 장기간 개발한 모델의 폭넓은 성능을 공개 데이터로 일주일 학습해 재현하기는 어려움
- TypeSafe AI CEO는 학습 데이터가 100% 합성 데이터이며, 단순히 LLM이 생성한 결과물과는 다르다고 밝힘
- 데이터 선별과 구성에 상당한 노력이 들어갔을 것이라는 추정은 가능하지만 세부 방식은 비공개임
- 소규모 사회과학 텍스트 분류 실험에서는 하이퍼파라미터 조정으로 약 2~5% 개선한 반면, 약 300개였던 데이터의 수동 레이블링을 늘려 규모를 두 배로 만들자 10~20% 이상의 정확도 개선을 얻음
- 추가 조정보다 데이터 확장이 효과적인지 판단하려면 학습 곡선을 확인하는 것이 유용함
- TypeSafe AI는 공개 소개에서 새 아키텍처, 효율을 위한 병렬 샘플러, RLCD(Reinforcement Learning for Calibrated Decisions) 학습 방식을 사용했다고 밝힘
- 확률 보정(calibration) 은 모델의 확률 추정이 실제 관측 빈도와 맞도록 조정하는 과정임
- 긍정 확률 74%와 54%는 임계값 50%에서 모두 긍정으로 분류되지만 확신의 정도는 다름
- 제대로 보정됐다면 긍정 확률을 약 74%로 예측한 리뷰 집단에서 실제 긍정 리뷰도 약 74%여야 함
- 확률값은 평가 없이 신뢰할 수 없으며, 보정에는 별도의 레이블 검증 데이터를 사용함
- 클래스 소속 확률을 실제 운영에서 활용하려면 보정 평가가 필요하며, scikit-learn 문서에 관련 기법이 정리돼 있음
- AI 탐지기 실험에 사용한 온도 스케일링은 소프트맥스 전에 로짓을 양수 온도 T로 나눔
- 모델 가중치를 고정하고 보정 데이터의 교차 엔트로피를 최소화하도록 T를 학습함
- T > 1이면 가장 높은 확률의 확신을 낮추고, 0 < T < 1이면 높임
- 새 예측에도 같은 온도를 적용하며, 로짓 순서는 유지되므로 최댓값으로 선택하는 클래스는 바뀌지 않음
- 2025년 Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty의 RLCR(Reinforcement Learning with Calibration Rewards) 은 Jev의 RLCD와 보정 목표가 유사하지만, 두 방법의 공식적인 연관성은 확인되지 않음
- RLVR은 일반적으로 정답에 1, 오답에 0을 보상하는 반면, RLCR은 부정확한 확신 추정에 추가 벌점을 부과함
- 오답에 확신 90%를 부여하면 보상은 -0.81, 확신 20%라면 -0.04임
- 정답에 확신 90%를 부여하면 보상은 0.99임
- 이 제곱 오차 항은 답이 맞을 확률에 대한 Brier 벌점에 해당함
- 실험의 Qwen2.5-7B는 같은 응답에서 추론, 답, 불확실성 분석, 0~1 사이 확신값 q를 순차적으로 생성함
- 불확실성 분석은 누락된 근거, 모호한 표현, 의심스러운 가정, 추론 오류 가능성을 점검함
- 프롬프트는 답의 수정안을 제안하기보다 구체적인 불확실성을 찾도록 요청함
- HotpotQA에서 RLCR은 RLVR 대비 기대 보정 오차(ECE)를 0.37에서 0.03으로 낮췄으며, 정확도는 RLVR 63.0%, RLCR 62.1%로 비슷했음
- 다른 6개 데이터셋에서는 평균 ECE가 0.46에서 0.21로 줄고, 정확도는 53.9%에서 56.2%로 높아짐
- 비교 방식인 RLVR + Classifier의 분류기는 생성된 답이 맞는지를 예측하는 지도 학습 이진 분류기임
- 추론 텍스트를 생성하지 않고 분류 헤드의 결정과 확률에 직접 보정 보상을 적용하는 변형도 생각할 수 있음
- 모델 본체와 헤드를 함께 학습하는 RLCR 기반 변형이지만, Jev의 RLCD가 이렇게 동작하는지는 알 수 없음
- RLHF의 대안으로 교차 엔트로피 형태의 목적함수를 사용하는 DPO처럼, 분류기에도 교차 엔트로피와 Brier 손실을 직접 결합할 수 있음. ModernBERT 실험에서는 일반적인 온도 스케일링 대비 소폭 개선을 보임
- 이상적인 조건에서는 교차 엔트로피 자체가 올바른 확률 추정을 유도하므로 추가 보정 벌점이 필요하지 않음
- 앞면 확률 80%인 동전을 대표성 있는 데이터로 학습하면, 교차 엔트로피 최소화는 앞면 80%, 뒷면 20%를 학습하도록 유도함
- Strictly Proper Scoring Rules, Prediction, and Estimation에 따르면 Brier 손실도 같은 이론적 최적점을 가짐
- 현실에서는 유한한 데이터로 학습하므로, 대부분의 학습 예제를 맞힌 뒤에도 확신을 높여 학습 교차 엔트로피를 더 낮출 수 있음
- 이렇게 얻은 확률은 테스트 데이터나 새 데이터에 잘 일반화되지 않을 수 있음
- On Calibration of Modern Neural Networks는 분류 정확도가 좋아지는 동안에도 확률 추정은 과적합될 수 있음을 보임
- 테스트 정확도가 개선돼도 테스트 교차 엔트로피는 나빠질 수 있음
- Brier 손실은 학습 중 예측 오류에 부여하는 가중 방식을 바꾸지만, 보정 개선 여부는 별도 검증 데이터로 확인해야 함
- ModernBERT 실험의 추가 이득은 매우 작았으며, 항상 도움이 된다고 일반화할 수 없음
- 교차 엔트로피를 직접 최소화하지 않는 강화 학습에서는 Brier 항을 사용하는 이유가 더 명확함. 정답 보상과 별도로 정확한 확신을 보고하도록 유도하기 때문임
- Jev는 작업마다 분류기를 미세 조정할 시간을 줄이면서, GPT-6 같은 큰 LLM의 비용도 아끼려는 사용자에게 적합함
- 실용적인 응용으로 이메일 분류, 추가 스팸 필터, 우선순위 결정이 있으며, Tetris 같은 게임은 낮은 지연 시간을 보여주는 사례임
- 에이전트 하네스에서는 다음과 같은 보조 역할을 맡을 수 있음
- 문맥에서 프롬프트 주입을 사전 탐지함
- 모델의 추론 노력 수준을 선택함
- 등록된 스킬 라이브러리에서 skill.md를 선택함
- 평가나 자기 개선을 위한 판정기로 사용함
- 문맥 구성에 필요한 관련 파일을 찾음
- 짧은 기간에 등장한 Jev 관련 프로젝트 2,170개를 분석한 arXiv 조사도 공개됨
- 출시 후 등장한 많은 Jev 복제 프로젝트는 ModernBERT나 Qwen을 지도 미세 조정(SFT) 하고 유사 API를 붙인 형태임
- 확인한 프로젝트들은 Jev만큼 폭넓은 작업에서 같은 수준의 성능을 내지 못했음
- 초기 LLaMA 기반 Alpaca와 GPT-6처럼, 접근법이 비슷해도 실제 작업 성능은 크게 다를 수 있음
- 약 3년간 개발돼 온 GLiNER는 근본적으로 같은 모델은 아니지만 유사한 용도로 활용할 수 있음. 다만 인용한 벤치마크에서는 Jev가 더 강했음
- 좋은 공개 가중치 대안의 필요성은 비용보다 개인정보 보호에 있음
- 강력한 로컬 하드웨어에서 더 빠르게 실행할 가능성도 기대할 수 있음
- 전문 팀이 수개월 수행한 개발과 평가를 일주일 만에 재현하기는 어렵지만, 조 단위 파라미터 모델보다 작은 모델이라는 점은 개발 부담을 줄일 여지가 있음
- OpenAI는 2026년 9월 29일 DevDay에서 Decisions API를 발표함
- 정해진 유한 개의 답을 가진 사용자 정의 질문에 Luna의 지능을 집중해 실시간 의사결정을 수행함
- 텍스트나 이미지 문맥을 입력받아 콘텐츠 분류, 요청 라우팅, 에이전트의 다음 행동 선택에 쓸 답을 반환함
- 당일 제한적 프리뷰를 시작했으며, 수일 내 폭넓은 공개를 계획함
- 추가로 시험한 Contrastive Language Models는 IMDb 정확도 82.90%를 기록했고 Tetris 테스트에 실패함
- Laya는 IMDb에서 92.33%로 더 높았지만, Tetris 테스트에서는 더 좋지 않은 결과를 보임
- 비교 기준인 Jev의 Choice 정확도는 96.47%임
- Jev가 비영어권 법률 검토에 약하다는 독자 제보도 있으나 별도로 검증된 결과는 아님
- 저렴한 번역 모델인 GPT-6 Luna 등을 연결하면 작은 지연 시간 증가와 함께 다국어 약점을 우회할 수 있음
- Jev의 핵심은 완전히 새로운 분류 개념보다 다양한 작업에서 즉시 쓸 수 있는 성능에 있음
- 전문가의 전용 모델 미세 조정은 계속 유효하지만, Jev나 유사 모델로 충분히 좋은 결과를 쉽게 얻을 수 있어 전용 모델을 학습할 필요성이 더 분명해야 함
- Jev 계열이 새로운 능력을 열거나 이전에 불가능했던 문제를 해결할 것으로 기대되지는 않음
- 대신 GPT-6, Opus 5.5 같은 비싼 모델을 보조해 하네스 내부의 의사결정을 담당하면, 향후 에이전트 실행을 더 빠르고 저렴하게 만들 수 있음