Jeff vs Jev, 같은 문항으로 재 보니: 종합 점수와 선택지 26개 한계
Jeff 자체 벤치마크 4,599문항에서 Jev 85.7, Jeff-2B 83.0이었습니다. README의 83.1 대 83.0은 다른 표본끼리 비교한 값입니다. 제 측정에서 Jeff는 27번째 이후 선택지를 고르지 않았습니다.

Jeff vs Jev, 같은 문항으로 재 보니: 종합 점수와 선택지 26개 한계
Jeff는 Qwen3.5-0.8B와 2B를 파인튜닝한 오픈 판단 모델이고, Jev와 같은 요청 형식을 받습니다. README는 공개 벤치마크 다섯 개 종합에서 Jeff-2B 83.1, Jev 83.0으로 Jeff를 그 줄의 승자로 표시합니다. 그러면서 Jev 숫자는 "같은 벤치마크의 다른 표본에서 잰 것"이라고 분명히 적어 두었습니다.
Jev API와 Kev vs Jev에서 쓴 측정 도구가 이미 있어서, Jeff의 벤치마크를 Jeff 자신의 스크립트로 다시 만들고, 같은 4,599문항을 Jev, Jeff-0.8B, Jeff-2B, Kev-9B에 모두 돌렸습니다. 이어서 앞선 글에서 쓴 데이터셋 여섯 개에도 Jeff를 돌렸습니다.
요약
- 같은 문항에서는 Jev가 앞섰습니다. Jev 85.7, Jeff-2B 83.0입니다(짝지은 검정 p < 0.001). Financial PhraseBank와 RAGTruth에서는 Jeff-2B가 확실히 나았고, BBH, JudgeBench, WinoGrande에서는 확실히 뒤졌습니다.
- 종합 점수는 다섯 벤치마크를 어떻게 합치느냐에 따라 달라집니다. Jeff의 "Overall"은 흔히 쓰는 문항 수 가중 방식인데, 두 벤치마크가 전체 문항의 54%를 차지합니다. 다섯 개를 그냥 평균하면 제 측정에서 79.2 대 85.5입니다.
- 제 측정에서 Jeff는 27번째 이후 선택지를 한 번도 고르지 않았습니다. 선택지 60~150개짜리 의도 분류에서 9~36%였고, 같은 문장에서 Kev-9B와 Jev는 62~83%였습니다. 선택지 순서를 뒤집자 틀리는 문장도 함께 옮겨 갔습니다.
Jeff 벤치마크 재현
Jeff 저장소에는 벤치마크를 만드는 jeff-panel 스크립트가 있습니다. 공개 데이터셋 다섯 개를 고정된 버전으로 받아 정해진 시드로 뽑습니다. BBH 750문항(과제 15개, 50문항씩), Financial PhraseBank 999문장, JudgeBench 350쌍, RAGTruth 1,500건, WinoGrande 1,000문장입니다. 저는 이 스크립트를 고치지 않고 그대로 돌렸습니다. 비교하기 전에, 다시 만든 문항에서 Jeff가 README와 같은 점수를 내는지부터 확인했습니다.
| Jeff-0.8B README | Jeff-0.8B 제 측정 | Jeff-2B README | Jeff-2B 제 측정 | |
|---|---|---|---|---|
| BBH | 64.0 | 64.0 | 68.0 | 67.6 |
| Financial PhraseBank | 96.4 | 96.6 | 96.3 | 96.3 |
| JudgeBench | 62.6 | 62.3 | 64.6 | 64.3 |
| RAGTruth | 86.1 | 86.2 | 88.9 | 88.8 |
| WinoGrande | 68.6 | 69.2 | 79.0 | 79.2 |
| 종합 | 79.1 | 79.3 | 83.1 | 83.0 |
모든 칸이 0.6점 이내로 맞았습니다. 문항과 서버 설정이 Jeff 쪽과 같다고 볼 수 있습니다.
같은 4,599문항에서 Jev

| Jeff-0.8B | Jeff-2B | Kev-9B | Jev 1.13 | 한쪽만 맞힌 문항 (Jeff-2B / Jev) | |
|---|---|---|---|---|---|
| BBH (750) | 64.0 | 67.6 | 65.7 | 90.5 | 26 / 198, p < 0.001 |
| Financial PhraseBank (999) | 96.6 | 96.3 | 93.7 | 85.3 | 132 / 22, p < 0.001 |
| JudgeBench (350) | 62.3 | 64.3 | 62.3 | 79.4 | 31 / 84, p < 0.001 |
| RAGTruth (1,500) | 86.2 | 88.8 | 68.1 | 81.8 | 192 / 87, p < 0.001 |
| WinoGrande (1,000) | 69.2 | 79.2 | 72.3 | 90.6 | 50 / 164, p < 0.001 |
| Jeff 방식 종합(문항 수 가중) | 79.3 | 83.0 | 73.8 | 85.7 | 431 / 555, p < 0.001 |
| 다섯 개 단순 평균 | 75.7 | 79.2 | 72.4 | 85.5 |
이 문항에서 Jev는 README의 83.0이 아니라 85.7이었습니다. 가장 크게 달라진 것은 Financial PhraseBank로, Jeff가 인용한 77.0 대신 85.3이 나왔습니다. Jeff 패널은 Financial PhraseBank 중 "평가자 전원 일치" 묶음, 즉 모든 평가자가 같은 감성을 붙인 문장만 씁니다. 이 데이터셋에서 가장 쉬운 판본입니다. 그렇게 고른 것 자체는 문제가 없지만, 77.0과 85.3은 같은 시험이 아닙니다.
같은 문항에서 Jeff-2B는 Financial PhraseBank에서 11점, RAGTruth에서 7점 Jev보다 높았습니다. 나머지 셋은 Jev가 앞섰고, WinoGrande 11점, JudgeBench 15점, BBH 23점 차이였습니다. BBH에서는 차이가 23점이었고 여러 단계를 거쳐야 하는 과제에서 가장 벌어졌습니다. 펭귄 표 읽기 문제는 Jev가 50개 중 49개, Jeff-2B가 20개를 맞혔고, 섞인 물건 추적 문제는 47개 대 24개였습니다.
이 숫자를 읽을 때는 학습 데이터도 함께 봐야 합니다. Jeff 학습 데이터 목록에는 RAGTruth와 WinoGrande의 학습 분할, 금융 뉴스 트윗 감성 데이터셋이 들어 있습니다. 패널의 다섯 벤치마크 중 셋이 Jeff가 학습한 과제와 가깝다는 뜻입니다(패널 문항 자체는 학습에서 걸러 냈습니다). Jev는 TypeSafe가 학습 데이터를 공개하지 않아서, 어느 쪽인지 말할 수 없습니다.
다섯 벤치마크 중 어느 것도 학습하지 않은 Kev-9B는 종합에서 Jeff 두 모델보다 낮았습니다. Kev 글에서 본 모습과 같습니다. Kev는 학습 데이터와 비슷한 모양의 과제에 강하고, 이 추론·근거 확인 벤치마크는 그런 과제가 아닙니다.
벤치마크 가중 방식이 종합 점수에 주는 영향
Jeff의 "Overall"은 4,599문항 전체 중 맞힌 비율이라서, 벤치마크마다 문항 수만큼 무게가 실립니다. 흔히 쓰는 집계 방식입니다. 다른 방법은 다섯 벤치마크 점수를 그냥 평균해 벤치마크마다 같은 무게를 주는 것입니다. 이번에는 벤치마크 크기가 달라 두 방식의 결과가 갈립니다. RAGTruth 1,500문항과 Financial PhraseBank 999문항을 합치면 전체의 54%이고, 이 둘이 Jeff가 가장 강한 벤치마크입니다.
Jev의 공개 벤치마크별 점수에 같은 가중치를 주면 정확히 83.0이 나오고, 그냥 평균하면 83.6입니다. Jeff-2B의 공개 점수는 가중하면 83.1, 그냥 평균하면 79.4입니다. 즉 공개 수치로는 집계 방식에 따라 순서가 바뀝니다. 같은 문항으로 재면 두 방식 모두에서 Jev가 앞섭니다.
확률 보정: 전체로는 좋고, 벤치마크별로는 들쭉날쭉
Jeff 모델 카드는 보정 오차를 2B 0.028, 0.8B 0.049로 적었습니다. 제가 4,599문항 전체를 한데 모아 계산하니 0.028과 0.046이 나와, 카드 숫자는 전체를 모은 값으로 보입니다. 벤치마크별로 나누면 Jeff-2B의 보정 오차는 RAGTruth 1.2점부터 JudgeBench 14.6점까지 벌어졌습니다. JudgeBench에서는 평균 최고 확률이 실제 정확도보다 13.3점 높았습니다. Jev는 모든 벤치마크에서 2.5~4.2점이었고 전체로는 1.5점이었습니다.
전체를 모은 숫자가 좋아 보여도 특정 벤치마크는 크게 어긋날 수 있습니다. 반대 방향 오차가 서로 상쇄되기 때문입니다. Jeff-2B는 JudgeBench(+13.3점)와 WinoGrande(+6.9)에서는 확신이 지나쳤고, Financial PhraseBank(−5.1)에서는 모자랐습니다. 앞선 글과 같은 방식으로, 받아들인 답의 정확도를 95%로 지키는 임계값을 잡으면 전체 문항 중 Jeff-2B는 54.4%, Jev는 63.0%를 자동으로 받아들일 수 있었습니다. JudgeBench만 보면 Jeff-2B 0.6%, Jev 29.1%였습니다.

벤치마크 밖에서: 27번째 이후 선택지
다음으로 Kev vs Jev의 8개 조건에 Jeff 두 모델을 돌렸습니다. 문장과 라벨 이름이 모두 같습니다.
| Jeff-0.8B | Jeff-2B | Kev-9B | Jev 1.13 | |
|---|---|---|---|---|
| BANKING77 (선택지 77개) | 23.4% | 16.2% | 82.5% | 76.0% |
| TREC, 라벨 이름만 (6개) | 72.0% | 63.0% | 93.8% | 89.0% |
| TREC, 설명 추가 (6개) | 76.6% | 80.6% | 96.6% | 93.6% |
| AG News, 라벨 이름만 (4개) | 88.0% | 88.5% | 89.0% | 89.0% |
| AG News, 설명 추가 (4개) | 88.0% | 90.0% | 90.5% | 90.0% |
| CLINC150 (150개 + 범위 밖) | 10.8% | 9.2% | 62.0% | 68.5% |
| MASSIVE (60개) | 36.0% | 34.9% | 76.0% | 82.9% |
| 금융 트윗 주제 (20개) | 53.0% | 63.5% | 69.5% | 71.0% |
CLINC150의 범위 밖 100문항은 맞는 선택지가 없어 모든 모델이 틀리므로, 이 과제의 상한은 75%입니다.
점수가 떨어진 곳은 선택지가 26개를 넘는 세 과제였고, 틀린 답은 선택지 위치와 강하게 연관돼 있었습니다. Jeff는 선택지에 A부터 Z, 그다음 AA, AB 식으로 기호를 붙이고, 각 기호의 확률로 답을 읽습니다. 세 과제에서 두 모델이 낸 답 1,458개 가운데 Z 뒤 기호가 붙은 선택지는 하나도 없었습니다. 정답이 앞쪽 26개 안에 있을 때 Jeff-0.8B는 80%를 맞혀 Kev-9B(79%)와 비슷했습니다. Jeff-2B는 69%였습니다. 작은 모델이 BANKING77에서도 앞섰는데(23.4% 대 16.2%), 이유는 확인하지 못했습니다. 정답이 27번째 이후에 있을 때는 두 모델 모두 452문항 중 0개였습니다.

문제가 문장이 아니라 위치 때문인지 확인하려고 BANKING77 선택지 77개의 순서를 뒤집어 Jeff-2B를 다시 돌렸습니다. 원래 0개를 맞혔던 102문장에서 25개를 맞혔고, 반대로 정답이 Z 뒤로 밀려난 문장은 0개가 됐습니다. Z 뒤에 있는 정답 선택지가 받은 확률은 중앙값이 0.0004였습니다. README는 선택지를 최대 255개까지 쓸 수 있고 "선택지는 무엇이든 될 수 있다(고객 지원 대기열, 사용자 의도, 검수 라벨, 음성 명령, 게임 동작)"고 적었으며 서버도 255개를 받지만, 이번 측정에서 두 모델은 26번째 뒤 선택지를 전혀 쓰지 않았습니다. MASSIVE는 Jeff 학습 데이터에 있는데도 35~36%였습니다. 정답 175개 중 102개가 Z 뒤에 있었기 때문입니다.
Jeff를 쓴다면 질문 하나에 선택지를 26개 이하로 두세요. 코드에서 후보를 먼저 추리는 방법이 있습니다. AG News에서 Jeff 두 모델은 Jev와 기사 네 건 이내였습니다(p ≥ 0.29). 선택지 6개인 TREC에서는 Jev보다 13~26점 낮았으니, 선택지 위치만으로 모든 차이가 설명되지는 않습니다.
어느 쪽을 쓸까
- 금융 감성 분류나, 답변이 근거 문서와 맞는지 확인하는 일(RAGTruth 유형)이라면 같은 문항에서 Jeff-2B가 Jev보다 나았고, 로컬에서 돕니다.
- 추론, 두 답변 중 더 나은 쪽 고르기, 대명사가 가리키는 대상 찾기라면 Jev가 11~23점 앞섰습니다.
- 선택지가 26개를 넘는다면 Jeff는 피하거나 먼저 26개로 추리세요. Kev와 Jev는 150개도 다뤘습니다.
이 결과의 한계
Jev는 한 버전(jev-1.13.0)만 쟀습니다. Jeff 패널은 Jeff가 고른 벤치마크와 표본이고, README와 비교할 수 있도록 그대로 썼습니다. JevBench 어려운 문항과 Jeff의 게임 시험은 돌리지 않았습니다. Jeff는 RAGTruth와 WinoGrande 학습 분할로 학습했고, Kev는 다섯 개 모두 학습하지 않았으며, Jev가 무엇으로 학습했는지는 공개되지 않았습니다. 26개 한계는 의도 분류 데이터셋 세 개와, 그중 하나로 한 순서 뒤집기 시험에서 확인한 것입니다. Jeff-Gemma4-E2B는 돌리지 않았습니다.
실험 설정: Jeff 저장소 firelex/jeff 985797f, 가중치 mstrasser/Jeff-Qwen3.5-0.8B 9878256, mstrasser/Jeff-Qwen3.5-2B f2d993c. 저장소의 jeff-serve(PyTorch, bf16, torch 2.14.0)로 A100 80GB PCIe 한 장에서 127.0.0.1에만 띄웠고 모델 이름은 jeff-latest입니다. 패널은 jeff-panel을 고치지 않고 돌렸습니다(시드 20260926, 4,599행, 길이 때문에 빠진 행 없음, SHA-256 46b6fb82…). Kev-9B는 앞선 글과 같이 kev.serve로 띄웠습니다. Jev는 POST https://api.typesafe.ai/v1/systemone에 model: "jev-1.13.0"으로 동시 4개씩 보냈고 오류나 재시도는 없었습니다. 모든 모델에 패널의 state, 지시문, 기준을 그대로 넣었습니다. 예/아니오 문항(RAGTruth)은 확률 0.5 이상을 "예"로 채점했습니다. 보정 오차는 최고 선택지 확률(예/아니오는 max(p, 1 − p))을 10구간으로 나눈 ECE이고, McNemar 검정은 양측 정확 검정입니다. 8개 조건은 Kev 글과 같은 파일, 라벨 이름, 지시문을 썼습니다. 순서 뒤집기 시험은 같은 BANKING77 154문장에 선택지 목록만 거꾸로 넣었고, 응답의 model 필드는 모두 jeff-qwen3.5-2b였습니다. 속도: A100 한 장에서 로컬 HTTP로 패널 문항을 보냈을 때 Jeff는 두 크기 모두 문항당 중앙값 45ms였습니다(README는 RTX PRO 6000에서 22~24ms, 그 환경은 재현하지 않았습니다). Jev 4,599회 요청에는 입력 토큰 339만 개, 정가 기준 $0.14가 들었습니다. 측정일 2026-09-29.
이 글과 이어지는 강좌
SOTAAZ 강좌강좌는 하나씩 살 수 있습니다. 13개 전체가 필요하면 $199 평생 번들도 있습니다.
이메일로 받아보기
관련 포스트

Kev와 MoJev 실측: 오픈소스 Jev 대안 두 개의 정확도와 확률
Jev와 같은 API를 쓰는 Kev(0.8B~9B)와 MoJev(0.85B)를 BANKING77·TREC·AG News에서 사람 라벨로 채점했습니다. Kev의 확률은 쓸 만했습니다. 정확도 95%를 지키며 BANKING77의 53~61%를 자동 통과시켰고, 같은 조건에서 laya는 0%였습니다. 다만 Kev는 이 세 데이터셋으로 학습된 모델이고, 같은 데이터로 학습한 작은 분류기가 BANKING77에서는 여전히 앞섰습니다. MoJev는 보정 오차 0.79%를 발표했지만 여기서는 6~22%였고, 확률이 실제보다 낮게 나왔습니다.

판단 모델의 확신을 믿어도 될까: 반복 응답과 확률 실측
판단 모델은 답마다 확률을 붙여 줘서, 확실한 건 바로 처리하고 나머지만 넘길 수 있다고 합니다. 그 '확실함'을 판단하는 두 방법을 사람이 붙인 정답 라벨로 평가했습니다. openjev가 틀린 답의 77~80%는 8번 뽑아도 모두 같은 답이었습니다. 확률은 그보다 나았지만 유용성이 과제에 따라 크게 달랐습니다. laya는 정확도 95%를 지키며 TREC의 88%를 자동 통과시켰고 BANKING77은 0%였습니다. 새로 나온 CLM-8B는 라벨 이름만 주면 세 데이터셋 모두 우연 수준이었습니다.

10분 만에 이해하는 Jev: 빠른 판단 모델은 언제 쓸모 있나
Jev는 글로 답하지 않고 선택지마다 확률을 매겨 돌려주는 모델입니다. 이런 모델이 왜 필요한지, 오픈소스는 같은 일을 어떻게 하는지, 그리고 세 번에 걸쳐 직접 재 본 결과를 정리했습니다. 선택지가 몇 개뿐이면 421M 모델이 23ms에 86.6%를 맞혔고, 77개면 CPU에서 도는 작은 분류기가 90%로 여전히 앞섰습니다.