Ollama 판단 모델을 Jev와 같은 문항으로 재 봤습니다: Nimble과 Tev1
Ollama 0.35가 Jev식 판단 모델을 로컬에서 돌립니다. 같은 문항에서 Nimble 9B는 TREC 95.6%로 Jev(89.0%)를 앞섰고, 추론 위주 4,599문항에서는 76.0 대 85.7로 뒤졌습니다. 선택지가 26개를 넘는 질문은 Ollama 엔드포인트가 세 모델 모두 거절했습니다.

Ollama 판단 모델을 Jev와 같은 문항으로 재 봤습니다: Nimble과 Tev1
9월 28일에 나온 Ollama 0.35에 /v1/systemone 엔드포인트가 생겼습니다. Jev의 API를 그대로 따릅니다. 상태와 유형이 정해진 질문을 보내면, 로컬 모델이 글 대신 선택지마다 확률을 돌려줍니다. 함께 나온 모델은 셋입니다. Bespoke Labs의 Nimble(9B)과 Together AI의 Tev1(4B, 0.8B)이고, 모두 Qwen3.5를 파인튜닝했습니다.
Jev, Kev, Jeff는 이미 같은 문장으로 재 둔 상태였습니다. 그래서 같은 측정 도구의 주소만 Ollama로 바꿔 세 모델을 돌렸습니다. 앞선 글들의 분류 조건 다섯 개와, Jeff vs Jev에서 쓴 4,599문항 패널입니다.
요약
- 짧은 분류 과제에서는 Nimble이 Jev와 같거나 앞섰습니다. TREC은 95.6% 대 89.0%(p < 0.001)였고, AG News와 금융 뉴스 트윗은 어느 쪽으로든 3점 이내라 통계적 차이가 없었습니다.
- 추론 위주 패널에서는 Jev가 크게 앞섰습니다. 85.7 대 76.0이었고, WinoGrande와 BBH에서 차이가 가장 컸습니다.
- Ollama 엔드포인트는 선택지가 26개를 넘는 질문을 세 모델 모두 거절했습니다. 틀린 답을 내는 대신 분명한 오류를 돌려줍니다. 의도 77개짜리 BANKING77은 질문 하나로 보낼 수 없습니다.
- Tev1 0.8B는 TREC과 패널 종합에서 크게 낮았습니다(41%, 59.7). 다만 AG News 설명 추가 조건에서는 여섯 모델 중 가장 높았습니다. Tev1은 두 크기 모두 약 2,050토큰이 넘는 입력을 거절합니다.

각 모델이 학습한 것
아래 숫자를 읽는 방법이 여기서 정해지니 먼저 적습니다.
Nimble은 학습 데이터를 공개했습니다. 상거래, 여행, 소프트웨어 같은 10개 분야의 합성 예시 2,676건이고, 이름이 붙은 공개 데이터셋은 없습니다. 제 시험 문장을 대조해 보니 TREC 500문항, AG News 200건, 금융 트윗 200건 중 하나도 들어 있지 않았고, 데이터셋 이름도 나오지 않았습니다. 파인튜닝 데이터 기준으로는 여기 나온 Nimble 결과가 모두 처음 보는 과제입니다. 다만 그 전에 기반 모델 Qwen3.5-9B가 무엇을 봤는지는 공개되지 않았습니다.
Tev1은 학습 출처를 밝혔고, 그중 둘이 제가 쓴 데이터와 겹칩니다. AG News 1,500건과 BANKING77 3,000건이 MultiNLI, BoolQ, SST-5와 함께 들어 있습니다. 그러니 Tev1에게 AG News는 익숙한 과제이고, TREC과 금융 트윗은 처음 보는 과제입니다.
Jev는 학습 데이터를 공개하지 않아서 어느 쪽인지 말할 수 없습니다.
짧은 분류: Nimble이 Jev와 같거나 앞섰습니다
| Jev 1.13 | Nimble 9B | Tev1 4B | Tev1 0.8B | Kev-9B | Jeff-2B v1.1 | |
|---|---|---|---|---|---|---|
| TREC, 라벨 이름만 (500) | 89.0 | 95.6 | 71.2 | 41.0 | 93.8 | 69.4 |
| TREC, 설명 추가 (500) | 93.6 | 96.2 | 89.8 | 41.2 | 96.6 | 87.0 |
| AG News, 라벨 이름만 (200) | 89.0 | 90.0 | 88.5 | 86.5 | 89.0 | 88.5 |
| AG News, 설명 추가 (200) | 90.0 | 90.0 | 90.5 | 91.0 | 90.5 | 88.5 |
| 금융 트윗, 주제 20개 (200) | 71.0 | 68.0 | 67.5 | 46.0 | 69.5 | 62.0 |
문장마다 짝지어 보면, TREC에서 Jev만 틀리고 Nimble이 맞힌 문항이 38개, 반대가 5개였습니다(p < 0.001). 설명을 붙인 조건에서는 17 대 4였습니다(p = 0.007). AG News와 금융 트윗은 몇 문항 차이라 통계적으로 의미가 없었습니다(p ≥ 0.34). TREC을 학습한 Kev-9B와 TREC을 학습하지 않은 Nimble의 점수가 비슷했습니다.
Tev1 4B는 라벨마다 한 줄 설명을 붙이자 TREC에서 19점 올라, 여기서 가장 크게 올랐습니다. 학습한 AG News에서는 다른 모델들과 비슷했습니다. Tev1 0.8B는 설명이 있든 없든 TREC에서 41%에 머물렀습니다.
추론 위주 패널: Jev가 크게 앞섰습니다
Jeff가 공개한 패널입니다. BBH, Financial PhraseBank, JudgeBench, RAGTruth, WinoGrande 다섯 벤치마크 4,599문항이고, 어느 것도 Nimble 학습 데이터에 없습니다.
| Jev 1.13 | Nimble 9B | 한쪽만 맞힌 문항 (Nimble / Jev) | |
|---|---|---|---|
| BBH (750) | 90.5 | 70.3 | 21 / 173, p < 0.001 |
| Financial PhraseBank (999) | 85.3 | 84.5 | 58 / 66, p = 0.53 |
| JudgeBench (350) | 79.4 | 64.3 | 21 / 74, p < 0.001 |
| RAGTruth (1,500) | 81.8 | 78.9 | 191 / 235, p = 0.037 |
| WinoGrande (1,000) | 90.6 | 71.8 | 20 / 208, p < 0.001 |
| 전체 4,599 | 85.7 | 76.0 | 311 / 756, p < 0.001 |
Nimble은 금융 감성 분류에서 Jev와 비겼고, 추론이 필요한 곳에서는 모두 뒤졌습니다. Nimble의 패널 합계 76.0은 Kev-9B(73.8)와 Jeff-2B v1.1(81.9) 사이입니다. Ollama 모델 가운데 금융 감성은 Tev1이 가장 잘했습니다. Financial PhraseBank에서 Tev1 4B는 93.9, Tev1 0.8B는 89.7로 둘 다 Jev(85.3)보다 높았습니다(103 대 17, p < 0.001; 137 대 93, p = 0.004). Tev1 학습 데이터에는 감성 데이터셋 SST-5가 들어 있습니다. Tev1은 4B가 70.8, 0.8B가 59.7인데, 이 합계에는 거절된 138문항이 오답으로 들어 있습니다. 아래에서 설명합니다.
쓰다 보면 부딪히는 한도 두 가지
선택지가 26개를 넘으면 거절합니다. 의도 77개를 모두 넣은 BANKING77을 보내자 Ollama 0.35의 /v1/systemone이 세 모델 모두에 HTTP 400: question "intent": criteria must contain 2–26 candidates를 돌려줬고, CLINC150과 MASSIVE도 같았습니다. 모델과 관계없이 같은 문구라, 엔드포인트가 요청을 검사하는 단계에서 막는 것으로 보입니다. 안전한 쪽의 동작입니다. Jeff v1.0은 이런 목록을 받고도 27번째 뒤 선택지를 조용히 한 번도 고르지 않았기 때문입니다(v1.1에서 고쳐짐). 다만 77개짜리 의도 분류라면, Ollama에 보내기 전에 코드에서 후보를 먼저 추려야 합니다. Tev1 README는 학습한 범위인 선택지 2~24개를 권합니다.
Tev1은 긴 입력을 거절합니다. 패널에서 138문항이 prompt 0 has 3429 tokens; expected 1–2050 (input is never truncated) 같은 오류로 돌아왔습니다. JudgeBench 350문항 중 116개, RAGTruth 1,500문항 중 22개입니다. 몰래 잘라 쓰는 것보다는 낫지만, 보낼 수 있는 길이가 정해져 있다는 뜻입니다. Tev1 4B는 답을 낸 JudgeBench 문항에서 63.2%를 맞혔습니다. Nimble은 이 패널에서 거절한 문항이 없었습니다.

확률: TREC에서는 정확하고, 추론에서는 확신이 지나쳤습니다
Ollama는 Jev API처럼 확률을 소수 둘째 자리로 반올림하지 않고 그대로 돌려줍니다. 그래서 임계값을 세밀하게 잡을 수 있습니다. 모델이 말한 확률과 실제 정확도의 차이는 과제에 따라 달랐습니다.
| 평균 최고 확률 − 정확도 (%p) | Jev 1.13 | Nimble 9B | Tev1 4B |
|---|---|---|---|
| TREC, 라벨 이름만 | −0.1 | +1.0 | +6.4 |
| AG News, 라벨 이름만 | +6.7 | +4.9 | +1.6 |
| 금융 트윗 | +15.8 | +17.2 | +9.1 |
| JudgeBench (패널) | +0.4 | +21.1 | |
| WinoGrande (패널) | +2.7 | +21.0 |
TREC에서 Nimble의 확률은 거의 정확했고, 받아들인 답의 정확도를 95%로 지키면서 500문항 전부를 자동으로 받아들일 수 있었습니다. 반면 JudgeBench와 WinoGrande에서는 실제보다 약 21점 더 확신했습니다. Nimble 모델 카드는 학습 뒤에 온도 보정을 따로 하지 않았다고 밝혔고, Tev1 README는 확률이 "보정된 확신이 아니라 모델의 선호"라고 적었습니다. 둘 다 이 점을 숨기지 않았으니, 실제로는 과제마다 내가 라벨을 단 데이터로 임계값을 정하면 됩니다.
속도
다른 작업이 없는 A100 한 장에서, 로컬 HTTP로 한 번에 한 요청씩 보낸 TREC 문항당 중앙값은 Nimble 192ms, Tev1 4B 158ms, Tev1 0.8B 53ms였습니다. 같은 서버에서 Kev-9B는 29ms, Jeff는 약 45ms였으니 Ollama 쪽이 느렸습니다. 이유는 조사하지 않았습니다. 한국에서 부른 Jev API는 약 220ms였고, 서버 처리 시간은 9월 29일 BANKING77 요청 30건에서 잰 값으로 약 53ms였습니다.
설정 하나도 적어 둡니다. 이 서버에서 Ollama는 A100을 Vulkan과 CUDA 두 장치로 인식했고, 기본으로 Vulkan을 골랐습니다. OLLAMA_LLM_LIBRARY=cuda_v13으로 CUDA를 쓰게 했고, 정확도는 어느 쪽이든 같았습니다. Ollama 0.35에서 NVIDIA 그래픽카드가 유난히 느리다면, 서버 로그에서 어떤 백엔드를 골랐는지 확인해 보세요.
어느 쪽을 쓸까
- 데이터를 밖으로 내보내지 않는 짧은 로컬 분류라면 Nimble입니다. TREC에서 여기 모델 중 가장 높은 수준이었고, AG News와 금융 트윗에서 Jev와 비슷했으며, TREC에서는 확률도 잘 맞았습니다.
- 금융 감성 분류라면 Ollama 모델 중에서는 Tev1 4B가 Financial PhraseBank에서 가장 높았습니다(93.9, Jev 85.3).
- 답변 판정, 여러 단계 추론, 대명사 해석이라면 Jev가 같은 문항에서 15~20점 앞섰습니다.
- 선택지가 26개를 넘는다면 어떤 Ollama 모델이든 먼저 후보를 추리세요.
- Tev1 0.8B는 직접 재 본 과제에만 쓰세요. 학습한 AG News에서는 잘했고, 학습하지 않은 TREC에서는 못했습니다.
이 결과의 한계
짧은 문장 분류 조건 다섯 개와 패널 하나이고, 모두 영어입니다. 모델마다 한 버전(Ollama의 Q8_0 빌드)과 Jev 1.13만 쟀습니다. Nimble의 TREC 우세는 파인튜닝 데이터 기준으로 처음 보는 과제의 결과지만, 기반 모델의 사전학습 데이터는 알 수 없고 Jev의 학습 데이터도 마찬가지입니다. 임계값은 채점한 표본에서 그대로 찾았습니다. 속도는 A100에서 로컬 HTTP로 잰 값이라 Mac이나 일반 그래픽카드에서는 다를 수 있습니다.
실험 설정: Ollama 0.35.0(Linux amd64 릴리스 tarball, CUDA 13 라이브러리, OLLAMA_LLM_LIBRARY=cuda_v13), /v1/systemone을 127.0.0.1에서, A100 80GB PCIe 한 장. 모델은 Ollama 라이브러리의 nimble:latest(blob bbf1d6fc03bb, 9.53GB, Q8_0), tev1:4b(35f9281a3df5, 4.48GB), tev1:0.8b(fa9732e3924d, 0.81GB). 요청 본문, 데이터 파일, 라벨 이름, 설명, 지시문은 Kev vs Jev, Jeff vs Jev 글과 같고, Jev·Kev·Jeff 행은 그 결과 파일에서 읽었습니다. 패널은 Jeff의 jeff-panel 출력 4,599행입니다. Nimble 학습 데이터는 bespokelabsai/nimble의 data/train.jsonl(62076b4)이고, 시험 문장 전체와 패널 문항 가운데 80자를 소문자로 바꾸고 문장부호를 지운 뒤 그대로 들어 있는지 대조했고, 네 묶음 모두 0건이었습니다(scripts/jev-bench/check_nimble_overlap.py). 거절된 요청은 합계에서 오답으로 셌습니다. 확률 차이는 평균 최고 확률에서 정확도를 뺀 값이고, McNemar 검정은 양측 정확 검정입니다. 정확도 측정은 다른 작업과 GPU를 나눠 쓰는 동안 돌렸고, 속도는 그 뒤 GPU가 빈 상태에서 따로 쟀으며 두 실행의 답은 같았습니다. 측정일 2026-10-01.
이 글과 이어지는 강좌
SOTAAZ 강좌강좌는 하나씩 살 수 있습니다. 13개 전체가 필요하면 $199 평생 번들도 있습니다.
이메일로 받아보기
관련 포스트

판단 모델은 라벨 몇 개의 값어치일까: Kev가 처음 보는 과제 세 개 실측
Kev가 학습하지 않은 CLINC150, MASSIVE, 금융 뉴스 트윗에서 Kev-9B의 정확도는 클래스마다 라벨 2~20개로 학습한 작은 분류기와 비슷했습니다. 확률은 실제 정답률보다 10~17%p 낮게 나왔고(보정 오차 11~17%, 익숙한 데이터에서는 2~9%), 정확도 95% 기준으로 자동 통과시킬 수 있는 비율은 23~58%였습니다. 선택지에 없는 질문에는 낮은 확률을 붙여서 100개 중 5개만 그 기준을 넘었습니다. 0.8B 모델은 금융 트윗 200개 중 152개를 'Financials'로 답했습니다.

Kev와 MoJev 실측: 오픈소스 Jev 대안 두 개의 정확도와 확률
Jev와 같은 API를 쓰는 Kev(0.8B~9B)와 MoJev(0.85B)를 BANKING77·TREC·AG News에서 사람 라벨로 채점했습니다. Kev의 확률은 쓸 만했습니다. 정확도 95%를 지키며 BANKING77의 53~61%를 자동 통과시켰고, 같은 조건에서 laya는 0%였습니다. 다만 Kev는 이 세 데이터셋으로 학습된 모델이고, 같은 데이터로 학습한 작은 분류기가 BANKING77에서는 여전히 앞섰습니다. MoJev는 보정 오차 0.79%를 발표했지만 여기서는 6~22%였고, 확률이 실제보다 낮게 나왔습니다.

판단 모델의 확신을 믿어도 될까: 반복 응답과 확률 실측
판단 모델은 답마다 확률을 붙여 줘서, 확실한 건 바로 처리하고 나머지만 넘길 수 있다고 합니다. 그 '확실함'을 판단하는 두 방법을 사람이 붙인 정답 라벨로 평가했습니다. openjev가 틀린 답의 77~80%는 8번 뽑아도 모두 같은 답이었습니다. 확률은 그보다 나았지만 유용성이 과제에 따라 크게 달랐습니다. laya는 정확도 95%를 지키며 TREC의 88%를 자동 통과시켰고 BANKING77은 0%였습니다. 새로 나온 CLM-8B는 라벨 이름만 주면 세 데이터셋 모두 우연 수준이었습니다.