Models & Algorithms••EN

Ollama 판단 모델을 Jev와 같은 문항으로 재 봤습니다: Nimble과 Tev1

Ollama 0.35가 Jev식 판단 모델을 로컬에서 돌립니다. 같은 문항에서 Nimble 9B는 TREC 95.6%로 Jev(89.0%)를 앞섰고, 추론 위주 4,599문항에서는 76.0 대 85.7로 뒤졌습니다. 선택지가 26개를 넘는 질문은 Ollama 엔드포인트가 세 모델 모두 거절했습니다.

Ollama 판단 모델을 Jev와 같은 문항으로 재 봤습니다: Nimble과 Tev1

Ollama 판단 모델을 Jev와 같은 문항으로 재 봤습니다: Nimble과 Tev1

9월 28일에 나온 Ollama 0.35에 /v1/systemone 엔드포인트가 생겼습니다. Jev의 API를 그대로 따릅니다. 상태와 유형이 정해진 질문을 보내면, 로컬 모델이 글 대신 선택지마다 확률을 돌려줍니다. 함께 나온 모델은 셋입니다. Bespoke Labs의 Nimble(9B)과 Together AI의 Tev1(4B, 0.8B)이고, 모두 Qwen3.5를 파인튜닝했습니다.

Jev, Kev, Jeff는 이미 같은 문장으로 재 둔 상태였습니다. 그래서 같은 측정 도구의 주소만 Ollama로 바꿔 세 모델을 돌렸습니다. 앞선 글들의 분류 조건 다섯 개와, Jeff vs Jev에서 쓴 4,599문항 패널입니다.

요약

  • 짧은 분류 과제에서는 Nimble이 Jev와 같거나 앞섰습니다. TREC은 95.6% 대 89.0%(p < 0.001)였고, AG News와 금융 뉴스 트윗은 어느 쪽으로든 3점 이내라 통계적 차이가 없었습니다.
  • 추론 위주 패널에서는 Jev가 크게 앞섰습니다. 85.7 대 76.0이었고, WinoGrande와 BBH에서 차이가 가장 컸습니다.
  • Ollama 엔드포인트는 선택지가 26개를 넘는 질문을 세 모델 모두 거절했습니다. 틀린 답을 내는 대신 분명한 오류를 돌려줍니다. 의도 77개짜리 BANKING77은 질문 하나로 보낼 수 없습니다.
  • Tev1 0.8B는 TREC과 패널 종합에서 크게 낮았습니다(41%, 59.7). 다만 AG News 설명 추가 조건에서는 여섯 모델 중 가장 높았습니다. Tev1은 두 크기 모두 약 2,050토큰이 넘는 입력을 거절합니다.
모든 모델에 같은 문항을 준 정확도 히트맵. 행은 TREC 이름만, TREC 설명 추가, AG News 이름만, AG News 설명 추가, 금융 트윗, Jeff 패널. Jev 1.13: 89.0, 93.6, 89.0, 90.0, 71.0, 85.7. Nimble 9B: 95.6, 96.2, 90.0, 90.0, 68.0, 76.0. Tev1 4B: 71.2, 89.8, 88.5, 90.5, 67.5, 70.8. Tev1 0.8B: 41.0, 41.2, 86.5, 91.0, 46.0, 59.7. Kev-9B: 93.8, 96.6, 89.0, 90.5, 69.5, 73.8. Jeff-2B v1.1: 69.4, 87.0, 88.5, 88.5, 62.0, 81.9.

각 모델이 학습한 것

아래 숫자를 읽는 방법이 여기서 정해지니 먼저 적습니다.

Nimble은 학습 데이터를 공개했습니다. 상거래, 여행, 소프트웨어 같은 10개 분야의 합성 예시 2,676건이고, 이름이 붙은 공개 데이터셋은 없습니다. 제 시험 문장을 대조해 보니 TREC 500문항, AG News 200건, 금융 트윗 200건 중 하나도 들어 있지 않았고, 데이터셋 이름도 나오지 않았습니다. 파인튜닝 데이터 기준으로는 여기 나온 Nimble 결과가 모두 처음 보는 과제입니다. 다만 그 전에 기반 모델 Qwen3.5-9B가 무엇을 봤는지는 공개되지 않았습니다.

Tev1은 학습 출처를 밝혔고, 그중 둘이 제가 쓴 데이터와 겹칩니다. AG News 1,500건과 BANKING77 3,000건이 MultiNLI, BoolQ, SST-5와 함께 들어 있습니다. 그러니 Tev1에게 AG News는 익숙한 과제이고, TREC과 금융 트윗은 처음 보는 과제입니다.

Jev는 학습 데이터를 공개하지 않아서 어느 쪽인지 말할 수 없습니다.

짧은 분류: Nimble이 Jev와 같거나 앞섰습니다

Jev 1.13Nimble 9BTev1 4BTev1 0.8BKev-9BJeff-2B v1.1
TREC, 라벨 이름만 (500)89.095.671.241.093.869.4
TREC, 설명 추가 (500)93.696.289.841.296.687.0
AG News, 라벨 이름만 (200)89.090.088.586.589.088.5
AG News, 설명 추가 (200)90.090.090.591.090.588.5
금융 트윗, 주제 20개 (200)71.068.067.546.069.562.0

문장마다 짝지어 보면, TREC에서 Jev만 틀리고 Nimble이 맞힌 문항이 38개, 반대가 5개였습니다(p < 0.001). 설명을 붙인 조건에서는 17 대 4였습니다(p = 0.007). AG News와 금융 트윗은 몇 문항 차이라 통계적으로 의미가 없었습니다(p ≥ 0.34). TREC을 학습한 Kev-9B와 TREC을 학습하지 않은 Nimble의 점수가 비슷했습니다.

Tev1 4B는 라벨마다 한 줄 설명을 붙이자 TREC에서 19점 올라, 여기서 가장 크게 올랐습니다. 학습한 AG News에서는 다른 모델들과 비슷했습니다. Tev1 0.8B는 설명이 있든 없든 TREC에서 41%에 머물렀습니다.

추론 위주 패널: Jev가 크게 앞섰습니다

Jeff가 공개한 패널입니다. BBH, Financial PhraseBank, JudgeBench, RAGTruth, WinoGrande 다섯 벤치마크 4,599문항이고, 어느 것도 Nimble 학습 데이터에 없습니다.

Jev 1.13Nimble 9B한쪽만 맞힌 문항 (Nimble / Jev)
BBH (750)90.570.321 / 173, p < 0.001
Financial PhraseBank (999)85.384.558 / 66, p = 0.53
JudgeBench (350)79.464.321 / 74, p < 0.001
RAGTruth (1,500)81.878.9191 / 235, p = 0.037
WinoGrande (1,000)90.671.820 / 208, p < 0.001
전체 4,59985.776.0311 / 756, p < 0.001

Nimble은 금융 감성 분류에서 Jev와 비겼고, 추론이 필요한 곳에서는 모두 뒤졌습니다. Nimble의 패널 합계 76.0은 Kev-9B(73.8)와 Jeff-2B v1.1(81.9) 사이입니다. Ollama 모델 가운데 금융 감성은 Tev1이 가장 잘했습니다. Financial PhraseBank에서 Tev1 4B는 93.9, Tev1 0.8B는 89.7로 둘 다 Jev(85.3)보다 높았습니다(103 대 17, p < 0.001; 137 대 93, p = 0.004). Tev1 학습 데이터에는 감성 데이터셋 SST-5가 들어 있습니다. Tev1은 4B가 70.8, 0.8B가 59.7인데, 이 합계에는 거절된 138문항이 오답으로 들어 있습니다. 아래에서 설명합니다.

쓰다 보면 부딪히는 한도 두 가지

선택지가 26개를 넘으면 거절합니다. 의도 77개를 모두 넣은 BANKING77을 보내자 Ollama 0.35의 /v1/systemone이 세 모델 모두에 HTTP 400: question "intent": criteria must contain 2–26 candidates를 돌려줬고, CLINC150과 MASSIVE도 같았습니다. 모델과 관계없이 같은 문구라, 엔드포인트가 요청을 검사하는 단계에서 막는 것으로 보입니다. 안전한 쪽의 동작입니다. Jeff v1.0은 이런 목록을 받고도 27번째 뒤 선택지를 조용히 한 번도 고르지 않았기 때문입니다(v1.1에서 고쳐짐). 다만 77개짜리 의도 분류라면, Ollama에 보내기 전에 코드에서 후보를 먼저 추려야 합니다. Tev1 README는 학습한 범위인 선택지 2~24개를 권합니다.

Tev1은 긴 입력을 거절합니다. 패널에서 138문항이 prompt 0 has 3429 tokens; expected 1–2050 (input is never truncated) 같은 오류로 돌아왔습니다. JudgeBench 350문항 중 116개, RAGTruth 1,500문항 중 22개입니다. 몰래 잘라 쓰는 것보다는 낫지만, 보낼 수 있는 길이가 정해져 있다는 뜻입니다. Tev1 4B는 답을 낸 JudgeBench 문항에서 63.2%를 맞혔습니다. Nimble은 이 패널에서 거절한 문항이 없었습니다.

확률: TREC에서는 정확하고, 추론에서는 확신이 지나쳤습니다

Ollama는 Jev API처럼 확률을 소수 둘째 자리로 반올림하지 않고 그대로 돌려줍니다. 그래서 임계값을 세밀하게 잡을 수 있습니다. 모델이 말한 확률과 실제 정확도의 차이는 과제에 따라 달랐습니다.

평균 최고 확률 − 정확도 (%p)Jev 1.13Nimble 9BTev1 4B
TREC, 라벨 이름만−0.1+1.0+6.4
AG News, 라벨 이름만+6.7+4.9+1.6
금융 트윗+15.8+17.2+9.1
JudgeBench (패널)+0.4+21.1
WinoGrande (패널)+2.7+21.0

TREC에서 Nimble의 확률은 거의 정확했고, 받아들인 답의 정확도를 95%로 지키면서 500문항 전부를 자동으로 받아들일 수 있었습니다. 반면 JudgeBench와 WinoGrande에서는 실제보다 약 21점 더 확신했습니다. Nimble 모델 카드는 학습 뒤에 온도 보정을 따로 하지 않았다고 밝혔고, Tev1 README는 확률이 "보정된 확신이 아니라 모델의 선호"라고 적었습니다. 둘 다 이 점을 숨기지 않았으니, 실제로는 과제마다 내가 라벨을 단 데이터로 임계값을 정하면 됩니다.

속도

다른 작업이 없는 A100 한 장에서, 로컬 HTTP로 한 번에 한 요청씩 보낸 TREC 문항당 중앙값은 Nimble 192ms, Tev1 4B 158ms, Tev1 0.8B 53ms였습니다. 같은 서버에서 Kev-9B는 29ms, Jeff는 약 45ms였으니 Ollama 쪽이 느렸습니다. 이유는 조사하지 않았습니다. 한국에서 부른 Jev API는 약 220ms였고, 서버 처리 시간은 9월 29일 BANKING77 요청 30건에서 잰 값으로 약 53ms였습니다.

설정 하나도 적어 둡니다. 이 서버에서 Ollama는 A100을 Vulkan과 CUDA 두 장치로 인식했고, 기본으로 Vulkan을 골랐습니다. OLLAMA_LLM_LIBRARY=cuda_v13으로 CUDA를 쓰게 했고, 정확도는 어느 쪽이든 같았습니다. Ollama 0.35에서 NVIDIA 그래픽카드가 유난히 느리다면, 서버 로그에서 어떤 백엔드를 골랐는지 확인해 보세요.

어느 쪽을 쓸까

  • 데이터를 밖으로 내보내지 않는 짧은 로컬 분류라면 Nimble입니다. TREC에서 여기 모델 중 가장 높은 수준이었고, AG News와 금융 트윗에서 Jev와 비슷했으며, TREC에서는 확률도 잘 맞았습니다.
  • 금융 감성 분류라면 Ollama 모델 중에서는 Tev1 4B가 Financial PhraseBank에서 가장 높았습니다(93.9, Jev 85.3).
  • 답변 판정, 여러 단계 추론, 대명사 해석이라면 Jev가 같은 문항에서 15~20점 앞섰습니다.
  • 선택지가 26개를 넘는다면 어떤 Ollama 모델이든 먼저 후보를 추리세요.
  • Tev1 0.8B는 직접 재 본 과제에만 쓰세요. 학습한 AG News에서는 잘했고, 학습하지 않은 TREC에서는 못했습니다.

이 결과의 한계

짧은 문장 분류 조건 다섯 개와 패널 하나이고, 모두 영어입니다. 모델마다 한 버전(Ollama의 Q8_0 빌드)과 Jev 1.13만 쟀습니다. Nimble의 TREC 우세는 파인튜닝 데이터 기준으로 처음 보는 과제의 결과지만, 기반 모델의 사전학습 데이터는 알 수 없고 Jev의 학습 데이터도 마찬가지입니다. 임계값은 채점한 표본에서 그대로 찾았습니다. 속도는 A100에서 로컬 HTTP로 잰 값이라 Mac이나 일반 그래픽카드에서는 다를 수 있습니다.

실험 설정: Ollama 0.35.0(Linux amd64 릴리스 tarball, CUDA 13 라이브러리, OLLAMA_LLM_LIBRARY=cuda_v13), /v1/systemone을 127.0.0.1에서, A100 80GB PCIe 한 장. 모델은 Ollama 라이브러리의 nimble:latest(blob bbf1d6fc03bb, 9.53GB, Q8_0), tev1:4b(35f9281a3df5, 4.48GB), tev1:0.8b(fa9732e3924d, 0.81GB). 요청 본문, 데이터 파일, 라벨 이름, 설명, 지시문은 Kev vs Jev, Jeff vs Jev 글과 같고, Jev·Kev·Jeff 행은 그 결과 파일에서 읽었습니다. 패널은 Jeff의 jeff-panel 출력 4,599행입니다. Nimble 학습 데이터는 bespokelabsai/nimble의 data/train.jsonl(62076b4)이고, 시험 문장 전체와 패널 문항 가운데 80자를 소문자로 바꾸고 문장부호를 지운 뒤 그대로 들어 있는지 대조했고, 네 묶음 모두 0건이었습니다(scripts/jev-bench/check_nimble_overlap.py). 거절된 요청은 합계에서 오답으로 셌습니다. 확률 차이는 평균 최고 확률에서 정확도를 뺀 값이고, McNemar 검정은 양측 정확 검정입니다. 정확도 측정은 다른 작업과 GPU를 나눠 쓰는 동안 돌렸고, 속도는 그 뒤 GPU가 빈 상태에서 따로 쟀으며 두 실행의 답은 같았습니다. 측정일 2026-10-01.

이 글과 이어지는 강좌

SOTAAZ 강좌

강좌는 하나씩 살 수 있습니다. 13개 전체가 필요하면 $199 평생 번들도 있습니다.

더 많은 콘텐츠를 받아보세요

SNS에서 새로운 글과 튜토리얼 소식을 가장 먼저 받아보세요

이메일로 받아보기

관련 포스트

판단 모델은 라벨 몇 개의 값어치일까: Kev가 처음 보는 과제 세 개 실측
Models & Algorithms

판단 모델은 라벨 몇 개의 값어치일까: Kev가 처음 보는 과제 세 개 실측

Kev가 학습하지 않은 CLINC150, MASSIVE, 금융 뉴스 트윗에서 Kev-9B의 정확도는 클래스마다 라벨 2~20개로 학습한 작은 분류기와 비슷했습니다. 확률은 실제 정답률보다 10~17%p 낮게 나왔고(보정 오차 11~17%, 익숙한 데이터에서는 2~9%), 정확도 95% 기준으로 자동 통과시킬 수 있는 비율은 23~58%였습니다. 선택지에 없는 질문에는 낮은 확률을 붙여서 100개 중 5개만 그 기준을 넘었습니다. 0.8B 모델은 금융 트윗 200개 중 152개를 'Financials'로 답했습니다.

Kev와 MoJev 실측: 오픈소스 Jev 대안 두 개의 정확도와 확률
Models & Algorithms

Kev와 MoJev 실측: 오픈소스 Jev 대안 두 개의 정확도와 확률

Jev와 같은 API를 쓰는 Kev(0.8B~9B)와 MoJev(0.85B)를 BANKING77·TREC·AG News에서 사람 라벨로 채점했습니다. Kev의 확률은 쓸 만했습니다. 정확도 95%를 지키며 BANKING77의 53~61%를 자동 통과시켰고, 같은 조건에서 laya는 0%였습니다. 다만 Kev는 이 세 데이터셋으로 학습된 모델이고, 같은 데이터로 학습한 작은 분류기가 BANKING77에서는 여전히 앞섰습니다. MoJev는 보정 오차 0.79%를 발표했지만 여기서는 6~22%였고, 확률이 실제보다 낮게 나왔습니다.

판단 모델의 확신을 믿어도 될까: 반복 응답과 확률 실측
Models & Algorithms

판단 모델의 확신을 믿어도 될까: 반복 응답과 확률 실측

판단 모델은 답마다 확률을 붙여 줘서, 확실한 건 바로 처리하고 나머지만 넘길 수 있다고 합니다. 그 '확실함'을 판단하는 두 방법을 사람이 붙인 정답 라벨로 평가했습니다. openjev가 틀린 답의 77~80%는 8번 뽑아도 모두 같은 답이었습니다. 확률은 그보다 나았지만 유용성이 과제에 따라 크게 달랐습니다. laya는 정확도 95%를 지키며 TREC의 88%를 자동 통과시켰고 BANKING77은 0%였습니다. 새로 나온 CLM-8B는 라벨 이름만 주면 세 데이터셋 모두 우연 수준이었습니다.