좋습니다.
지금까지 보낸 전 모델 raw 로그 + CSV 결과 기반으로 정리만 하겠습니다.
(추가 분석 없이, 결론 중심)
📊 전체 라우터 벤치 요약🔥 1️⃣ 완전 탈락❌ lfm2.5-thinking30/30 스키마 실패
<think> 체인오브쏘트 노출
JSON 출력 불가→ 라우터로 사용 불가
⚠️ 2️⃣ 구조적 붕괴형 (복수 route / 스키마 깨짐)❌ llama3.1:8b복수 route 다발
why_empty 반복
route 필드 불안정❌ llama3.2:latestroute에 LEGAL/CONFLICT/NUMERIC 같은 태그값 혼입
risk_tags 빈 리스트
복수 route 다수❌ lfm2:latest복수 route 폭발
LOGICAL_FALLACY 같은 허용 외 태그 생성→ 공통 특징:
“분류 못하면 여러 개 써버리는 성향”
라우터로 부적합.
🟡 3️⃣ 소형 모델군 (빠르지만 불안정)qwen3:1.7b빈 응답 다수
JSON 중간 잘림
why 누락
태그 오염→ 초고속이지만 안정성 낮음
→ 라우터로 위험
🟡 4️⃣ qwen2.5:7b가장 큰 문제: need_rag_not_bool
특정 케이스에서 need_rag 필드 누락
일부 태그 혼합(["AMBIGUOUS","NONE"])장점:
route 판단은 비교적 안정
JSON 형태는 대체로 유지단점:
스키마 준수 100% 아님
태그 통제 약함→ “저비용 라우터 실험용” 가능
→ 프로덕션은 아직 위험
🟢 5️⃣ qwen3:latest장점:
route 정확도 상위권
태그 안정성 높음
분기 판단 일관성 있음문제:
빈 응답/잘림 발생 (num_predict 영향 가능)
평균 wall 9~13초 (너무 느림)→ 정확도는 좋지만 라우터로 느림
🟢 6️⃣ 🏆 gpt-oss:20b (현재 1위)장점:
Schema 93%+
Route 최고 정확도
need_rag 최고
need_verify 최고
태그 오염 적음
복수 route 거의 없음문제:
2건 빈 응답 (likely 토큰 컷)
태그를 보수적으로 적게 붙임→ 현재 가장 실전형 라우터 후보
📌 모델 성향 정리
🎯 결론라우터는 “생성 잘하는 모델”이 아니라“형식 지키는 모델”이 적합thinking 모델 = 전부 탈락
복수 route 성향 모델 = 탈락
🏁 최종 추천🥇 1순위gpt-oss:20b
🥈 2순위qwen3:latest (속도 문제 감수 시)
🥉 3순위qwen2.5:7b (저비용 실험용)
💡 중요한 관찰라우터는:
크기보다 결정 일관성
추론능력보다 enum 통제력
창의성보다 보수적 분기이 더 중요함.
| 모델 | 복수 route | JSON 깨짐 | 태그 창작 | 안정성 | 라우터 적합 |
|---|
| lfm2.5-thinking | 심각 | 100% | - | 최악 | ❌ |
| llama3.1 | 다수 | 중간 | 일부 | 낮음 | ❌ |
| llama3.2 | 다수 | 다수 | route 오염 | 낮음 | ❌ |
| lfm2 | 다수 | 중간 | 허용외 태그 | 낮음 | ❌ |
| qwen3:1.7b | 없음 | 빈응답 다수 | 일부 | 낮음 | ❌ |
| qwen2.5:7b | 없음 | need_rag 누락 | 약함 | 중간 | 🟡 |
| qwen3:latest | 거의 없음 | 잘림 문제 | 안정 | 높음 | 🟡(느림) |
| gpt-oss:20b | 거의 없음 | 2건 | 안정 | 최고 | 🟢 |