# 배심원 7모델의 등급·실행 위치·API 단가 (가격은 공식 페이지에서 2026-09-11 확인)

| 모델 | 등급·크기 | 실행 위치 | 입력 $/1M | 출력 $/1M | 출처 | 확인일 |
|---|---|---|---|---|---|---|
| gemini-2.5-flash | Google 상용 소형(Flash) 등급, 크기 비공개 | Google Gemini API | 0.30 | 2.50 | ai.google.dev/gemini-api/docs/pricing | 2026-09-11 |
| gpt-4o-mini | OpenAI 상용 소형 등급, 크기 비공개 | OpenAI API | 0.15 | 0.60 | developers.openai.com/api/docs/pricing | 2026-09-11 |
| claude-haiku-4-5 (claude-haiku-4-5-20251001) | Anthropic 상용 소형(Haiku) 등급, 크기 비공개 | Anthropic API | 1.00 | 5.00 | claude.com/pricing | 2026-09-11 |
| gpt-oss-120b | OpenAI 오픈 가중치, 120B 전문가혼합(MoE) | Cerebras Inference API | 0.25 | 0.69 | cerebras.ai 블로그(gpt-oss-120b 출시 공지) | 2026-09-11 열람 |
| gemma-4 (gemma4:latest, 8.0B, Q4_K_M) | Google 오픈 가중치 8B | 연구실 서버 Ollama (RTX 3090 ×3) | 0 | 0 | 로컬 실행, API 요금 없음 | — |
| exaone-3.5 (exaone3.5:7.8b, Q4_K_M) | LG AI 오픈 가중치 7.8B | 연구실 서버 Ollama | 0 | 0 | 로컬 실행 | — |
| llama-3.1 (llama3.1:8b, Q4_K_M) | Meta 오픈 가중치 8B | 연구실 서버 Ollama | 0 | 0 | 로컬 실행 | — |

## 이 연구의 호출량과 API 비용 추정

- 판정 수: 2,448쌍 × 7모델 × 4조건 = 68,544건 (모델당 9,792건).
- 토큰 추정(문장 길이 기준, 한국어 약 2.2자/토큰·영어 약 4자/토큰; 기본 프롬프트 ≈45토큰, 루브릭 +≈230, 앵커 +≈20, 출력 ≈3토큰): 모델당 입력 ≈ 1,947,704 토큰, 출력 ≈ 29,376 토큰.
- 모델당 추정 API 비용: gemini-2.5-flash ≈ $0.66, gpt-4o-mini ≈ $0.31, claude-haiku-4-5 ≈ $2.09, gpt-oss-120b ≈ $0.51 (로컬 3모델은 0).
- 즉 전체 본실험의 API 비용은 수 달러 수준이며, 비용은 배심원 구성의 제약이 아니었다. 모델 등급은 동등하지 않다: 8B급 로컬 오픈 모델 3개, 상용 소형 API 3개, 120B MoE 오픈 모델 1개.

주의: 상용 모델의 파라미터 수는 비공개. 가격은 표준(비배치) 요금이며 변동될 수 있으므로 투고 직전 재확인 필요. 로컬 모델은 4비트 양자화(Q4_K_M) 버전으로 실행.