프런티어 모델을 끊임없이 벤치마크합니다.
최고 AI 모델의 품질·비용·속도 — 실시간 주기로 갱신 · 최근 업데이트 2026-09-19.
지능·코딩·에이전트 지수
Artificial Analysis 종합 지수 · 백만 토큰당 가격(입력/출력)
| # | 모델 | 지능 | 코딩 | 에이전트 | $ / 1M 입력 | $ / 1M 출력 |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 53.4 | 81.6 | 58 | $5.00 | $25.00 |
| 2 | Qwen3.8 Max | 53.4 | 68.9 | 49.9 | — | — |
| 3 | GPT-6 Astra (max) | 52.8 | 76.9 | 51.5 | $11.00 | $55.00 |
| 4 | Claude Opus 5 (Adaptive Reasoning, Max Effort) | 50.7 | 78 | 56.2 | $5.50 | $27.50 |
| 5 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | 49.7 | 76.5 | 51 | $10.00 | $50.00 |
| 6 | GPT-5.6 Sol (max) | 47.1 | 77.4 | 50.5 | $4.00 | $20.00 |
| 7 | Qwen3.8 Max (0902) | 45.4 | 76.2 | 56.1 | $2.00 | $6.00 |
| 8 | GLM-5.3 (max) | 44.9 | 74.8 | 53.4 | $0.890 | $2.80 |
| 9 | Grok 4.6 (high) | 44.4 | 76.8 | 53.4 | $4.00 | $12.00 |
| 10 | Kimi K3 (max) | 43.8 | 76.2 | 50.6 | $2.10 | $10.95 |
| 11 | GPT-5.6 Terra (max) | 42.3 | 76.7 | 43.7 | $4.00 | $24.00 |
| 12 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | 42 | 74.3 | 42.6 | $10.00 | $50.00 |
| 13 | GLM-5.3-Flash | 41.9 | 71.5 | 51.2 | $0.150 | $0.500 |
| 14 | Gemini 3.8 Flash (high) | 41.2 | 76.3 | 41.1 | $1.35 | $6.75 |
| 15 | Qwen3.8 2.4T A95B | 40 | 71.9 | 50.4 | $2.00 | $6.00 |
| 16 | Muse Spark 1.2 (xhigh) | 39.8 | 72.2 | 44 | $1.25 | $4.25 |
| 17 | DeepSeek V4.1 Flash (Reasoning, Max Effort) | 39.5 | — | — | $0.200 | $0.600 |
| 18 | Gemini 3.7 Flash (high) | 39.4 | 76.1 | 36.4 | $1.35 | $6.75 |
| 19 | Grok 4.5 (high) | 39.1 | 72.4 | 42.1 | $4.00 | $12.00 |
| 20 | GPT-5.5 (xhigh) | 38.6 | 74.9 | 37.3 | $2.50 | $15.00 |
| 21 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 38.4 | 71.5 | 44.3 | $2.20 | $11.00 |
| 22 | GPT-5.6 Luna (max) | 37.5 | 71.4 | 42.7 | $0.400 | $2.40 |
| 23 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 36.3 | 68.8 | 42.3 | $1.32 | $3.96 |
| 24 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 34.5 | 69.1 | 41.7 | $0 | $0 |
| 25 | Muse Spark 1.1 (xhigh) | 34.3 | 71.3 | 27.5 | $1.25 | $4.25 |
| 26 | Gemini 3.6 Flash (high) | 34.3 | 69.2 | 30.2 | $1.35 | $6.75 |
| 27 | GLM-5.2 (max) | 34 | 68.8 | 39.4 | $2.25 | $8.00 |
| 28 | Qwen3.8 27B (xhigh) | 33.9 | 68.1 | 46.5 | $0 | $0 |
| 29 | Gemini 3.5 Flash (high) | 33 | 70.1 | 27.3 | $2.70 | $16.20 |
| 30 | DeepSeek V4 Pro (Reasoning, Max Effort) | 30.9 | 59.4 | 27.7 | $1.15 | $2.55 |
추론·에이전트·검색 — 최신 모델로 재실행
GPQA Diamond
Graduate-level science reasoning
| # | 모델 | 점수 | $ / 작업 |
|---|---|---|---|
| 1 | Fugu Ultra | 94.6% | $1.15 |
| 2 | Gemini 3.1 Pro Preview | 94.4% | $0.202 |
| 3 | GPT-6 Astra | 94.4% | $0.099 |
| 4 | Gemini 3.7 Flash | 94.3% | $0.031 |
| 5 | GPT-5.5 | 93.8% | $0.308 |
| 6 | GPT-5.6 Sol Pro | 93.8% | $0.445 |
| 7 | Fugu Ultra V2 | 93.3% | $0.503 |
| 8 | Grok 4.6 | 93.3% | $0.122 |
| 9 | Gemini 3.6 Flash | 92.8% | $0.067 |
| 10 | Gemini 3.5 Flash | 92.8% | $0.142 |
| 11 | GPT-5.6 Sol | 91.9% | $0.071 |
| 12 | Kimi K3 | 91.9% | $0.139 |
| 13 | Union Alpha | 90.9% | — |
| 14 | Auto Router | 90.7% | $0.0079 |
| 15 | MiniMax M3 | 90.6% | $0.030 |
모든 벤치마크에서 이기는 단일 모델은 없습니다.
작업마다 선두가 바뀝니다. 추론은 이 모델이, 코딩은 저 모델이, 에이전트 검색은 또 다른 모델이 최고입니다. MultipleChat이 존재하는 이유가 바로 이것입니다 — 선두 모델들을 나란히 두고 초안 작성, 반박, 검증을 시키고 최고의 답만 가져가세요.
품질·비용·속도를 함께
가격표 없는 벤치마크 점수는 마케팅일 뿐입니다. 이곳의 모든 리더보드는 품질과 작업당·백만 토큰당 비용을 함께 보여줍니다.
실시간 & 오픈
지속적으로 갱신되며 다음 형식으로 다운로드할 수 있습니다: JSON. 자체 분기별 비교 연구는 다음에서: MultipleChat AI Benchmark.
출처
Source: OpenRouter (openrouter.ai/rankings) (Artificial Analysis 지수 포함), as of 2026-09-19T14:29:23Z. 라이선스: CC BY 4.0.