🏆 AI 모델 벤치마크 순위
주요 AI 모델의 순위를 두 관점으로 보여줍니다 — 실사용자 선호(Arena Elo)와 실제 능력(LiveBench 종합점수). 매일 자동 갱신됩니다.
기준일: Jul 19, 2026
실제 사용자가 두 모델의 답변을 블라인드로 비교 투표해 산출한 Elo 순위입니다. 말투·서식 선호가 반영되며, 능력 정답률과는 다를 수 있습니다.
| 순위 | 모델 | 제작사 | 점수(ELO) | 신뢰구간 | 투표수 | 라이선스 |
|---|---|---|---|---|---|---|
| 🥇 | claude-fable-5 | Anthropic | 1,507 | ±7 | 9,798 | 독점 |
| 🥈 | claude-opus-4-6-thinking | Anthropic | 1,504 | ±4 | 62,355 | 독점 |
| 🥉 | claude-opus-4-7-thinking | Anthropic | 1,502 | ±4 | 49,798 | 독점 |
| 4 | claude-opus-4-6 | Anthropic | 1,498 | ±4 | 66,131 | 독점 |
| 5 | muse-spark-1.1 | Meta | 1,495 | ±8 | 7,074 | 독점 |
| 6 | claude-opus-4-7 | Anthropic | 1,494 | ±4 | 50,890 | 독점 |
| 7 | muse-spark | Meta | 1,487 | ±6 | 13,562 | 독점 |
| 8 | kimi-k3 | Moonshot | 1,487 | ±10 | 3,614 | 독점 |
| 9 | gpt-5.6-sol-xhigh | OpenAI | 1,486 | ±8 | 5,467 | 독점 |
| 10 | gemini-3-pro | 1,486 | ±4 | 41,279 | 독점 | |
| 11 | gemini-3.1-pro-preview | 1,486 | ±4 | 83,386 | 독점 | |
| 12 | claude-opus-4-8-thinking | Anthropic | 1,485 | ±5 | 30,024 | 독점 |
| 13 | gpt-5.5-high | OpenAI | 1,481 | ±4 | 44,927 | 독점 |
| 14 | gpt-5.4-high | OpenAI | 1,478 | ±4 | 58,116 | 독점 |
| 15 | gemini-3.5-flash-high | 1,476 | ±7 | 10,094 | 독점 | |
| 16 | gpt-5.2-chat-latest-20260210 | OpenAI | 1,476 | ±4 | 34,416 | 독점 |
| 17 | gpt-5.5 | OpenAI | 1,476 | ±4 | 46,328 | 독점 |
| 18 | qwen3.7-max-preview | Alibaba | 1,475 | ±10 | 3,715 | 독점 |
| 19 | gemini-3.5-flash-medium | 1,475 | ±6 | 13,158 | 독점 | |
| 20 | claude-opus-4-8 | Anthropic | 1,474 | ±5 | 30,670 | 독점 |
데이터 출처: Arena (구 LMArena) 리더보드. 점수는 사용자 블라인드 비교 투표 기반 Elo이며, 순위는 수시로 변동됩니다.