🏆 AI 모델 벤치마크 순위

주요 AI 모델의 순위를 두 관점으로 보여줍니다 — 실사용자 선호(Arena Elo)와 실제 능력(LiveBench 종합점수). 자동 갱신됩니다.

실제 사용자가 두 모델의 답변을 블라인드로 비교 투표해 산출한 Elo 순위입니다. 말투·서식 선호가 반영되며, 능력 정답률과는 다를 수 있습니다.

마지막 업데이트: 2026-09-04 · Arena 발표 기준 Sep 2, 2026

순위모델점수(ELO)
🥇claude-fable-51,507
🥈claude-opus-4-6-high1,505
🥉claude-fable-5.1-max1,504
41claude-opus-4-7-high1,502
51muse-spark-1.2 (xHigh)1,499
61claude-opus-4-61,498
71claude-opus-4-71,494
8gemini-3.8-flash-high1,494
92claude-opus-5-high1,493
102muse-spark-1.11,492
112gemini-3.7-flash-high1,491
122kimi-k3-max1,489
13muse-spark1,488
14claude-opus-5-max1,488
15gemini-3.1-pro-preview1,487
16gemini-3-pro1,486
17gpt-5.6-sol-xhigh1,483
18claude-opus-4-8-high1,482
19gpt-5.5-high1,482
20glm-5.3-max1,482

데이터 출처: Arena (구 LMArena) 리더보드. 점수는 사용자 블라인드 비교 투표 기반 Elo이며, 순위는 수시로 변동됩니다.

오픈채팅