AI · 테크

AI 모델(LLM) 성능 벤치마크 순위

공신력 있는 벤치마크 리더보드 Arena AI 텍스트 리더보드 기준 상위 AI 모델을 정리했습니다.

최종 업데이트 2026.07.07
선정 기준

Arena AI(구 LMArena) 텍스트 리더보드, 2026년 7월 기준 Elo 스코어로 선정했습니다(실시간 순위이며 계속 변동). Elo 스코어는 두 모델의 답변을 사용자가 직접 비교 투표한 결과를 체스 랭킹 방식으로 환산한 값으로, 점수가 높을수록 상대 평가에서 더 자주 선택됐다는 의미다.

01

Claude Fable 5 (Anthropic)

Elo 스코어 1509로 전체 1위.

02

Claude Opus 4.6 Thinking (Anthropic)

Elo 스코어 1504로 2위.

03

Claude Opus 4.7 Thinking (Anthropic)

Elo 스코어 1502.

04

Claude Opus 4.6 (Anthropic)

Elo 스코어 1499.

05

Claude Opus 4.7 (Anthropic)

Elo 스코어 1494.

06

Muse Spark (Meta)

Elo 스코어 1487로, Anthropic 계열이 아닌 모델 중 최상위.

07

Gemini 3.1 Pro Preview (Google)

Elo 스코어 1486.

08

Gemini 3 Pro (Google)

Elo 스코어 1486으로 프리뷰 버전과 동률.

09

Claude Opus 4.8 Thinking (Anthropic)

Elo 스코어 1484.

10

GPT-5.5 High (OpenAI)

Elo 스코어 1481로 10위권 진입.

Anthropic 계열이 상위권을 대부분 차지한 이유

상위 10개 모델 중 6개가 Anthropic Claude 계열이다. 같은 회사가 Thinking(추론 강화) 버전과 일반 버전을 함께 리더보드에 올리면서 상위권 다수를 자체 점유하는 구조로, 실제 체감 성능 격차보다는 다중 모델 동시 출품 전략의 영향이 크다는 평가도 있다.

1위와 10위 격차는 크지 않다

1위(1509)와 10위(1481) 사이 점수 차는 30점이 안 된다. Elo 스코어 특성상 이 정도 차이는 사용자 체감으로는 거의 구분되지 않는 수준이라, 순위 자체보다는 상위권에 어떤 모델들이 몰려 있는지 흐름을 보는 것이 더 의미 있다.

정리하면

종합 리더보드에서는 Anthropic 계열 모델이 상위 10개 중 6개를 차지하며 강세를 보였고, Google과 OpenAI가 뒤를 이었습니다.