ARCROUTER시작하기
랭킹크리에이티브

ARCROUTER / CREATIVE INTELLIGENCE

다음 이야기를 만들 모델,
감이 아닌 근거로.

게임의 캐릭터부터 브랜드의 한 문장까지.창작자를 위해 흩어진 공개 벤치마크를 하나의 프로필로 모았습니다.

게임 · 캐릭터스토리 · 세계관광고 · 콘텐츠

창작 모델을 고르는 새로운 기준

5

품질 프로필 축

101

공개 점수 수록 모델

수집 기준 2026-09-08
수록 버전의 스냅샷이며 실시간 순위가 아닙니다.

스토리텔링 · 감성 이해 · 콘텐츠 작성 · 선택 언어의 4개 지표를 함께 비교합니다.

종합 랭킹 101개 모델

4개 지표 종합 순 · 높을수록 우수
한국어 기준 종합 모델 순위. 롤플레잉 활용은 표본 요청 점유율 순위이며 언어별로 나누지 않습니다. 나머지 점수는 각 평가의 순위 백분위이며 대시는 미수록입니다. 모델 이름을 누르면 상세 프로필을 확인할 수 있습니다.
순위모델롤플레잉 활용OpenRouter 요청 %종합스토리감성글쓰기한국어
1—97.794.796.3100.0100.0
2—93.693.285.298.297.7
3—90.288.681.595.595.1
4—88.993.974.189.498.1
5—85.089.477.886.686.0
6—83.885.655.698.096.2
7—78.186.444.491.789.8
8—72.781.140.784.684.5
9—70.958.348.185.991.3
10—69.356.825.997.796.6
11—67.762.137.088.982.6
—4위4.7%—60.6—76.162.1
—1위26.3%—62.9—79.373.1
———59.1—65.558.7
———49.2—71.356.1
———63.6—86.483.7
———31.8—58.443.6
————11.183.478.4
———65.9—92.281.8
———40.2—61.531.1

— 미수록 · 롤플레잉 활용은 OpenRouter 요청 점유율 순위이며, 레이더와 종합 점수에 포함하지 않습니다. 종합은 4개 확정 품질 지표가 모두 있는 모델에만 표시합니다.

BEHIND THE SCORE

Claude Fable 5의 평가 근거

CREATIVE PROFILE

창작에 필요한 다섯 가지 시선

공개 벤치마크 내 상대 백분위 · 한국어 기준 · 2026-09-08 수집

전체 모델 비교 ↗
롤플레잉미수록스토리텔링94.7감정 이해96.3창작 글쓰기100.0한국어100.0

종합 · 4개 지표

확정된 4개 지표로만 산출

97.7

미수록은 0점이 아닙니다. 평가가 없는 축은 비워 두며, 모든 축이 채워질 때만 면을 연결합니다.

롤플레잉

품질 평가 미수록
RP-Bench · 검토 중 ↗

품질 평가와 OpenRouter 상위 10개 사용 순위에 아직 수록되지 않았습니다. 롤플레잉 활용 순위 보기 ↗

미수록 · 허구적 롤플레잉 · 캐릭터 일관성 등 · 수집 2026-09-08

평가 범위와 주의사항

평가 조건과 데이터 이용 범위를 검토 중입니다. 수록 전까지 미측정으로 표시하며 종합 점수에서 제외합니다.

스토리텔링

94.7 백분위
EQ-Bench · Creative Writing v3 ↗

원점수 1,934.6 · 원본 순위 8/133

평가 모델: claude-fable-5

Creative Writing v3 · 영어 창작 글쓰기 · LLM 심사 · 수집 2026-09-08

평가 범위와 주의사항

스토리텔링의 대리 지표입니다. 영어 평가이며 허구적 롤플레잉이나 광고 성과를 직접 평가하지 않습니다. 게시일 미제공: 수집일만 표시합니다.

감정 이해

96.3 백분위
EQ-Bench 4 ↗

원점수 1,340.4 · 원본 순위 2/28 · 표본 120 · 신뢰구간 1,328.5–1,355.2

평가 모델: claude-fable-5

EQ-Bench 4 · 영어 · 16턴 대화 · 정서·사회적 상호작용 · 수집 2026-09-08 · 발표 2026-07-26

평가 범위와 주의사항

LLM이 심사하는 사회적 상황 대화 평가입니다. 감정을 실제로 느끼는지, 허구 캐릭터 연기, 한국어 감정 표현을 측정하지 않습니다.

창작 글쓰기

100.0 백분위
Arena · Creative Writing ↗

원점수 1,504.45 · 원본 순위 1/398 · 표본 5,480 · 신뢰구간 1,495.43–1,513.47

평가 모델: claude-fable-5

Text Arena · Style Control · 창작 글쓰기 선호도 · 여러 언어 · 수집 2026-09-08 · 발표 2026-09-02

평가 범위와 주의사항

사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.

한국어

100.0 백분위
Arena · 한국어 ↗

원점수 1,501.26 · 원본 순위 1/265 · 표본 548 · 신뢰구간 1,474.25–1,528.26

평가 모델: claude-fable-5

Text Arena · Style Control · 한국어 응답 선호도 · 전체 텍스트 작업 · 수집 2026-09-08 · 발표 2026-09-02

평가 범위와 주의사항

사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.

NSFW 정책 미확인 · 이 모델의 현재 공급 경로에서 성인 창작 텍스트 허용을 확인한 정책 근거가 없습니다. 모더레이션 미적용 표기는 허용을 뜻하지 않습니다.

종합 점수는 스토리텔링·감정 이해·창작 글쓰기·선택 언어의 출처별 순위 백분위를 각각 25%로 평균한 ArcRouter 편집 지표입니다. 네 지표가 모두 있는 모델만 산출합니다. 롤플레잉·사용량·NSFW는 포함하지 않습니다. 벤치마크의 언어·버전·평가 설정은 서로 다르며, 점수는 실제 작업 성과를 보장하지 않습니다.

IN THE WILD

실제로 어디에 쓰이고 있을까?

OpenRouter의 분야별 요청 점유율 순위입니다. 토큰 점유율도 함께 제공하며, 실제 활용 동향을 보여줍니다.

2026-09-07 기준 · 최근 7일 · OpenRouter 표본 · 전체 언어

출처: OpenRouter Rankings · CC BY 4.0 · 수집 2026-09-08 · 분야별 표본 요청·토큰 점유율입니다. 공식 API가 공개한 상위 모델만 포함하므로 비율의 합은 100%보다 작을 수 있습니다. 요청 기준 순위와 확인된 모델 ID를 유지하며, 이 사용량 순위는 레이더와 종합 점수에 합산하지 않습니다.

HOW TO READ

숫자 뒤의 기준도 투명하게

서로 다른 벤치마크를 읽는 방법

01. 같은 척도로 읽기

각 출처의 원본 순위를 100 × (전체 모델 수 − 순위) / (전체 모델 수 − 1)로 환산합니다. 100은 해당 평가의 최상위이며 정답률은 아닙니다.

02. 빈칸은 그대로

정확한 모델과 평가 버전을 연결할 수 없으면 미수록으로 남깁니다. 0점 처리나 다른 모델의 점수 대입은 하지 않습니다.

03. 언어와 용도 구분

영어 창작 평가와 선택 언어의 일반 선호도는 별도 축입니다. 한국어를 선택해도 영어 평가가 한국어 창작 평가로 바뀌지 않습니다.

04. NSFW는 정책

성능과 분리해 공급자별 허용 정책을 확인합니다. 오픈웨이트 여부나 검열 메타데이터만으로 성인 창작 허용을 판단하지 않습니다.

종합 점수는 스토리텔링·감정 이해·창작 글쓰기·선택 언어의 출처별 순위 백분위를 각각 25%로 평균한 ArcRouter 편집 지표입니다. 네 지표가 모두 있는 모델만 산출합니다. 롤플레잉·사용량·NSFW는 포함하지 않습니다. 벤치마크의 언어·버전·평가 설정은 서로 다르며, 점수는 실제 작업 성과를 보장하지 않습니다.

OpenRouter의 Roleplay & Fiction, Content Writing, Customer Support 분류는 실제 활용 동향을 보는 데 유용합니다. 사용량·지출 순위는 품질 평가가 아니므로 이 점수에 합산하지 않습니다.

출처 · 평가 범위 · 수집 날짜 (7)
Arena · 한국어 ↗

한국어 응답 선호도 · 전체 텍스트 작업

사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.

Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02

Arena · 영어 ↗

영어 응답 선호도 · 전체 텍스트 작업

사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.

Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02

Arena · 일본어 ↗

일본어 응답 선호도 · 전체 텍스트 작업

사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.

Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02

Arena · Creative Writing ↗

창작 글쓰기 선호도 · 여러 언어

사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.

Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02

EQ-Bench · Creative Writing v3 ↗

영어 창작 글쓰기 · LLM 심사

스토리텔링의 대리 지표입니다. 영어 평가이며 허구적 롤플레잉이나 광고 성과를 직접 평가하지 않습니다. 게시일 미제공: 수집일만 표시합니다.

Creative Writing v3 · 수집 2026-09-08

EQ-Bench 4 ↗

영어 · 16턴 대화 · 정서·사회적 상호작용

LLM이 심사하는 사회적 상황 대화 평가입니다. 감정을 실제로 느끼는지, 허구 캐릭터 연기, 한국어 감정 표현을 측정하지 않습니다.

EQ-Bench 4 · 수집 2026-09-08 · 발표 2026-07-26

RP-Bench · 검토 중 ↗

허구적 롤플레잉 · 캐릭터 일관성 등

평가 조건과 데이터 이용 범위를 검토 중입니다. 수록 전까지 미측정으로 표시하며 종합 점수에서 제외합니다.

미수록 · 수집 2026-09-08