Roleplay & Fiction
요청 점유율 순- 126.3%토큰 19.6%
- 215.6%토큰 11.3%
- 3gemini-2.5-flash-lite5.1%토큰 3.2%
- 44.7%토큰 5.6%
- 53.5%토큰 6.0%
- 63.5%토큰 1.3%
- 7gpt-oss-20b3.3%토큰 1.3%
- 82.8%토큰 2.7%
- 92.7%토큰 2.1%
- 102.7%토큰 2.8%
ARCROUTER / CREATIVE INTELLIGENCE
게임의 캐릭터부터 브랜드의 한 문장까지.
창작자를 위해 흩어진 공개 벤치마크를 하나의 프로필로 모았습니다.
창작 모델을 고르는 새로운 기준
품질 프로필 축
공개 점수 수록 모델
수집 기준 2026-09-08
수록 버전의 스냅샷이며 실시간 순위가 아닙니다.
스토리텔링 · 감성 이해 · 콘텐츠 작성 · 선택 언어의 4개 지표를 함께 비교합니다.
| 순위 | 모델 | 롤플레잉 활용OpenRouter 요청 % | 종합 | 스토리 | 감성 | 글쓰기 | 한국어 | |
|---|---|---|---|---|---|---|---|---|
| 1 | — | 97.7 | 94.7 | 96.3 | 100.0 | 100.0 | ||
| 2 | — | 93.6 | 93.2 | 85.2 | 98.2 | 97.7 | ||
| 3 | — | 90.2 | 88.6 | 81.5 | 95.5 | 95.1 | ||
| 4 | — | 88.9 | 93.9 | 74.1 | 89.4 | 98.1 | ||
| 5 | — | 85.0 | 89.4 | 77.8 | 86.6 | 86.0 | ||
| 6 | — | 83.8 | 85.6 | 55.6 | 98.0 | 96.2 | ||
| 7 | — | 78.1 | 86.4 | 44.4 | 91.7 | 89.8 | ||
| 8 | — | 72.7 | 81.1 | 40.7 | 84.6 | 84.5 | ||
| 9 | — | 70.9 | 58.3 | 48.1 | 85.9 | 91.3 | ||
| 10 | — | 69.3 | 56.8 | 25.9 | 97.7 | 96.6 | ||
| 11 | — | 67.7 | 62.1 | 37.0 | 88.9 | 82.6 | ||
| — | 4위4.7% | — | 60.6 | — | 76.1 | 62.1 | ||
| — | 1위26.3% | — | 62.9 | — | 79.3 | 73.1 | ||
| — | — | — | 59.1 | — | 65.5 | 58.7 | ||
| — | — | — | 49.2 | — | 71.3 | 56.1 | ||
| — | — | — | 63.6 | — | 86.4 | 83.7 | ||
| — | — | — | 31.8 | — | 58.4 | 43.6 | ||
| — | — | — | — | 11.1 | 83.4 | 78.4 | ||
| — | — | — | 65.9 | — | 92.2 | 81.8 | ||
| — | — | — | 40.2 | — | 61.5 | 31.1 |
— 미수록 · 롤플레잉 활용은 OpenRouter 요청 점유율 순위이며, 레이더와 종합 점수에 포함하지 않습니다. 종합은 4개 확정 품질 지표가 모두 있는 모델에만 표시합니다.
BEHIND THE SCORE
CREATIVE PROFILE
공개 벤치마크 내 상대 백분위 · 한국어 기준 · 2026-09-08 수집
종합 · 4개 지표
확정된 4개 지표로만 산출
미수록은 0점이 아닙니다. 평가가 없는 축은 비워 두며, 모든 축이 채워질 때만 면을 연결합니다.
품질 평가와 OpenRouter 상위 10개 사용 순위에 아직 수록되지 않았습니다. 롤플레잉 활용 순위 보기 ↗
미수록 · 허구적 롤플레잉 · 캐릭터 일관성 등 · 수집 2026-09-08
평가 조건과 데이터 이용 범위를 검토 중입니다. 수록 전까지 미측정으로 표시하며 종합 점수에서 제외합니다.
원점수 1,934.6 · 원본 순위 8/133
평가 모델: claude-fable-5
Creative Writing v3 · 영어 창작 글쓰기 · LLM 심사 · 수집 2026-09-08
스토리텔링의 대리 지표입니다. 영어 평가이며 허구적 롤플레잉이나 광고 성과를 직접 평가하지 않습니다. 게시일 미제공: 수집일만 표시합니다.
원점수 1,340.4 · 원본 순위 2/28 · 표본 120 · 신뢰구간 1,328.5–1,355.2
평가 모델: claude-fable-5
EQ-Bench 4 · 영어 · 16턴 대화 · 정서·사회적 상호작용 · 수집 2026-09-08 · 발표 2026-07-26
LLM이 심사하는 사회적 상황 대화 평가입니다. 감정을 실제로 느끼는지, 허구 캐릭터 연기, 한국어 감정 표현을 측정하지 않습니다.
원점수 1,504.45 · 원본 순위 1/398 · 표본 5,480 · 신뢰구간 1,495.43–1,513.47
평가 모델: claude-fable-5
Text Arena · Style Control · 창작 글쓰기 선호도 · 여러 언어 · 수집 2026-09-08 · 발표 2026-09-02
사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.
원점수 1,501.26 · 원본 순위 1/265 · 표본 548 · 신뢰구간 1,474.25–1,528.26
평가 모델: claude-fable-5
Text Arena · Style Control · 한국어 응답 선호도 · 전체 텍스트 작업 · 수집 2026-09-08 · 발표 2026-09-02
사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.
NSFW 정책 미확인 · 이 모델의 현재 공급 경로에서 성인 창작 텍스트 허용을 확인한 정책 근거가 없습니다. 모더레이션 미적용 표기는 허용을 뜻하지 않습니다.
종합 점수는 스토리텔링·감정 이해·창작 글쓰기·선택 언어의 출처별 순위 백분위를 각각 25%로 평균한 ArcRouter 편집 지표입니다. 네 지표가 모두 있는 모델만 산출합니다. 롤플레잉·사용량·NSFW는 포함하지 않습니다. 벤치마크의 언어·버전·평가 설정은 서로 다르며, 점수는 실제 작업 성과를 보장하지 않습니다.
IN THE WILD
OpenRouter의 분야별 요청 점유율 순위입니다. 토큰 점유율도 함께 제공하며, 실제 활용 동향을 보여줍니다.
출처: OpenRouter Rankings · CC BY 4.0 · 수집 2026-09-08 · 분야별 표본 요청·토큰 점유율입니다. 공식 API가 공개한 상위 모델만 포함하므로 비율의 합은 100%보다 작을 수 있습니다. 요청 기준 순위와 확인된 모델 ID를 유지하며, 이 사용량 순위는 레이더와 종합 점수에 합산하지 않습니다.
HOW TO READ
각 출처의 원본 순위를 100 × (전체 모델 수 − 순위) / (전체 모델 수 − 1)로 환산합니다. 100은 해당 평가의 최상위이며 정답률은 아닙니다.
정확한 모델과 평가 버전을 연결할 수 없으면 미수록으로 남깁니다. 0점 처리나 다른 모델의 점수 대입은 하지 않습니다.
영어 창작 평가와 선택 언어의 일반 선호도는 별도 축입니다. 한국어를 선택해도 영어 평가가 한국어 창작 평가로 바뀌지 않습니다.
성능과 분리해 공급자별 허용 정책을 확인합니다. 오픈웨이트 여부나 검열 메타데이터만으로 성인 창작 허용을 판단하지 않습니다.
종합 점수는 스토리텔링·감정 이해·창작 글쓰기·선택 언어의 출처별 순위 백분위를 각각 25%로 평균한 ArcRouter 편집 지표입니다. 네 지표가 모두 있는 모델만 산출합니다. 롤플레잉·사용량·NSFW는 포함하지 않습니다. 벤치마크의 언어·버전·평가 설정은 서로 다르며, 점수는 실제 작업 성과를 보장하지 않습니다.
OpenRouter의 Roleplay & Fiction, Content Writing, Customer Support 분류는 실제 활용 동향을 보는 데 유용합니다. 사용량·지출 순위는 품질 평가가 아니므로 이 점수에 합산하지 않습니다.
한국어 응답 선호도 · 전체 텍스트 작업
사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.
Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02
영어 응답 선호도 · 전체 텍스트 작업
사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.
Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02
일본어 응답 선호도 · 전체 텍스트 작업
사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.
Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02
창작 글쓰기 선호도 · 여러 언어
사람의 쌍대 비교 투표, 스타일 보정 적용. 언어 점수는 해당 언어의 창작 전용 평가가 아닙니다.
Text Arena · Style Control · 수집 2026-09-08 · 발표 2026-09-02
영어 창작 글쓰기 · LLM 심사
스토리텔링의 대리 지표입니다. 영어 평가이며 허구적 롤플레잉이나 광고 성과를 직접 평가하지 않습니다. 게시일 미제공: 수집일만 표시합니다.
Creative Writing v3 · 수집 2026-09-08
영어 · 16턴 대화 · 정서·사회적 상호작용
LLM이 심사하는 사회적 상황 대화 평가입니다. 감정을 실제로 느끼는지, 허구 캐릭터 연기, 한국어 감정 표현을 측정하지 않습니다.
EQ-Bench 4 · 수집 2026-09-08 · 발표 2026-07-26
허구적 롤플레잉 · 캐릭터 일관성 등
평가 조건과 데이터 이용 범위를 검토 중입니다. 수록 전까지 미측정으로 표시하며 종합 점수에서 제외합니다.
미수록 · 수집 2026-09-08