NPC 대사 벤치마크 모델 선택기

모델명 제공사 등급 입력(1M tok) 출력(1M tok) 추정 세션비용 컨텍스트 제한 주요 용도

인간 검수 (Human Evaluation)

벤치마크 실행 후 생성된 results/runs.jsonl 파일을 업로드하여, 각 모델의 한국어 정확성, 유창성, 그리고 대답 시 지연 시간(Latency)을 사람이 직접 검수합니다.

runs.jsonl 로그 파일 업로드

이곳을 클릭하거나 runs.jsonl 파일을 드래그 앤 드롭 하세요.

벤치마크 개요

  • 온라인 판타지 게임 NPC 대사 생성에 최적화된 LLM을 비교 분석하기 위한 성능 평가 도구입니다.
  • 모든 평가는 한국어 기반 시나리오 및 한국어 심사관 채점 루브릭을 기준으로 수행됩니다.
  • 가장 적절한 대사 품질과 응답 속도, 비용 효율성(가성비)을 만족하는 모델을 판별하는 것을 목적으로 합니다.

세션 추정 비용 기준 및 분량 안내

  • 단일 세션 기준: 플레이어와 NPC가 대화를 총 20회 왕복하는 분량 (총 20턴)
  • 턴당 프롬프트 (약 3,000 토큰) 분량 체감:
    • 한국어 텍스트 기준 공백 포함 약 2,000자 ~ 3,000자 범위에 해당합니다.
    • A4 용지 단면 기준으로 약 1.5장 ~ 2장을 채우는 텍스트 분량입니다.
    • 이 분량은 NPC의 시스템 지침(페르소나 정의), 대화 기본 배경 지식, 팩트 저장소의 갱신 목록, 그리고 최근 대화 맥락 히스토리가 모두 누적 전송되는 실전 입력 크기를 나타냅니다.
  • 턴당 응답 (약 150 토큰) 분량 체감:
    • 한국어 구어체 기준 공백 포함 약 100자 ~ 150자 내외에 해당합니다.
    • 줄글 기준 약 2 ~ 4개 문장의 짧고 자연스러운 캐릭터 독백 및 대사 분량입니다.
    • 일반적인 MMORPG/RPG 게임 내의 기본 대화창에 한 번에 표시되는 텍스트 양에 가깝습니다.
  • 세션당 총 소모량:
    • 매 턴마다 이전 대화 상태를 포함한 3,150 토큰 가량이 호출 서버로 누적 입력되므로, 20턴 세션을 완주할 경우 한 세션당 대략 63,000 토큰이 누적 사용됩니다.

평가 방식 및 측정 지표

  • 기억지수 (기억력 검증)
    • 대화 중에 주어진 정보(사용자 이름, 직업 등)를 정확히 회상하는지 여부 (Recall)
    • 대화 중간에 수정된 정보가 있을 때, 수정된 내용으로 잘 갱신하여 인지하는지 여부 (Recall Updated)
    • 대화에 주어지지 않은 임의의 사실을 참인 것처럼 거짓 동조하여 대답하지 않는지 여부 (False Premise 방지)
    • 게임 미공개 영역 등 모르는 사실에 대해 모른다고 솔직히 답하는지 여부 (Abstain)
  • 품질지수 (대사 적절성)
    • 독립적인 LLM 심사관이 대사의 맥락 적절성, 자연스러움, 감정 공감도를 1~5점 척도로 평가합니다.
  • 캐릭터 유지도 (OOC 방지)
    • "너는 AI 모델이니?" 등 정체성을 유도하는 질문에 캐릭터의 페르소나를 잃지 않고 방어하는지 검출합니다.
  • 인프라 및 비용
    • 첫 번째 토큰 응답 속도(TTFT) 및 단일 세션당 사용된 총 API 비용(USD)을 수집하여 비교합니다.

프롬프트 토큰 절감 전략

  • 컨텍스트 캐싱 (Context Caching)
    • 접속 시점마다 고정되는 페르소나 지침, 고정 지식 등의 접두사(Prefix) 영역을 API 공급자 서버에 캐싱해 둡니다.
    • 캐시가 적중(Hit)하는 경우 입력 토큰 단가를 최소 50%에서 최대 90%까지 대폭 할인받을 수 있습니다.
    • 대화 주기가 잦은 게임 NPC 서버 환경에서 비용을 절감하는 핵심 기술입니다.
  • 메모리 아키텍처 다이어트 (Memory Optimization)
    • 이전 대화를 원본 그대로 전송하는 슬라이딩 윈도우 방식을 조절하여, 최근 5~8턴의 발화 기록만 남겨둡니다.
    • 그 이전의 대화 내역은 1~2문장으로 핵심만 요약한 타임라인 목록으로 병합하여 프롬프트 토큰 증가를 억제합니다.
    • 수만 단어에 달하는 거대한 게임 세계관 정보를 통째로 전송하는 대신, 사용자 최근 대사에서 키워드를 추출해 연관성 높은 2~3개의 정보만 벡터 DB에서 동적 검색(RAG)해 주입합니다.
  • 프롬프트 영문(English) 최적화
    • 한글은 글자당 약 1.5~2.5토큰을 소비하지만, 영어는 단어당 약 1.3토큰 내외를 소모하여 영어 기술 시 2배 이상의 토큰 전송 효율이 발생합니다.
    • NPC의 행동 방식, 금지 조항 등 백엔드 지침을 영문으로 작성하고 최하단에 "항상 친절한 한국어로 답변할 것"의 1줄 지침만 추가하여 비용을 절감합니다.
  • 프롬프트 텍스트 압축 (Prompt Compression)
    • 불필요한 공백, 연속 개행, 탭 등 비효율적인 구문 서식을 줄이고 명료한 XML 태그 방식으로 프롬프트 레이아웃을 최적화합니다.
    • 소형 보조 모델을 이용해 정보 밀도가 낮은 텍스트를 기계적으로 필터링/압축(LLMLingua 기법)하여 본 모델에 전송합니다.
입력하신 API Key는 브라우저의 로컬 스토리지에만 보관됩니다.

1. 모델 구성 파일 내용 (selection.json)

[]

2. 터미널 실행 스크립트

# 선택된 모델이 없습니다.