어떤 모델에 맡길까요
프롬프트를 읽고 맞는 모델을 골라드려요.
어디서 쓰나요
프롬프트
예시로 해보기
판단 기준
능력치 숫자가 어디서 왔는지
측정값
| 성능 | Intelligence Index |
| 에이전트 | Terminal-Bench 4.0 |
| 무인 장시간 | AA-Briefcase v1.1 Elo |
| 속도 | 출력 tok/s와 첫 토큰 대기를 반반 |
| 컨텍스트 가격 | 각 벤더 공식 문서 |
벤더 자체 발표 수치는 쓰지 않습니다. 하니스와 서브셋이 달라 교차 비교가 성립하지 않아서요 — 같은 SWE-bench Verified인데 출처마다 72.5% / 85.2% / 95%가 나옵니다. Artificial Analysis는 모든 모델을 하나의 방법론으로 돌립니다.
측정값이 없을 때
일부 모델은 세부 벤치마크가 공개돼 있지 않습니다. 이때 범용 지능 지수로 대체하면 안 재본 모델이 근거 없이 잰 모델을 이깁니다. 측정된 값들의 중앙값을 써서 유불리를 없앴고, 대체한 사실은 추천 카드의 "측정값 출처"에 그대로 적힙니다.
측정값이 아닌 것
작업 유형별 요구도만은 정책값입니다. 글쓰기·창작을 교차 벤더로 가르는 공개 벤치마크가 없어서요. 있는 척하지 않고 밝혀 둡니다.