정확도를 측정하는 방법
랜딩 페이지의 모든 수치는 아래 측정에서 나왔습니다 — 답안, 점수, 그리고 오차까지, 저희 것도 포함해서요.
답안 세트: 시험관 점수와 함께 출판된 Cambridge 19 답안들과 IDP가 공개한 Band 9 샘플 답안. 전부 공개 자료입니다 — Cambridge 19는 시험관 점수가 인쇄된 채로 어느 서점에나 있고, IDP는 Band 9 샘플을 자사 사이트에 게시합니다.
프로토콜: 모든 시스템이 동일한 채점 프롬프트를 받았습니다 — 같은 텍스트, 같은 형식, 코칭 없음 — 그리고 9 Aug 2026 (chatbots) · 2 Sep 2026 (ours)에 모든 답안을 세 번씩 채점했습니다. 모든 수치는 해당 시스템의 중앙값이며, 저희 수치는 사용자가 실제로 거치는 것과 같은 채점 경로를 통과했습니다.
적중만이 아니라 오차도 공개합니다: 저희의 평균 오차는 0.30 Band이고, 8.0 답안을 7.5로 읽은 반면 Gemini는 정확히 맞혔으며, 저희를 포함한 어떤 시스템도 IDP가 공개한 9에는 도달하지 못했습니다. 정직한 측정이란 이런 모습이고, 저희는 “±0.5”를 약속하는 대신 이렇게 말합니다.
2026년 9월 6일부터 모든 리포트는 가장 가능성 높은 밴드 옆에 범위를 표시합니다. 비슷한 채점에서 시험관의 밴드가 들어간 구간으로, 예를 들어 6.5–8.0 · 가장 가능성 높음 7.0입니다. 아래 표의 밴드는 각 채점에서 가장 가능성 높은 밴드입니다.
운 좋은 에세이 한 편이 아닙니다.
시험관이 채점한 답안 열 건 전체에서 — 저희의 평균 오차: 0.30 Band. Gemini 0.70 · DeepSeek 0.90 · ChatGPT 0.95 · Claude 1.50. 열 건 중 아홉 건이 반 Band 이내입니다. 나머지 한 건 — Band 4.0 답안을 5.0으로 읽은 것 — 이 이 묶음에서 저희 최악이고, 그 평균에도 포함돼 있습니다.
시험관 Band 대비 평균 오차 — 작을수록 좋습니다.
한 답안에서의 최대 오차: IELTS Ace 1.0 · ChatGPT 1.5 · DeepSeek 1.5 · Gemini 2.0 · Claude 2.5 밴드.
답안, 하나씩
| 답안 | 시험관 Band | ChatGPT | Gemini | DeepSeek | Claude | IELTS Ace |
|---|---|---|---|---|---|---|
| Cambridge 19 · Test 2 · Task 1 | 4.0 | 3.0 (−1.0) | 2.0 (−2.0) | 3.0 (−1.0) | 1.5 (−2.5) | 4.0 ✓ |
| Cambridge 20 · Test 3 · Task 1 | 5.0 | 4.0 (−1.0) | 4.5 (−0.5) | 4.5 (−0.5) | 3.5 (−1.5) | 5.5 (+0.5) |
| Cambridge 19 · Test 1 · Task 1 | 5.5 | 5.0 (−0.5) | 5.0 (−0.5) | 5.5 (0.0) | 4.5 (−1.0) | 6.0 (+0.5) |
| Cambridge 19 · Test 1 · Task 1 | 6.0 | 5.0 (−1.0) | 5.0 (−1.0) | 4.5 (−1.5) | 4.5 (−1.5) | 6.0 ✓ |
| Cambridge 19 · Test 2 · Task 2 | 7.0 | 6.0 (−1.0) | 6.5 (−0.5) | 5.5 (−1.5) | 5.5 (−1.5) | 7.0 ✓ |
| Cambridge 19 · Test 1 · Task 2 | 8.0 | 6.5 (−1.5) | 8.0 (0.0) | 6.5 (−1.5) | 6.5 (−1.5) | 7.5 (−0.5) |
| IDP · published Band 9 sample (line graph) · Task 1 | 9.0 | 7.0 (−2.0) | 8.0 (−1.0) | 6.5 (−2.5) | 5.5 (−3.5) | 7.5 (−1.5) |
랜딩 페이지에 표시된 4개의 답안. 원출력이 포함된 9개 답안 전체 표는 대칭 재측정과 함께 공개됩니다.
← 랜딩 페이지로 돌아가기