정확도를 측정하는 방법
랜딩 페이지의 모든 수치는 아래 측정에서 나왔습니다 — 답안, 점수, 그리고 오차까지, 저희 것도 포함해서요.
답안 세트: 시험관 점수와 함께 출판된 Cambridge 19 답안들과 IDP가 공개한 Band 9 샘플 답안. 전부 공개 자료입니다 — Cambridge 19는 시험관 점수가 인쇄된 채로 어느 서점에나 있고, IDP는 Band 9 샘플을 자사 사이트에 게시합니다.
프로토콜: 모든 시스템이 동일한 채점 프롬프트를 받았습니다 — 같은 텍스트, 같은 형식, 코칭 없음 — 그리고 9 Aug 2026에 모든 답안을 세 번씩 채점했습니다. 모든 수치는 해당 시스템의 중앙값이며, 저희 수치는 사용자가 실제로 거치는 것과 같은 채점 경로를 통과했습니다.
적중만이 아니라 오차도 공개합니다: 저희의 평균 오차는 0.22 Band이고, 8.0 답안을 7.5로 읽은 반면 Gemini는 정확히 맞혔으며, 저희를 포함한 어떤 시스템도 IDP가 공개한 9에는 도달하지 못했습니다. 정직한 측정이란 이런 모습이고, 저희는 “±0.5”를 약속하는 대신 이렇게 말합니다.
운 좋은 에세이 한 편이 아닙니다.
시험관이 채점한 답안 아홉 건 전체에서 — 저희의 평균 오차: 0.22 Band. Gemini 0.72 · ChatGPT 0.94 · DeepSeek 0.94 · Claude 1.50. 9건 중 9건 모두 반 Band 이내였고, 어느 쪽으로도 편향이 없었습니다 — 챗봇은 하나같이 낮게 읽습니다.
시험관 Band 대비 평균 오차 — 작을수록 좋습니다.
한 답안에서의 최대 오차: IELTS Ace 0.5 · ChatGPT 1.0 · DeepSeek 1.5 · Gemini 2.0 · Claude 2.5 밴드.
답안, 하나씩
| 답안 | 시험관 Band | ChatGPT | Gemini | DeepSeek | Claude | IELTS Ace |
|---|---|---|---|---|---|---|
| Cambridge 19 · Test 2 · Task 1 | 4.0 | 3.0 (−1.0) | 2.0 (−2.0) | 3.0 (−1.0) | 1.5 (−2.5) | 4.5 (+0.5) |
| Cambridge 19 · Test 1 · Task 1 | 5.5 | 5.0 (−0.5) | 5.0 (−0.5) | 5.5 (0.0) | 4.5 (−1.0) | 5.5 ✓ |
| Cambridge 19 · Test 1 · Task 1 | 6.0 | 5.0 (−1.0) | 5.0 (−1.0) | 4.5 (−1.5) | 4.5 (−1.5) | 6.0 ✓ |
| Cambridge 19 · Test 2 · Task 2 | 7.0 | 6.0 (−1.0) | 6.5 (−0.5) | 5.5 (−1.5) | 5.5 (−1.5) | 7.0 ✓ |
| Cambridge 19 · Test 1 · Task 2 | 8.0 | 6.5 (−1.5) | 8.0 (0.0) | 6.5 (−1.5) | 6.5 (−1.5) | 7.5 (−0.5) |
| IDP · published Band 9 sample · Task 1 | 9.0 | 7.0 (−2.0) | 8.0 (−1.0) | 6.5 (−2.5) | 5.5 (−3.5) | 8.0 (−1.0) |
랜딩 페이지에 표시된 4개의 답안. 원출력이 포함된 9개 답안 전체 표는 대칭 재측정과 함께 공개됩니다.
← 랜딩 페이지로 돌아가기