我们如何测量准确度
首页上的每一个数字都来自下面这次测量 — 答卷、分数与偏差,包括我们自己的偏差。
答卷集:公开出版、考官已评分的《剑桥雅思19》答卷,加上 IDP 公布的 Band 9 范文。每一份都是公开的 — 《剑桥雅思19》任何书店都有,考官分数印在书里;IDP 的 Band 9 范文发布在其官网上。
流程:每个系统收到的评分指令完全相同 — 同样的文本、同样的格式、没有任何引导 — 并在 9 Aug 2026 (chatbots) · 2 Sep 2026 (ours) 给每份答卷评了三次分。每个数字都是该系统的中位数;我们的数字走的是用户实际使用的同一条评分链路。
偏差和命中我们都公布:平均偏差 0.30 个分数段,8.0 那篇我们判成 7.5 而 Gemini 精准命中,且没有任何系统 — 包括我们 — 达到 IDP 公布的 9 分。诚实的测量就该是这个样子,我们直说,而不是承诺“±0.5”。
自2026年9月6日起,每份报告都会在最可能的分数旁显示一个区间——即在类似评分中考官分数所落入的范围,例如 6.5–8.0 · 最可能 7.0。下表中的分数是每次评分最可能的分数。
不是碰巧只对一篇。
在全部十份考官已评分答卷上 — 我们的平均偏差:0.30 个分数段。Gemini 0.70 · DeepSeek 0.90 · ChatGPT 0.95 · Claude 1.50。十份里有九份落在半个分数段以内。第十份 — 一份 4.0 的答卷我们读成 5.0 — 是这组里我们最差的一次,也计入了上面那个平均值。
与考官分数的平均偏差 — 越小越好。
单份答卷的最大偏差:IELTS Ace 1.0 · ChatGPT 1.5 · DeepSeek 1.5 · Gemini 2.0 · Claude 2.5 个分段。
答卷,逐一列出
| 答卷 | 考官分数 | ChatGPT | Gemini | DeepSeek | Claude | IELTS Ace |
|---|---|---|---|---|---|---|
| Cambridge 19 · Test 2 · Task 1 | 4.0 | 3.0 (−1.0) | 2.0 (−2.0) | 3.0 (−1.0) | 1.5 (−2.5) | 4.0 ✓ |
| Cambridge 20 · Test 3 · Task 1 | 5.0 | 4.0 (−1.0) | 4.5 (−0.5) | 4.5 (−0.5) | 3.5 (−1.5) | 5.5 (+0.5) |
| Cambridge 19 · Test 1 · Task 1 | 5.5 | 5.0 (−0.5) | 5.0 (−0.5) | 5.5 (0.0) | 4.5 (−1.0) | 6.0 (+0.5) |
| Cambridge 19 · Test 1 · Task 1 | 6.0 | 5.0 (−1.0) | 5.0 (−1.0) | 4.5 (−1.5) | 4.5 (−1.5) | 6.0 ✓ |
| Cambridge 19 · Test 2 · Task 2 | 7.0 | 6.0 (−1.0) | 6.5 (−0.5) | 5.5 (−1.5) | 5.5 (−1.5) | 7.0 ✓ |
| Cambridge 19 · Test 1 · Task 2 | 8.0 | 6.5 (−1.5) | 8.0 (0.0) | 6.5 (−1.5) | 6.5 (−1.5) | 7.5 (−0.5) |
| IDP · published Band 9 sample (line graph) · Task 1 | 9.0 | 7.0 (−2.0) | 8.0 (−1.0) | 6.5 (−2.5) | 5.5 (−3.5) | 7.5 (−1.5) |
首页展示的四份答卷。附原始输出的完整九卷表格将随对称复测一并发布。
← 返回首页