测评方法
我们如何测量准确度
首页上的每一个数字都来自下面这次测量 — 答卷、分数与偏差,包括我们自己的偏差。
测量于 9 Aug 2026 · 对称复测进行中
答卷集:公开出版、考官已评分的《剑桥雅思19》答卷,加上 IDP 公布的 Band 9 范文。每一份都是公开的 — 《剑桥雅思19》任何书店都有,考官分数印在书里;IDP 的 Band 9 范文发布在其官网上。
流程:每个系统收到的评分指令完全相同 — 同样的文本、同样的格式、没有任何引导 — 并在 9 Aug 2026 给每份答卷评了三次分。每个数字都是该系统的中位数;我们的数字走的是用户实际使用的同一条评分链路。
偏差和命中我们都公布:平均偏差 0.22 个分数段,8.0 那篇我们判成 7.5 而 Gemini 精准命中,且没有任何系统 — 包括我们 — 达到 IDP 公布的 9 分。诚实的测量就该是这个样子,我们直说,而不是承诺“±0.5”。
不是碰巧只对一篇。
在全部九份考官已评分答卷上 — 我们的平均偏差:0.22 个分数段。Gemini 0.72 · ChatGPT 0.94 · DeepSeek 0.94 · Claude 1.50。九份中九份我们都落在半个分数段以内,且没有任何方向性偏差 — 每个聊天机器人都判得偏低。
IELTS Ace0.22
Gemini0.72
ChatGPT0.94
DeepSeek0.94
Claude1.50
与考官分数的平均偏差 — 越小越好。
单份答卷的最大偏差:IELTS Ace 0.5 · ChatGPT 1.0 · DeepSeek 1.5 · Gemini 2.0 · Claude 2.5 个分段。
答卷,逐一列出
| 答卷 | 考官分数 | ChatGPT | Gemini | DeepSeek | Claude | IELTS Ace |
|---|---|---|---|---|---|---|
| Cambridge 19 · Test 2 · Task 1 | 4.0 | 3.0 (−1.0) | 2.0 (−2.0) | 3.0 (−1.0) | 1.5 (−2.5) | 4.5 (+0.5) |
| Cambridge 19 · Test 1 · Task 1 | 5.5 | 5.0 (−0.5) | 5.0 (−0.5) | 5.5 (0.0) | 4.5 (−1.0) | 5.5 ✓ |
| Cambridge 19 · Test 1 · Task 1 | 6.0 | 5.0 (−1.0) | 5.0 (−1.0) | 4.5 (−1.5) | 4.5 (−1.5) | 6.0 ✓ |
| Cambridge 19 · Test 2 · Task 2 | 7.0 | 6.0 (−1.0) | 6.5 (−0.5) | 5.5 (−1.5) | 5.5 (−1.5) | 7.0 ✓ |
| Cambridge 19 · Test 1 · Task 2 | 8.0 | 6.5 (−1.5) | 8.0 (0.0) | 6.5 (−1.5) | 6.5 (−1.5) | 7.5 (−0.5) |
| IDP · published Band 9 sample · Task 1 | 9.0 | 7.0 (−2.0) | 8.0 (−1.0) | 6.5 (−2.5) | 5.5 (−3.5) | 8.0 (−1.0) |
首页展示的四份答卷。附原始输出的完整九卷表格将随对称复测一并发布。
← 返回首页