精度の測り方
ランディングページのすべての数値は、以下の測定に由来します — 答案、スコア、そして外した分も、私たち自身の分を含めて。
答案セット:試験官のスコア付きで出版された Cambridge 19 の答案に、IDP が公表した Band 9 サンプル答案を加えたもの。すべて公開資料です — Cambridge 19 は試験官のスコアが印刷された状態でどの書店にもあり、IDP は Band 9 サンプルを自社サイトで公開しています。
プロトコル:すべてのシステムが同一の採点プロンプトを受け取り — 同じテキスト、同じ形式、誘導なし — 9 Aug 2026 に各答案を 3 回採点しました。すべての数値は各システムの中央値で、私たちの数値はユーザーが実際に通るのと同じ採点経路を通っています。
的中だけでなく誤差も公開します:平均誤差は 0.22 Band、8.0 の答案を 7.5 と読み、Gemini は的中させ、そしてどのシステムも — 私たちを含め — IDP が公表した 9 には届きません。誠実な測定とはこういうものであり、「±0.5」を約束する代わりに、私たちはそう明言します。
まぐれの 1 本ではありません。
試験官採点済みの答案 9 件すべてで — 私たちの平均誤差は 0.22 Band。Gemini 0.72 · ChatGPT 0.94 · DeepSeek 0.94 · Claude 1.50。9 件中 9 件で半 Band 以内に収まり、どちらの方向への偏りもゼロ — チャットボットはどれも低く読みます。
試験官の Band に対する平均誤差 — 小さいほど良い。
1 本の答案での最大の誤差:IELTS Ace 0.5 · ChatGPT 1.0 · DeepSeek 1.5 · Gemini 2.0 · Claude 2.5 バンド。
答案を 1 件ずつ
| 答案 | 試験官の Band | ChatGPT | Gemini | DeepSeek | Claude | IELTS Ace |
|---|---|---|---|---|---|---|
| Cambridge 19 · Test 2 · Task 1 | 4.0 | 3.0 (−1.0) | 2.0 (−2.0) | 3.0 (−1.0) | 1.5 (−2.5) | 4.5 (+0.5) |
| Cambridge 19 · Test 1 · Task 1 | 5.5 | 5.0 (−0.5) | 5.0 (−0.5) | 5.5 (0.0) | 4.5 (−1.0) | 5.5 ✓ |
| Cambridge 19 · Test 1 · Task 1 | 6.0 | 5.0 (−1.0) | 5.0 (−1.0) | 4.5 (−1.5) | 4.5 (−1.5) | 6.0 ✓ |
| Cambridge 19 · Test 2 · Task 2 | 7.0 | 6.0 (−1.0) | 6.5 (−0.5) | 5.5 (−1.5) | 5.5 (−1.5) | 7.0 ✓ |
| Cambridge 19 · Test 1 · Task 2 | 8.0 | 6.5 (−1.5) | 8.0 (0.0) | 6.5 (−1.5) | 6.5 (−1.5) | 7.5 (−0.5) |
| IDP · published Band 9 sample · Task 1 | 9.0 | 7.0 (−2.0) | 8.0 (−1.0) | 6.5 (−2.5) | 5.5 (−3.5) | 8.0 (−1.0) |
ランディングページに掲載した 4 件の答案。生の出力を含む全 9 件の表は、対称再測定とともに公開します。
← ランディングページに戻る