測定方法

精度の測り方

ランディングページのすべての数値は、以下の測定に由来します — 答案、スコア、そして外した分も、私たち自身の分を含めて。

9 Aug 2026 (chatbots) · 2 Sep 2026 (ours) に測定 · 対称再測定を実施中

答案セット:試験官のスコア付きで出版された Cambridge 19 の答案に、IDP が公表した Band 9 サンプル答案を加えたもの。すべて公開資料です — Cambridge 19 は試験官のスコアが印刷された状態でどの書店にもあり、IDP は Band 9 サンプルを自社サイトで公開しています。

プロトコル:すべてのシステムが同一の採点プロンプトを受け取り — 同じテキスト、同じ形式、誘導なし — 9 Aug 2026 (chatbots) · 2 Sep 2026 (ours) に各答案を 3 回採点しました。すべての数値は各システムの中央値で、私たちの数値はユーザーが実際に通るのと同じ採点経路を通っています。

的中だけでなく誤差も公開します:平均誤差は 0.30 Band、8.0 の答案を 7.5 と読み、Gemini は的中させ、そしてどのシステムも — 私たちを含め — IDP が公表した 9 には届きません。誠実な測定とはこういうものであり、「±0.5」を約束する代わりに、私たちはそう明言します。

2026年9月6日以降、すべてのレポートは最も可能性の高いバンドの横にレンジを表示します。これは、同様の採点で試験官のバンドが収まった範囲です(例:6.5–8.0 · 最有力 7.0)。下の表のバンドは、各採点で最も可能性の高いバンドです。

まぐれの 1 本ではありません。

試験官採点済みの答案 10 件すべてで — 私たちの平均誤差は 0.30 Band。Gemini 0.70 · DeepSeek 0.90 · ChatGPT 0.95 · Claude 1.50。10 件中 9 件は半 Band 以内です。残る 1 件 — Band 4.0 の答案を 5.0 と読んだもの — がこの組で最悪で、その平均にも含まれています。

答案を 1 件ずつ

答案試験官の BandChatGPTGeminiDeepSeekClaudeIELTS Ace
Cambridge 19 · Test 2 · Task 14.03.0 (−1.0)2.0 (−2.0)3.0 (−1.0)1.5 (−2.5)4.0 ✓
Cambridge 20 · Test 3 · Task 15.04.0 (−1.0)4.5 (−0.5)4.5 (−0.5)3.5 (−1.5)5.5 (+0.5)
Cambridge 19 · Test 1 · Task 15.55.0 (−0.5)5.0 (−0.5)5.5 (0.0)4.5 (−1.0)6.0 (+0.5)
Cambridge 19 · Test 1 · Task 16.05.0 (−1.0)5.0 (−1.0)4.5 (−1.5)4.5 (−1.5)6.0 ✓
Cambridge 19 · Test 2 · Task 27.06.0 (−1.0)6.5 (−0.5)5.5 (−1.5)5.5 (−1.5)7.0 ✓
Cambridge 19 · Test 1 · Task 28.06.5 (−1.5)8.0 (0.0)6.5 (−1.5)6.5 (−1.5)7.5 (−0.5)
IDP · published Band 9 sample (line graph) · Task 19.07.0 (−2.0)8.0 (−1.0)6.5 (−2.5)5.5 (−3.5)7.5 (−1.5)

ランディングページに掲載した 4 件の答案。生の出力を含む全 9 件の表は、対称再測定とともに公開します。

← ランディングページに戻る

教歴 10 年以上の英語教師が開発 — あなたと同じ試験に向けて勉強中です。

ChatGPT、Gemini、DeepSeek、Claude は各所有者の商標です。表示スコアは私たち自身の測定値です — 方法と生データは精度ページにあります。

IELTS は British Council、IDP: IELTS Australia、Cambridge University Press & Assessment の登録商標です。当サイトはいずれとも提携しておらず、承認も受けていません。ベンチマークの出典:試験官採点済みの公開答案 (Cambridge IELTS 19) と IDP が公表した Band 9 サンプル答案。方法の全文と生データはご要望に応じて提供します。