报告显示 3.0–5.5
问一个免费工具,一位真实水平 4.0 的考生会听到 1.5–3.0 — Gemini 说 2.0。我们说 4.0:与考官的分数段完全一致。
同一篇作文 · 给每个 AI 相同的指令 · 分数却大相径庭
报告显示 3.0–5.5
问一个免费工具,一位真实水平 4.0 的考生会听到 1.5–3.0 — Gemini 说 2.0。我们说 4.0:与考官的分数段完全一致。
报告显示 5.0–5.5
考官给 5.0;这份 144 词的答卷我们读成 5.5。高了半档 — 与同样低了半档的 Gemini、DeepSeek 距离相同。我们照登,因为不给你看平局,你也没法相信我们的胜局。
报告显示 5.5–6.5
一份 5.5 的答卷,多数聊天机器人读成 4.5–5.0。我们读成 6.0 — 高了半档;读得分毫不差的是 DeepSeek。
报告显示 5.5–6.5
要是信了聊天机器人,你会以为自己只有 4.5 — 而这篇答卷本来就是 6.0。
报告显示 6.5–8.0
一篇 Band 7 作文被判成 5.5 — 那就是为一门你根本不需要的课程再交一次钱。
报告显示 7.0–8.5
我们在本页唯一的偏差:半个分数段 — 就印在 Gemini 唯一一次精准命中的旁边。你看得到一切,所以你可以相信一切。
报告显示 7.0–8.5
没有哪个 AI 给 IDP 自己的满分范文打 9 分 — 一半读成 5.5–6.5。我们读成 7.5,而 Gemini 比我们读得更近。这是我们输掉的一张,就摆在赢的那几张旁边。
在全部十份考官已评分答卷上 — 我们的平均偏差:0.30 个分数段。Gemini 0.70 · DeepSeek 0.90 · ChatGPT 0.95 · Claude 1.50。十份里有九份落在半个分数段以内。第十份 — 一份 4.0 的答卷我们读成 5.0 — 是这组里我们最差的一次,也计入了上面那个平均值。
公开出版、考官已评分的《剑桥雅思》19 与 20 答卷,加上 IDP 公布的 Band 9 范文 — 每一份你都可以查证。包括我们在内的每个系统,都用完全相同的指令给每份答卷评了三次分;页面上的每个数字都是该系统的中位数(9 Aug 2026 (chatbots) · 2 Sep 2026 (ours))。模型版本与逐题原始数据在准确度页面。我们最接近,但并不完美:平均偏差 0.30 个分数段 — 十份中五份分毫不差、四份差半档、一份高了整整一档 — 我们全部如实公布。
与考官分数的平均偏差 — 越小越好。
单份答卷的最大偏差:IELTS Ace 1.0 · ChatGPT 1.5 · DeepSeek 1.5 · Gemini 2.0 · Claude 2.5 个分段。
“Overall the essay fits the band 7 description. Good range of complex sentences. To improve, use more advanced vocabulary and check your grammar carefully.”
✗ 哪句话丢了分 — 不告诉你✗ 你的用词有无标注 — 没有✗ 一篇修改后的范文 — 没有
查看这份完整报告 →“Overall, the speech fits well within the band 7 description due to its smooth flow, despite the slow pace and lack of cohesive devices affecting clarity.”
✗ 哪个词发音有误 — 不标注✗ 你在文本的哪里卡顿 — 不显示✗ 一份参考答案 — 没有
查看这份完整报告 →
查看这份完整报告 →
查看这份完整报告 →
Liz 为你评分、授课、陪练。同一个声音贯穿写作、口语和你的每日学习计划。
提交写作或口语,获得带批注的估分 — 用你的语言。
Part 1、2、3 专项练习,配真实发音反馈和追问。
结构化课程:短课时、练习和为你定制的进度跟踪。
任何 Task 1 或 Task 2 题目,任何口语部分。首次批改无需账号。
你的作文会与官方分数段描述逐条比对,分数段编号已隐藏,每一次选择都必须引用你自己的句子;口语则按可计数的特征评分。分数由描述在代码中决定,而不是某个模型的看法。
各项标准的分数、让你丢分的具体句子,以及最快的提分路径 — 用你自己的语言讲解。
写作和口语按官方标准评分 — 阅读和听力反馈还会指出证明每个答案的那句原文。这一点没有别家在做。
你的目标分数、考试日期和薄弱环节,每节课都会被提及。文字聊天或实时语音对话。
计时、按分数段加权、四项技能齐全 — 每次模考后附一份校准过的学习计划。
每一条解释都用你自己的语言给出 — 因为用你还在学的语言说“提升你的连贯性”,对谁都没有帮助。
不是。这是练习估分。在公开出版、考官已评分的答卷上,我们的平均偏差是 0.30 个分数段 — 经过实测并公布在本页 — 但只有 IDP 和 British Council 能颁发真实成绩。
对比中的每篇作文都连同考官分数一起公开出版 — 《剑桥雅思19》任何书店都有。自己去核对答案,或阅读附原始数据的完整测评方法。
因为它从未听到你说话。四项官方标准中的两项 — 发音,以及流利度与连贯性中的流利度部分 — 都藏在声音里:停顿、语速、填充词、迟疑、语调。聊天机器人读的是你打出来的文字稿,而打出来的文字稿总在美化你:“嗯”消失了,自动纠错替你修好了语法,你写下的是你想说的,而不是你实际说出的。我们直接给录音本身评分 — 逐词发音、节奏、填充词 — 再把官方分数段描述套在你真正说出的内容上。
支持 — 评分读的是你的英文,而每一条“该改什么”的解释都用你自己的语言给出:越南语、土耳其语、中文、阿拉伯语、韩语、泰语、日语、西班牙语、葡萄牙语、俄语、印尼语或英语。
随时可以,一键完成 — 周卡和月卡在已付周期结束时停止。Exam Pack 是一次性付费,没有需要取消的东西。