英语作文批改
把手写 OCR、句级反馈、教师复核与评分验证收成一条可追溯的教学工作流




【产品demo截图】输入层先保留手写原图与 OCR 文本的左右对照,让学生和老师能在评分前检查识别和阅读顺序是否可靠。
【高保真原型】学生端批改页先给出参考分数和整体评语,说明主旨是否清楚、读者是否读得懂,再下钻到内容、语言、结构扣分和句子改法。AI 分数仅供参考,最终成绩仍由教师确认。
【产品demo截图】学生端报告从总分下钻到内容、语言、段落结构、其他问题和句子提升建议,不只告诉学生哪里错了。将指针放在画面上,滚动查看超出高度的部分
【实际产品截图】教师端把 AI 预批改接回教学流程:教师查看提交与分布、核对错误案例,并保留最终判断。
为什么做
在 AI 学习空间 的学校合作中,深圳外国语学校初中部英语科组提出作文及日常练笔批改需求。老师反馈之前试用过的解决方案普遍评分偏高,且仅针对语法问题进行批改,没有关注到学生的表达与内容是否符合作文题目要求。其次,从方案落地形态层面考虑,其他解决方案需要老师收集全班所有作文后一页页用手机拍照上传,而在我们学习空间的硬件上,每位学生可以自主完成作文的拍照和提交,这也极大地减轻老师的机械工作量。
于是经过对教师的访谈之后,收集整理了教师精改作文时的工序,了解教师关注作文中的哪些部分。我没有先写一份覆盖所有理想能力的 PRD,而是用 Vibe Coding 在 3 天内搭出可运行 Demo,先回答几个更基础的问题:手写作文能否被稳定识别;反馈能否落到具体句子;AI 能否按照题目要求评价学生的表达能力;AI 分数与教师判断有多大偏差;等待、失败和人工接管应该出现在哪里。
作文批改的难点不是让模型按规则打出一个分数,而是判断学生能否用目标语言把主旨说清楚,写出别人读得懂、能共情的文章;同时保证输入可以核对、建议值得采纳、异常可以追溯,并让教师知道何时接管。
作文批改难在哪里
一篇作文的最终得分依赖多层判断:拍摄和手写质量影响 OCR,OCR 的文本和阅读顺序影响句子分析,句子分析又影响全文评价。任何上游偏差都会被下游放大。
评价对象本身更容易偏。许多 AI 批改停在规则层,关心拼写、时态、句式对不对。但对英语写作教学来说,规则只是底线。教师真正要看的是学生能不能用目标语言表达主旨:意思是否清楚,读者是否读得懂,情感和意图是否传达到。只抓语言形式,会把一篇主旨清楚、表达真诚的作文判成“错得多”,也会让学生误以为写作等于少犯错。
- 输入风险: 连笔、涂改、补写位置和拍摄质量会改变 OCR 结果。
- 评价风险: AI 容易把“写得对不对”当成“写得好不好”,忽略主旨是否清楚、读者能否理解和共情。
- 判断风险: 总体均值接近,不代表每一篇作文都可靠。
- 教学风险: 如果教师无法复核和查看班级共性问题,产品仍然只是个人工具。
三个关键产品判断
1. 识别结果必须可核对
当前原型使用多模态大模型完成 OCR。为了避免识别错误被静默带入评分,界面同时保留手写原图与 OCR 文本。教师可以先判断学生实际写了什么、阅读顺序是否正确,再理解后续评分依据。核对的不是识别得漂不漂亮,而是后面评价的是否仍是学生自己的表达。
2. 评价必须先看表达,再看规则
学生端报告先给出总分与整体评语,说明主旨是否清楚、读者是否读得懂、情感和意图是否传达到;再解释内容、语言、段落结构等扣分原因,并下钻到原句、修正句和修改逻辑。规则问题仍然要标,但它是底线,不是全文评价的中心。目标不是替学生润色出一篇更正确的作文,而是让学生知道意思有没有写出来、下一次该怎样表达。
3. AI 给出预批改,教师保留最终判断
教师端汇总提交人数、平均分、优秀人数、分数分布和典型案例。AI 承担扫描、预评分和归类;教师复核的不只是识别异常和语法错误,也包括 AI 是否把一篇读得懂、能共情的作文判低,或把主旨跑偏的作文判高。个性化评语和班级共性问题,仍由教师决定后续怎么教。
产品如何组织
保留原始作答与涂改痕迹
核对文本是否仍是学生原意
先看意思是否清楚,再给改法
先评主旨与可读性,再看语言
确认表达判断并查看班级洞察
这条链路把“识别”和“评分”分开,也把“规则检查”和“表达判断”分开,并把“AI 输出”和“教师确认”分开。顶部原型画廊按照同一顺序保留了 OCR 对照、学生批改页、详细报告与教师工作台;长报告可以在预览窗口内继续滚动查看。
评分验证:均值接近,不等于单篇可靠
我将 100+ 份真实作文的 AI 分数与教师分数逐篇对照。整体上,教师均分约为 10.22,AI 均分约为 9.91,均值相差约 0.31 分。这个结果说明当前方案值得继续验证,但不能直接写成“评分准确”。
15 分制人工批改
当前多模态方案
仍需检查单篇异常
平均数只能说明系统没有明显整体偏高或偏低,但是不能揭露少量大分差样本的问题所在。
从异常分差追到 OCR
复盘大分差作文后,定位到共性问题主要发生在 OCR,而不是评分规则本身。学生修改原文时,会划掉旧词并直接在上方补写新词。当前多模态大模型容易把补写词识别成独立的一行,打乱原句语序;评分模型随后基于错误文本分析,最终给出偏低分数。
- 01学生原始涂改
旧词被划掉,新词写在原位置上方。
- 02OCR 错误分行
补写词被识别成独立行,没有回到原句位置。
- 03整体语序改变
识别文本已经不再等同于学生实际表达。
- 04评分被输入带偏
下游基于错误文本扣分,出现明显偏低结果。
这次复盘把“模型偶尔不准”收敛成了一个可以继续解决的问题:复杂涂改下的手写版面还原。原图对照因此不是装饰,而是当前技术方案的必要校验入口。
当前方案与后续方向
多模态大模型承担 OCR
适合快速验证端到端链路,也能同时理解图像和文本;但面对划词、上方补写和复杂阅读顺序时,难以稳定恢复原句。
专用手写 OCR + 涂改关系逻辑
计划使用专门的手写 OCR 模型,并增加划除词、补写词及阅读顺序的关系恢复逻辑。在完成前,继续保留原图核对和教师复核。
日常练笔、个人成长档案和课本单元关联属于完整教学系统的延展方向,不作为本次 Demo 已经实现的能力。当前页面只陈述可运行原型、真实样本对照和已经完成的失败复盘。
项目收获
这个项目给我带来的一大收获不是证明“我能让模型批改作文”,而是我能从学校一线教师真实需求及痛点出发,把多模态能力拆成可以运行和检查的产品链路;再用真实教师结果验证,不用平均数掩盖异常,并把问题追到第一个发生偏差的环节,为下一轮技术和产品方案建立明确边界。
MY CONTRIBUTION / 个人贡献
- 从英语科组的真实需求出发,将作文批改拆成原图摄入、OCR 对照、句级反馈、全文评分
- 在 3 天内完成可运行 Demo,并组织真实作文的人工—AI 评分对照,效果得到教师认可
- 复盘大分差样本,定位到复杂涂改导致的 OCR 版面还原问题,并明确专用手写 OCR 与涂改关系恢复的后续规划
PROJECT OUTCOME / 项目结果
- 完成真实上百份作文验证,与教师批改成绩整体均值相差约 0.3分,单篇作文批改分差在教师可接受范围内
- 形成学生批改报告、教师复核与班级错误洞察的端到端产品原型
- 将 DEMO 流程落入实际产品并形成供教师查看的班级作文看板,便于教师发现共性问题
口径说明:这是基于学校真实需求完成的快速产品验证,效果经教师认可后已规划并落地产品功能完成闭环;当前 OCR 仍由多模态大模型完成,专用手写 OCR 与涂改关系恢复尚在规划中。