← 返回全部项目产品预研与原型验证2026

英语作文批改

把手写 OCR、句级反馈、教师复核与评分验证收成一条可追溯的教学工作流

ROLE / 我的角色产品设计、验证方案与 Demo 构建
STAGE / 项目阶段已上线 AI 学习空间
SURFACE / 产品形态多模态 OCR · 评分工作流
BOUNDARY / 事实边界这是基于学校真实需求完成的快速产品验证,效果经教师认可后已规划并落地产品功能完成闭环;当前 OCR 仍由多模态大模型完成,专用手写 OCR 与涂改关系恢复尚在规划中。

为什么做

AI 学习空间 的学校合作中,深圳外国语学校初中部英语科组提出作文及日常练笔批改需求。老师反馈之前试用过的解决方案普遍评分偏高,且仅针对语法问题进行批改,没有关注到学生的表达与内容是否符合作文题目要求。其次,从方案落地形态层面考虑,其他解决方案需要老师收集全班所有作文后一页页用手机拍照上传,而在我们学习空间的硬件上,每位学生可以自主完成作文的拍照和提交,这也极大地减轻老师的机械工作量。

于是经过对教师的访谈之后,收集整理了教师精改作文时的工序,了解教师关注作文中的哪些部分。我没有先写一份覆盖所有理想能力的 PRD,而是用 Vibe Coding 在 3 天内搭出可运行 Demo,先回答几个更基础的问题:手写作文能否被稳定识别;反馈能否落到具体句子;AI 能否按照题目要求评价学生的表达能力;AI 分数与教师判断有多大偏差;等待、失败和人工接管应该出现在哪里。

PRODUCT THESIS / 产品判断

作文批改的难点不是让模型按规则打出一个分数,而是判断学生能否用目标语言把主旨说清楚,写出别人读得懂、能共情的文章;同时保证输入可以核对、建议值得采纳、异常可以追溯,并让教师知道何时接管。

作文批改难在哪里

一篇作文的最终得分依赖多层判断:拍摄和手写质量影响 OCR,OCR 的文本和阅读顺序影响句子分析,句子分析又影响全文评价。任何上游偏差都会被下游放大。

评价对象本身更容易偏。许多 AI 批改停在规则层,关心拼写、时态、句式对不对。但对英语写作教学来说,规则只是底线。教师真正要看的是学生能不能用目标语言表达主旨:意思是否清楚,读者是否读得懂,情感和意图是否传达到。只抓语言形式,会把一篇主旨清楚、表达真诚的作文判成“错得多”,也会让学生误以为写作等于少犯错。

  1. 输入风险: 连笔、涂改、补写位置和拍摄质量会改变 OCR 结果。
  2. 评价风险: AI 容易把“写得对不对”当成“写得好不好”,忽略主旨是否清楚、读者能否理解和共情。
  3. 判断风险: 总体均值接近,不代表每一篇作文都可靠。
  4. 教学风险: 如果教师无法复核和查看班级共性问题,产品仍然只是个人工具。

三个关键产品判断

1. 识别结果必须可核对

当前原型使用多模态大模型完成 OCR。为了避免识别错误被静默带入评分,界面同时保留手写原图与 OCR 文本。教师可以先判断学生实际写了什么、阅读顺序是否正确,再理解后续评分依据。核对的不是识别得漂不漂亮,而是后面评价的是否仍是学生自己的表达。

2. 评价必须先看表达,再看规则

学生端报告先给出总分与整体评语,说明主旨是否清楚、读者是否读得懂、情感和意图是否传达到;再解释内容、语言、段落结构等扣分原因,并下钻到原句、修正句和修改逻辑。规则问题仍然要标,但它是底线,不是全文评价的中心。目标不是替学生润色出一篇更正确的作文,而是让学生知道意思有没有写出来、下一次该怎样表达。

3. AI 给出预批改,教师保留最终判断

教师端汇总提交人数、平均分、优秀人数、分数分布和典型案例。AI 承担扫描、预评分和归类;教师复核的不只是识别异常和语法错误,也包括 AI 是否把一篇读得懂、能共情的作文判低,或把主旨跑偏的作文判高。个性化评语和班级共性问题,仍由教师决定后续怎么教。

产品如何组织

01 / INPUT手写作文

保留原始作答与涂改痕迹

02 / OCR识别对照

核对文本是否仍是学生原意

03 / REVIEW句级反馈

先看意思是否清楚,再给改法

04 / SCORE全文评分

先评主旨与可读性,再看语言

05 / TEACH教师复核

确认表达判断并查看班级洞察

这条链路把“识别”和“评分”分开,也把“规则检查”和“表达判断”分开,并把“AI 输出”和“教师确认”分开。顶部原型画廊按照同一顺序保留了 OCR 对照、学生批改页、详细报告与教师工作台;长报告可以在预览窗口内继续滚动查看。

评分验证:均值接近,不等于单篇可靠

我将 100+ 份真实作文的 AI 分数与教师分数逐篇对照。整体上,教师均分约为 10.22,AI 均分约为 9.91,均值相差约 0.31 分。这个结果说明当前方案值得继续验证,但不能直接写成“评分准确”。

TEACHER MEAN / 教师均分10.22

15 分制人工批改

AI MEAN / AI 均分9.91

当前多模态方案

MEAN GAP / 整体均值差≈ 0.31

仍需检查单篇异常

平均数只能说明系统没有明显整体偏高或偏低,但是不能揭露少量大分差样本的问题所在。

从异常分差追到 OCR

复盘大分差作文后,定位到共性问题主要发生在 OCR,而不是评分规则本身。学生修改原文时,会划掉旧词并直接在上方补写新词。当前多模态大模型容易把补写词识别成独立的一行,打乱原句语序;评分模型随后基于错误文本分析,最终给出偏低分数。

  1. 01
    学生原始涂改

    旧词被划掉,新词写在原位置上方。

  2. 02
    OCR 错误分行

    补写词被识别成独立行,没有回到原句位置。

  3. 03
    整体语序改变

    识别文本已经不再等同于学生实际表达。

  4. 04
    评分被输入带偏

    下游基于错误文本扣分,出现明显偏低结果。

这次复盘把“模型偶尔不准”收敛成了一个可以继续解决的问题:复杂涂改下的手写版面还原。原图对照因此不是装饰,而是当前技术方案的必要校验入口。

当前方案与后续方向

CURRENT / 当前实现

多模态大模型承担 OCR

适合快速验证端到端链路,也能同时理解图像和文本;但面对划词、上方补写和复杂阅读顺序时,难以稳定恢复原句。

NEXT / 后续规划

专用手写 OCR + 涂改关系逻辑

计划使用专门的手写 OCR 模型,并增加划除词、补写词及阅读顺序的关系恢复逻辑。在完成前,继续保留原图核对和教师复核。

日常练笔、个人成长档案和课本单元关联属于完整教学系统的延展方向,不作为本次 Demo 已经实现的能力。当前页面只陈述可运行原型、真实样本对照和已经完成的失败复盘。

项目收获

这个项目给我带来的一大收获不是证明“我能让模型批改作文”,而是我能从学校一线教师真实需求及痛点出发,把多模态能力拆成可以运行和检查的产品链路;再用真实教师结果验证,不用平均数掩盖异常,并把问题追到第一个发生偏差的环节,为下一轮技术和产品方案建立明确边界。

MY CONTRIBUTION / 个人贡献

  • 从英语科组的真实需求出发,将作文批改拆成原图摄入、OCR 对照、句级反馈、全文评分
  • 在 3 天内完成可运行 Demo,并组织真实作文的人工—AI 评分对照,效果得到教师认可
  • 复盘大分差样本,定位到复杂涂改导致的 OCR 版面还原问题,并明确专用手写 OCR 与涂改关系恢复的后续规划

PROJECT OUTCOME / 项目结果

  • 完成真实上百份作文验证,与教师批改成绩整体均值相差约 0.3分,单篇作文批改分差在教师可接受范围内
  • 形成学生批改报告、教师复核与班级错误洞察的端到端产品原型
  • 将 DEMO 流程落入实际产品并形成供教师查看的班级作文看板,便于教师发现共性问题

口径说明:这是基于学校真实需求完成的快速产品验证,效果经教师认可后已规划并落地产品功能完成闭环;当前 OCR 仍由多模态大模型完成,专用手写 OCR 与涂改关系恢复尚在规划中。