理化生实验 AI 考评系统
招标参数只是入场券。从考试设备扩展到日常教学与练习,再把竞争转向可扩展的多模态 AI







校级平台首页,学校教师用于管理考务、实验课及实验练习等资源。
区级教学看板看本月开课、必做实验覆盖和资源覆盖,而不只看一场考试。将指针放在画面上,滚动查看超出高度的部分
区域考试成绩概览按学科、试卷和分数段看分布,服务教育局考后分析。将指针放在画面上,滚动查看超出高度的部分
日常教学:教师把实验课编排成可下发的流程,设备进入平时课堂,而不只在考试周打开。旧版本截图,只用于功能示意。
学生练习:AI 指出操作错误,给出原因、正确示意和可继续追问的知识点。旧版本截图,只用于功能示意。
练习和课堂后,正确率按动作拆开,评价能回到下一节课,而不是停在一张总分报表。旧版本截图,只用于功能示意。
高利害考试仍保留证据和人工复核:模型负责检测,人给出成绩。旧版本截图,只用于功能示意。
这个产品在做什么
教育部发文要求将实验操作考试纳入中考评分,各地市会结合教育政策推进理化生实验教学与考试信息化来保证中考可追溯性及公平性。厂商要协助教育局梳理软硬件技术参数,再通过招投标完成采购。所以这首先是一套 政策驱动、招投标交付的软硬一体系统:市/区/校平台、实验终端、考试组织、AI 评分、人工复核、设备与算力运维都在同一条链上。
它不应该只是一个实验录播工具,也不是只在考场里亮几次的专用设备。学生坐在实验桌上操作;摄像头要看清全过程和手法,终端要能被当成教室里的设备资产来管理。AI 必须在真实教室里面对网络、设备、算力、内容版本和评分争议。

我负责产品规划与方案演进。面对的竞争并不只是“功能好不好”,而是三件会随阶段变化的事:参数能不能进招标文件,买完之后学校为什么持续用,以及实验和题型增加时方案还能不能扩展。
三个关键判断
-
满足招标参数只是入场券。 各地政策不同,参数要求也不同。当多家厂商都能满足参数时,真正要回答的是:我们的方案为什么更值得学校采购?设备进校之后,怎样提高实际使用价值,而不是只服务一年少数几次考试?
-
采购后的投入产出比,比再加一个考试功能更重要。 如果整套设备一年只用两三次,对学校是高成本闲置。要把考试能力做成日常教学和学生练习也能用的基础设施,使用频率和教学价值才会上去,招投标竞争力才会从“能考”变成“考完还能教、还能练”。
-
场景覆盖同质化之后,下一阶段真正影响竞争力的是底层 AI 技术路线。 教学、练习逐渐成为主流厂商的共同配置,继续堆场景很难拉开差距。传统专项 CV 模型在实验和动作变多时,标注、训练和维护成本会快速上升。可扩展性和交付效率,取决于能不能用更具泛化能力的模型去理解实验过程。
这些判断决定了后面三步:先把考试设备做成学校愿意持续用的东西,再在功能竞争打平之后换技术底座。我并不是被动跟随客户需求增加功能,而是在不同竞争阶段持续判断:下一阶段真正影响方案竞争力的变量是什么,并提前推动产品演进。
关键破局
01|政策与招标:参数对得上,还要讲清买完怎么用
项目具有较强的政策驱动属性。各地市推进实验教学与考试信息化时,厂商会协助教育局梳理软硬件技术参数,并最终通过招投标完成采购。我对比其他厂商方案后认为:参数表决定的是能不能入围,不是学校为什么选你。
所以方案不能停在“考试能追溯和评分上”。招标材料、产品规划和现场沟通都要能回答同一件事:设备进校之后,除了中考那几天,平时怎么进入课堂、怎么支撑学生训练。
考试本身仍然是高利害场景,这是底线而不是差异。评分必须可复核,过程必须可追溯,异常必须可恢复——内容快照、考中换人/补考、实时监控、人工复核,都是为了让考试站得住。教室里的终端也必须被当成设备资产管理,否则规模交付和现场支持成本会失控。
02|从考试设备,扩展成日常教学和学生练习
基于学校采购后的投入产出比,我推动团队优先补齐两个高频场景。这不是单纯增加两个功能模块,而是改变整套方案被使用的方式。
日常教学。 教师可以直接基于设备开展实验课堂,结合 AI 做课堂辅助,实时点评所有学生操作并出分,解决传统实验课老师没法指点所有学生操作的痛点;也可以用于信息化、人工智能赋能的公开课和优秀课例。教师一节课通常只能顾及少数组,实时反馈用来补全全班视野,课权仍在教师手里。教学资源与考试资源分开管理,避免练习状态污染考场流程。

学生练习。 面向中考前实验操作训练,提供可反复练习的自习模式。学生自主完成操作,AI 实时识别过程并给出评价与反馈。设备在非考试期间也能转起来,帮助提升学生实战成绩。
这样,产品从“一年使用两三次的考试设备”,转成可以持续进入学校日常教学流程的教学基础设施。考试、教学、练习三类状态互斥,同一套终端服务不同可靠性等级的场景。
03|场景同质化之后,把竞争转向底层 AI
随着行业发展,教学模式、练习模式逐渐成为主流厂商的共同配置。单纯依靠场景覆盖已经难以形成明显差异。下一阶段真正影响产品可扩展性和交付成本的,是底层 AI 技术路线。
原方案主要基于传统 CV 深度学习模型。不同实验、不同动作往往需要单独准备数据、标注并训练模型。实验数量增加,或出现旧实验的变种题型时,模型开发和维护成本会快速增长,新项目的适配周期也会被拖住。
我们随后推动方案向小尺寸多模态大模型演进。相比传统方案,多模态模型面对新实验或变种题目时,对新增数据标注的依赖更低;不需要针对大量实验动作分别维护独立模型;新实验、新评分规则的适配周期可以缩短。整套 AI 能力从“针对固定题型训练模型”,逐渐转向“理解实验过程并完成评价”。
这不是一次模型替换,而是对后续扩展方式、算法成本和新项目交付效率的重新设计。我们较早开始探索以多模态大模型替代大量专项 CV 模型的技术路线。此后,行业主流方案也逐渐向类似方向演进。
产品如何组织
面向教育局、学校、教师、学生和实施运维,产品拆成市/区/校平台、教师端、学生终端、阅卷复核、设备与算力管理。
学生终端是评分现场,不是普通平板:拍摄条件、身份核验和设备状态都是评分质量的前置条件。教师端把一节实验课编排成可下发的流程。复核端同时给出过程视频、步骤规则和改判入口——模型负责检测,人负责成绩。班级数据按动作拆开,让评价能回到下一节课。
考试、日常教学、学生练习走不同流程和状态约束。公开课被当成产品验证场:现场缺的能力会进版本,而不是停留在一次性支持。
结果与边界
产品线支撑区域级教考项目与多校交付,并在考试项目中达到 98%+ 人机一致率、显著提升阅卷效率。这些是项目整体结果,由产品、算法、研发和交付团队共同完成。
我更希望被看到的是:在政策招标、学校使用价值和底层技术路线三个阶段,持续判断下一阶段真正影响方案竞争力的变量,并提前推动产品演进。
MY CONTRIBUTION / 个人贡献
- 在政策驱动的招投标竞争中判断:满足参数只是入场券,真正要回答的是学校采购后如何持续产生使用价值
- 推动日常教学与学生练习成为高频场景,把一年使用两三次的考试设备做成可进入学校日常流程的教学基础设施
- 在场景覆盖逐渐同质化后,推动从大量专项 CV 模型转向小尺寸多模态大模型,降低新实验与变种题的扩展、维护和交付成本
- 将考试可靠性做成产品机制:内容快照、考中异常处理、人工复核与设备集群运维
PROJECT OUTCOME / 项目结果
- 方案覆盖考试、日常教学与学生练习,支撑区域级教考项目与多校交付
- 在珠海中考项目整体达到 98%+ 人机一致率,并显著提升阅卷效率
- 较早探索以多模态大模型替代大量专项 CV 模型;此后行业主流方案也逐渐向类似方向演进