本方案采用人机协同而非全自动替代。模型负责初步识别、判分建议、证据抽取和风险提示;教师负责规则确认、开放题判断、异常样本处理和最终反馈发布。系统不将置信度隐藏在后台,而将其转化为明确的工作流动作:自动通过、抽样复核、强制复核或面批建议。
系统由六个模块组成。
第一,作业采集与解析模块。该模块接入纸笔扫描、移动拍摄和数字作业,完成版面切分、题目定位、学生匿名标识匹配和原始证据保存。系统不得覆盖原图,所有识别文本与人工修订均应保留版本。
第二,学科理解模块。数学侧重点在公式、步骤、单位和等价表达;英语侧重点在客观题、拼写、语法和语义完整性;语文侧重点在结构化量表、文本证据和教师辅助评价。不同学科共享课程标准、教材版本和校本评分规则索引。
第三,评分与反馈模块。系统输出建议分、评分依据、对应知识点、可能的订正方向和可编辑评语。对开放题,系统必须引用原作答片段或评分量表条目,避免只生成泛化评价。
第四,风险分流模块。分流依据包括模型置信度、题型风险、识别冲突、学生历史作答变化、严重误判规则和学校配置阈值。阈值必须带版本号,并在评测前冻结。本仓库示例阈值 0.75 仅用于演示,未经校准。
第五,教师复核工作台。工作台按风险与教学价值排序,展示原作答、模型建议、量表依据、历史变化和可操作动作。教师可确认、改分、改评语、加入面批或标记为规则冲突。所有复核结果进入审计日志,不直接等同于模型正确性标签。
第六,订正与再评价模块。系统根据共性错误生成讲评清单,根据个体持续错误生成面批清单,并通过等值后测或延迟保持测验验证干预效果。订正完成率只作为过程指标,不能单独代表学习提升。
若题型风险低、识别无冲突、置信度达到题型阈值:自动通过或进入抽样复核。
若置信度位于灰区、存在书写识别冲突或历史作答变化异常:进入教师复核。
若涉及开放表达、价值判断、严重误判可能或学生权益风险:强制教师复核。
若连续订正失败或教师标记需要解释:进入面批建议。
第一,将“是否批改正确”扩展为“是否可被可靠分流”。常规方案容易将准确率作为单一目标,本方案同时关注覆盖率、自动通过错误率、错误捕获率和严重错误逃逸率。
第二,将教师修订视为治理信号,而非简单训练样本。教师修订首先用于审计、规则版本比较和校本量表改进;是否用于模型训练必须经过脱敏、授权和用途限定。
第三,将学情分析表述为可复核假设。系统可以提示“需人工关注的作答变化”或“可能存在知识迁移困难”,但不自动进行情绪识别、能力定性或纪律判断。
第四,将课堂与作业证据连接起来。希沃类场景的潜在优势不在于单点批改,而在于课堂终端、互动反馈和课后作业之间存在连续证据链。但该证据链必须服从数据最小化原则。
在真实试验中,若系统通过阶段A门槛,可进入小规模阶段B验证。可量化目标包括:低风险客观题自动通过覆盖率达到预注册阈值;自动通过错误率低于预注册上限;严重错误逃逸率接近零且置信区间满足安全要求;教师净处理时长相对传统流程下降;学生订正后等值测验表现提升。上述目标均需通过真实数据估计,本仓库不声称已经达成。