拍照批改到底准不准 —— 用714个手写答案实测
批改本身不难,却很花时间。diglabo 里有一个功能:把做完的练习卷拍下来,就会自动批改。不过站在使用者的角度,先冒出来的念头恐怕不是“方便”,而是“机器要是读错了,明明做对却被打叉怎么办”。
我起初以为,机器读数字总比人准。实际测了之后,并非如此。
到底准不准,我做了测量,把结果写在这里。
怎么测的
把孩子实际用铅笔做完的练习卷扫描下来,对其中写有手写答案的 714 个格子,逐一记录人用眼睛读出来的答案,以此作为正确答案的基准。
这同样的 714 个格子可以反复测量。每次改动读取的方式,都能用同一把尺子和之前作比较。
结果
714 个格子中读错的数量。下面三项是在相同条件下并排测的。
- 以前的方式(只在手机内部处理):152 处 / 21.29%
- 现在的方式(gemini-2.5-flash-lite):10 处 / 1.40%
- gemini-2.5-flash:7 处 / 0.98%
- gemini-3.5-flash-lite:6 处 / 0.84%
以前只在设备内部读取。好处是不需要联网,代价是每 5 处就读错 1 处。看到这个数字之后,我改成了交给外部模型来读。
没有采用最准的那一个,是因为读取的费用要多出 3 倍以上,等待时间也变成 1.7 倍。换来的是 714 处中的 4 处。既然是免费公开的,我判断这个差距不值这笔钱。
机器读错的地方,人也会犹豫
把读错的内容逐一清点,现在这套方式的 10 处错误中,有 9 处是“把 0 读成了 6”,剩下 1 处是“把 4 读成了 9”。
我有点在意,就把纸拿出来重新看了一遍。写在上面的那个手写的 0,硬要说的话确实更像 6。 不是机器判断错了,而是那个字就是这么读的。
我本以为这是提升读取精度的事,做着做着变成了写字方式的事。
出乎意料的一点 —— 机器的“自信”靠不住
读取时,每一处都会返回“对这次读取有多少把握”。我原本打算只让人复查把握低的格子。
实际一查,读错的地方无一例外都被判定为“有把握”。被判为把握低的格子,一处也没有出现。
靠自信度来挑出可疑格子,这个设计不成立。所以 diglabo 做成了可以当场修改读取结果的形式。它的前提就是:不把机器的判断当作最终结论。
还没能解决的问题
老实写下来。
有时会在什么都没写的格子里凭空造出数字。 把橡皮的痕迹或纸上的阴影读成了数字。做了对策之后减少了,但没有归零。
竖式计算中,行会因人而异地错位。 在有余数的除法和除法(÷1位数)中,如果孩子省略不写中间的“0”,写余数的那一行就会往上移一行。机器看的是固定位置,于是读到了别的格子。写法不止一种的地方,我还没有追上。
关于测量方法的说明
把同一张图片用同样的设置再读一次,239 处中有 4 处(1.7%)与上一次的读取结果不同。既然用的是生成式模型,这一点无法避免。
也就是说,这种测法能分辨的只有“大于几处的差距”。上面那些数字里,10 处、7 处、6 处之间的差距接近这个幅度,所以我并不把它读作“哪一个更好”。能读出来的,只有从 152 处降到 10 处这一段。
接下来要测的
- 日语以外的练习卷(英语、中文、韩语、西班牙语)的读取
- 空格是否被正确判定为空格
- 读取结果实际被修改的比例
不写什么时候完成。测出来了就补写在这里。
批改是确认对错的动作。机器读错了,并不等于孩子做错了。读取看起来不对的时候,请当场改掉——修改功能就是为此准备的。
这篇文章由 diglabo 的开发者、一位家长撰写。我不是老师,也不是教育专家。文中一般性的教法依据日本小学的教学内容,并对照了日本的课程标准。
diglabo 的练习题按日本的课程编写。如果你不在日本,这意味着什么