可判定的输出,指不依赖“感觉做对了”就能验收的结果:要么是一个文件、一段可运行的规则、一份对照表,要么是一个能明确回答是或否的判断。把火车头采集教程里的文章知识转成实操题时,先定验收物,再倒推要练的步骤,比先列步骤再想怎么检查更省事。下面从一个常见矛盾讲起。
读教程时觉得每一步都合理,真上手却卡在中间:任务能建起来,但采到的内容缺字段;或者字段都在,却混进了不该要的页面。这类矛盾通常有两种解释。
解释一:知识本身是描述性的,只说了“要设置采集规则”,没说清规则生效后应该看到什么。读者接收的是概念,不是可检验的指令。
解释二:练习者跳过了中间的验证环节,直接追求最终结果,导致出错时无法定位是哪一步偏了。
两种解释都成立,但处理方式不同。前者要把知识改写成带输出的题目,后者要补上分段验证。
不用凭印象猜,做一次小规模试跑就能区分。假设有一篇讲列表页与详情页两级采集的文章,按下面三项观察。
这三项证据的价值在于,它们把“我好像没学会”拆成了可以分别处理的具体状态。下一步动作取决于落在哪一项上。
以教程中任何一个知识点为起点,按下面的顺序改写,每一步都产出一个能检查的东西。
完成这四步后,一篇文章就变成了若干道可判定的实操题。做不出来时,你能立刻知道该回到哪一步,而不是整篇重读。
假设某篇教程讲“采集结果导出为表格”,练习者据此设计一道题:验收物是一份五行数据的表格文件,判定条件是五行的三个字段均与源页面一致。
试跑后发现导出只有三行。这时不要急着改导出设置,先检查采集阶段是否只抓到了三条。如果采集阶段就是三条,问题在规则;如果采集阶段有五条而导出只有三条,问题在导出环节。这个区分动作会直接改变下一步该看哪一段教程内容。
这个例子里没有任何真实项目数据,数字只用于说明“先定位环节、再改设置”的比较方法。
教程、旧规则或旧协作方式需要退出时,不必整体丢弃。判断标准是:这部分内容能否被改写成上面那种带验收物的题目。
能改写的,说明它仍然提供了可检验的判断依据,值得保留并重新组织;只能停留在“大概是这样”的描述,且无法对应任何可观察结果的,才适合淘汰。按这个标准筛一遍,通常会留下规则结构、字段定义和失败排查思路,而淘汰掉与具体界面或特定时期操作路径强绑定的部分。
需要提醒的是,请求量、抓取量或某个统计值归零,并不能单独证明某段知识已经失效。它也可能是样本选择、页面改版或练习规模太小造成的。要确认失效,仍需回到验收物本身:按原知识设计的题目,是否还能稳定产出可判定的结果。如果不能,再决定是修正题目还是放弃这部分内容。