当页面数量从几十增长到几百甚至几千,手工逐页核对快照、标题和链接会先变成瓶颈,再变成错误来源。判断标准不是“手工能不能做”,而是这项工作是否需要逐页判断;如果每页的判断逻辑一致,只是数量增加,就应该转为规则化处理,手工只保留抽样复核和例外处理。
网站规模扩大后,手工操作最先失真的不是速度,而是一致性。同一批页面由同一个人在不同时间检查,判断标准会漂移;由不同人检查,差异更大。快照作用在这里体现为:它反映的是搜索引擎上次抓取并存储的页面状态,而不是当前线上状态。手工核对时,你看到的是快照与当前页面的差异,但差异原因可能是抓取延迟、页面改版、robots 限制或服务端返回异常,这几种情况需要不同处理。
可以这样区分:如果差异集中在最近修改过的页面,优先怀疑抓取延迟;如果差异集中在某一类模板页面,优先怀疑模板或链接结构;如果差异随机分布且数量很大,优先怀疑抓取预算或服务端稳定性。手工核对很难同时保留这三类证据,因为人脑会不自觉地把“我上次看到的不一样”当成结论。
以你手里的一份页面清单为对象,先做一次分类,而不是直接逐页改。分类维度可以包括:页面类型、上次修改时间、是否被站内链接指向、返回状态码、快照时间与当前时间差。分类之后,只有两类页面需要人工介入:一类是规则无法判断的例外,另一类是抽样验证规则是否有效。
实际动作可以这样安排:先选出二十个页面作为样本,手工记录快照时间、当前标题、当前主要链接和返回状态;然后写一条检查规则,对全站跑一遍,输出与样本判断不一致的页面。如果规则结果与手工样本差异很小,说明规则可以接管大部分工作;如果差异很大,说明分类维度不够,需要补充维度,而不是继续手工扩大样本。
这个动作的结果会直接影响下一步:规则可靠时,手工只做抽查和例外处理;规则不可靠时,先修分类维度,暂时不要扩大自动化范围。否则自动化只会把错误放大。
不是所有工作都该自动化。以下情况保留手工更合理:
反过来,以下工作不适合继续手工:全站快照时间与当前时间的批量比对、全站标题和描述的一致性检查、全站内链指向的批量核对、返回状态码的定期扫描。这些工作的共同点是判断逻辑固定、页面数量大、手工容易漏。
假设你有一个内容站,页面从八十篇增长到八百篇。手工核对快照的工作量从每周两小时变成每周二十小时,而且开始出现漏记。此时可以设一条规则:对每个页面记录快照时间、当前返回状态、标题是否与快照标题一致、是否被至少一个站内链接指向。规则输出三类结果:正常、需复核、需处理。
需复核的页面由人工看,需处理的页面按类型批量处理,正常的页面不再逐页看。这样手工时间从二十小时降到三小时左右,但前提是规则分类维度正确。如果规则把抓取延迟误判为页面问题,人工复核量会反弹,这时要回到分类维度,而不是增加人手。
不要只看“手工做不完”这一个信号。更可靠的证据是:同一判断标准在多次手工操作中是否稳定;手工结果是否可被另一人复现;错误是否集中在某几类页面。如果这三条都指向“不稳定、不可复现、错误集中”,说明问题在规则,不在人手。如果指向“稳定、可复现、错误分散”,说明可以转为规则化处理,手工只保留抽样和例外。
快照作用在这里不是给你一个排名信号,而是帮你区分抓取、索引和展示三个环节的差异。规模扩大后,手工适合处理需要语境判断的少数页面,规则适合处理逻辑一致的大量页面。先分类,再决定哪些动作交给规则,哪些留给人,这样下一步的复核才有依据。