关键不在关掉评分,而在让评分只做筛选器。把需要人工判断的项目写成可核对的证据字段,并规定评分只能触发复核、不能直接决定结论,人工判断就不会被自动分数吞掉。下面用一个假设情境说明具体做法。
假设某站点改版后,用SEO站长工具跑了一轮全站检查。工具给出一个综合分,首页、栏目页分数都不低,于是团队把精力放在分数最低的几十个页面上。两周后发现,真正影响抓取和收录的是一批分数中等、但模板结构重复、正文与导航混在一起的页面。它们没进低分名单,也没进人工复核队列。
这个情境是假设的,用于说明一种常见偏差:自动评分擅长把大量页面排序,却不擅长判断“这个页面为什么值得看”。一旦复核名单完全由分数决定,判断权就从人转移到了评分规则上,而规则本身看不到改版背景、模板差异和业务优先级。
可自动化的项目通常有明确、可重复的判定条件,例如状态码、可抓取性、重复标题、缺失的规范标签。这类项目让工具批量处理没有问题,人工只需抽查规则是否被正确执行。
必须人工判断的项目往往缺少唯一正确答案,例如:
判断依据不是分数高低,而是“这个结论会不会因为上下文变化而改变”。会改变的,就不该由固定评分单独决定。
防止被替代的实际动作,是把人工复核的结论落成可检查的字段。假设仍用上面的改版情境,可以在复核表里固定几列:页面用途、模板类型、正文起始位置、是否存在同模板近似页面、本次改版是否涉及该模板、复核结论、下一步动作。
填写时只记录能核对的事实,例如“正文从第几个区块开始”“同模板页面约有多少个”,不写“感觉质量差”。当这些字段积累起来,团队就能看出评分漏掉了哪类页面,并据此调整复核名单的生成方式,而不是继续争论分数准不准。
这个动作的结果会直接影响下一步:如果漏掉的页面集中在某几个模板,就应把模板类型加入筛选条件;如果漏掉的页面分散,则说明需要按业务优先级抽样,而不是继续扩大全站扫描。
具体做法可以写成一条流程约束:分数只用于排序和分组,任何结论必须由人工字段确认后才能进入执行清单。可以按下面的顺序操作:
这样做的结果是,评分仍然节省时间,但决定看哪些页面、得出什么结论的权力留在人工字段里。若某轮复核发现评分与人工结论高度一致,也只能说明该轮规则适用,不能据此取消人工复核,因为站点结构、模板和业务重点会变化。
当某次调整后评分上升、抓取量变化或某项统计归零,不能单独证明处理正确。抓取量下降也可能来自服务器响应、发布节奏、外部链接变化或抓取预算重新分配;某项统计归零也可能只是采集口径或过滤条件改变。需要回到证据字段,确认变化是否与本次处理有可解释的对应关系。
例如,假设复核发现某模板页面正文被导航挤到靠后位置,于是调整了模板输出顺序。之后如果这些页面的抓取和索引表现改善,同时其他模板没有同步变化,这个对照才更有说服力。若所有模板同时变化,就无法把结果归因于这一次调整。
人工判断的价值正在这里:它保留了对原因的解释,而自动评分只给出一个可比较的数字。两者配合的方式,是让评分负责发现异常,让人工负责解释异常并决定是否行动。