结论先行:只有当评分依据的字段能被结构化、且误判成本低于人工复核成本时,才适合让自动评分接管;一旦项目涉及语义歧义、跨语种语气、品牌风险或不可逆的商务承诺,就应把自动评分降级为排序信号,而不是最终裁决。判断边界不是看评分准不准,而是看判错的代价由谁承担、能否回退。
自动评分的本质是把多个可量化字段压成一个数。它擅长处理“同一维度、同一口径、可重复比较”的项目,比如标题长度、字段缺失、链接是否可访问这类有明确对错的事实项。它不擅长处理需要语境才能定性的项目,例如一段文案是否冒犯特定地区用户、一条外链所在页面的编辑意图、一个产品描述是否构成过度承诺。
把这两类混在一个分数里,风险在于:事实项的高分会掩盖语义项的严重问题。一个页面可能字段完整、结构规范,得分很高,但核心表述与当地法规冲突。此时分数越高,越容易让人跳过复核。
可操作的区分方法是给每个评分维度标注“可回退性”:
如果业务已经依赖评分来决定优先级,可以保留分数,但改变它的使用位置:把分数用于“决定先看哪一条”,而不是“决定哪一条通过”。这样做的结果是,人工时间被集中到高分和低分两端,中间段可以抽样;一旦抽样发现高分项存在语义问题,就说明当前评分维度需要增补,而不是继续调权重。
一个假设的例子:某团队用评分给待审页面排序,分数由字段完整度、内链数量、文本长度组成。某天一个字段完整、内链充足的页面排在最前,但人工打开后发现它把竞品名称写进了对比结论,属于需要法务确认的表述。这里分数没有错,它只是没有覆盖“是否涉及第三方名称”这一维度。下一步动作应是新增一个布尔字段“是否含第三方品牌指称”,命中即强制转人工,而不是把该页面的分数调低。
很多团队习惯设一条分数线,比如低于某分就人工看。问题在于分数线是全局的,而风险是局部的。更稳的做法是设触发条件:只要命中特定字段或特定来源,无论分数多高都转人工。触发条件可以包括:
需要说明的是,触发条件命中率上升并不自动证明评分失效。它也可能只是业务范围扩大、来源变杂。要区分这两种解释,可以对比触发项的构成:如果新增触发集中在某一类来源,多半是来源变化;如果分散在各来源,才更可能是评分维度不足。
前面结论有一个明确的反例。当判断对象是纯机械核对,且人工复核本身存在疲劳和口径不一致时,自动评分可能比人工更稳定。例如核对一批页面的字段是否为空、数值是否在允许区间、同一字段在不同页面是否自相矛盾。这类任务人工做久了会漏,评分脚本不会因为下午三点而走神。
所以“防止被替代”不是全面拒绝评分,而是承认评分有它的适用面。把机械项交给评分,把语义项留给人,比笼统地说“评分不可信”更有用。反过来,如果团队把语义项也写成规则硬塞进评分,规则会迅速膨胀到没人能解释每条权重的来源,那时评分既不可信也不可维护。
要判断当前项目处在哪种状态,可以做一次小范围分歧审计:抽取一批评分结果,让至少两个人独立给出“通过/不通过”的人工判断,再和评分结论对照。重点不是算一致率,而是看分歧集中在哪些维度。
如果分歧集中在可回退的事实项,说明评分维度可以补齐,下一步是加字段。如果分歧集中在不可回退的语义项,说明评分不该做终审,下一步是把这些维度改为强制人工触发。审计样本不必大,但必须覆盖不同来源和不同业务类型,否则得出的结论只适用于被抽到的那一类。完成这一步后,再决定是调整评分、调整人工介入点,还是两者同时改。