试验性工作的“完成”不能定义为排名或流量出现,而应定义为双方事先约定的动作被执行、产出物被提交、执行记录可复核。当这些条件全部满足,即使结果未达预期,该阶段也视为完成;协议要写清的是“做完什么”,而不是“做成了什么”。
一个常见场景是:先在某个站点上试一批页面调整,观察一段时间后,该样本的抓取或展示表现出现改善。于是双方默认这套动作可以铺开,协议里也按“完成一批优化”来写。铺开到更多站点后,却出现部分站点毫无变化,甚至个别站点表现回落。
这不是执行方偷懒,也不必然说明方法无效。它暴露的是试验性工作无法用统一结果来定义完成:样本成立有样本成立的前提,规模化有规模化的边界,而协议若只写“做完这批动作”,就无法回答“做完”之后谁来判断、按什么判断。
面对“单站有效、多站失效”,通常有两种解释,需要分开对待。
这两种解释指向完全不同的责任和下一步:前者是适用范围问题,后者是执行质量问题。协议如果不区分,验收就会变成互相指责。
要判断属于哪一种,需要看的是执行证据,而不是结果数字。可以要求交付方提供以下可复核材料:
如果证据显示铺开站点的动作执行与试验站点一致,但结果仍不同,更倾向于解释一,即样本边界问题,此时应缩小适用范围或补充前置条件。如果证据显示执行本身有遗漏、覆盖或标准下降,则属于解释二,应先修复执行,再谈结果。
需要提醒的是,抓取量或展示量归零、下降,不能单独证明动作做错或做对。它还可能来自站点其他改动、内容整体质量变化、外部链接变动等。协议验收不应把这类单点现象当作唯一判据。
试验性工作的完成条件应当是可勾选的,例如:
这样定义后,“完成”与“有效”被拆开:完成是执行方的义务,有效是双方共同面对的不确定结果。协议可以约定,完成动作即触发阶段验收和付款节点,而效果评估作为独立环节另行讨论。
假设协议约定:先在一个站点试做 20 个页面的结构调整,完成后提交对照记录。执行方按约提交,该样本表现改善。随后协议约定扩展到 100 个页面。若扩展后部分页面无变化,按前述证据方法核对:若执行记录显示 100 个页面均按同一标准完成,则该阶段完成条件已满足,结果差异属于适用范围问题,下一步应是重新划定适用边界,而非否定已完成的工作;若记录显示只有 60 个页面真正按标准执行,则完成条件未满足,下一步是先补齐执行,再重新评估。
这个例子的关键不在于数字,而在于:完成与否由执行证据判定,结果好坏由适用范围和后续评估判定,两者不能混为一谈。
如果对方坚持“看到结果才算完成”,可以退一步,把协议拆成两段:第一段只验收动作与产出物,第二段把结果观察写成双方共同参与的评估流程,并明确评估不构成对特定结果的承诺。这样既保留了试验性工作的空间,也让“完成”有可操作的判定标准。真正需要避免的,是把完成条件写成无法验证的表述,导致执行方和委托方对同一句话产生不同理解。