KNOWLEDGE NOTE · 持续修订

研究维护:数字、版本与公开边界

让报告能被持续修正:固定分母、保存来源版本、区分机器标签与人工判断。

作者分析 · 复核于 · 如何使用这些判断

研究报告过期,不一定是行业发生了变化。也可能是数据文件已经更新,正文还保留旧数字;或者同一个名称,先后指代原始记录、筛选子集与编码结果。

这次整理把报告的“内容版本”和“数据版本”分开保存。公开页面标注复核日期,数据发布保留输入快照摘要、统计方法和不支持的推论。

一组数字至少带四个条件

统计单位是什么,纳入了谁,覆盖哪个时间,如何从输入计算。条目、评论、项目、用户和需求不可以互换。不同来源中的同文转载,也不能充当多份独立支持。

本次核对的三组语料合计包含 629,705 次记录,但跨组存在规范化后的完全相同文本。这个总和不表示独立用户或已经验证的需求。即使完全去重,同一人的多次发言仍可能存在。

公开汇总保留每组分母、来源集中度和交叉重复口径,也说明原始平台内容没有再分发。

机器可以查结构,语义需要另外验收

字段齐全、JSON 可解析、记录 ID 不重复,是必要检查。判断一句话是否真的接受方案,是否真的付费,以及付款对象是什么,需要回到上下文。

机器标签统计应明确称为候选标签分布。抽检可以估计错误与发现系统偏差,但必须说明抽样方法和范围;不能把一个小样本的通过率套到全部来源。

用修订记录处理冲突

若旧正文与当前表格冲突,先固定两个版本,再核对过滤条件。确认是错误时更正,并说明影响了哪个结论;如果口径不同,保留两个分母及用途。不要悄悄替换数字后继续沿用旧论证。

一个值得维护的知识单元,应该能单独更新某个判断,而不必每次重写整份行业报告。文章保留当时的完整论证,知识页承接后续修订,两者互相指向。

公开不等于原始材料全部上传

作者自己的分析、处理方法和经过审查的汇总可以公开。第三方原文、平台账号标识、企业内部计划和个人资料,需要另外的权限与使用边界。脱掉名字不一定完成匿名化,小样本背景仍可能识别人或组织。

这个知识库采用公开白名单:只有经过内容检查的派生文件进入站点仓库。原始资料留在独立的本地工作区,不能仅用页面隐藏或草稿标记隔离。

对自己的方法也保留反证

如果维护成本高到无法持续,应减少字段、缩小发布范围,优先保住来源、日期、分母和关键反证。资料系统的价值在于提高下一次判断质量,不在于积累越来越多却没人复核的字段。

公开来源与适用范围