KNOWLEDGE NOTE · 持续修订
研究维护:数字、版本与公开边界
让报告能被持续修正:固定分母、保存来源版本、区分机器标签与人工判断。
研究报告过期,不一定是行业发生了变化。也可能是数据文件已经更新,正文还保留旧数字;或者同一个名称,先后指代原始记录、筛选子集与编码结果。
这次整理把报告的“内容版本”和“数据版本”分开保存。公开页面标注复核日期,数据发布保留输入快照摘要、统计方法和不支持的推论。
一组数字至少带四个条件
统计单位是什么,纳入了谁,覆盖哪个时间,如何从输入计算。条目、评论、项目、用户和需求不可以互换。不同来源中的同文转载,也不能充当多份独立支持。
本次核对的三组语料合计包含 629,705 次记录,但跨组存在规范化后的完全相同文本。这个总和不表示独立用户或已经验证的需求。即使完全去重,同一人的多次发言仍可能存在。
公开汇总保留每组分母、来源集中度和交叉重复口径,也说明原始平台内容没有再分发。
机器可以查结构,语义需要另外验收
字段齐全、JSON 可解析、记录 ID 不重复,是必要检查。判断一句话是否真的接受方案,是否真的付费,以及付款对象是什么,需要回到上下文。
机器标签统计应明确称为候选标签分布。抽检可以估计错误与发现系统偏差,但必须说明抽样方法和范围;不能把一个小样本的通过率套到全部来源。
用修订记录处理冲突
若旧正文与当前表格冲突,先固定两个版本,再核对过滤条件。确认是错误时更正,并说明影响了哪个结论;如果口径不同,保留两个分母及用途。不要悄悄替换数字后继续沿用旧论证。
一个值得维护的知识单元,应该能单独更新某个判断,而不必每次重写整份行业报告。文章保留当时的完整论证,知识页承接后续修订,两者互相指向。
公开不等于原始材料全部上传
作者自己的分析、处理方法和经过审查的汇总可以公开。第三方原文、平台账号标识、企业内部计划和个人资料,需要另外的权限与使用边界。脱掉名字不一定完成匿名化,小样本背景仍可能识别人或组织。
这个知识库采用公开白名单:只有经过内容检查的派生文件进入站点仓库。原始资料留在独立的本地工作区,不能仅用页面隐藏或草稿标记隔离。
对自己的方法也保留反证
如果维护成本高到无法持续,应减少字段、缩小发布范围,优先保住来源、日期、分母和关键反证。资料系统的价值在于提高下一次判断质量,不在于积累越来越多却没人复核的字段。
公开来源与适用范围
- SURE · User Demand Research
作者项目与方法 · 研究契约、证据分级、CLI 与 MCP;结构检查通过不等于需求成立。
- AgentMeasure Core Specification
作者项目规范 · attempt、operation 与证据语义;草案,不是行业普遍采纳证明。