← 返回知识库

LIBRARY NOTES · 2026.08.31

研究数据与统计边界

首批公开三组语料的重计结果、字段说明与局限。只发布审查后的汇总,不再分发原始平台内容。

这次公开什么

这是 2026 年 8 月 31 日对三份本地研究快照的结构重计,统计单位为记录。数据帮助检查研究材料的范围与偏差,不用于推断市场普遍性或需求已成立。

研究语料 记录数 记录月份范围 Reddit 占比
本地 AI 与私有算力 211,088 2024-01—2026-07 90.21%
AI 眼镜与开放场景 209,862 2023-01—2026-07 83.29%
家庭机器人与开放场景 208,755 2023-01—2026-08 88.15%

合计 629,705 次记录,不是独立用户数,也不是“验证了 62 万个需求”。三组之间存在重复文本;同一人也可能多次发言。月份来自记录字段,不表示每个月都有完整覆盖。

下载完整 JSON · 总览 CSV · 来源分布 CSV · 机器候选标签 CSV

重计做了哪些检查

逐行解析输入,重算记录数、非空文本、来源分布、记录 ID 和已有文本哈希的缺失及重复,绑定每份输入文件的 SHA-256。

三份快照均未发现无效 JSON 行、空正文或重复记录 ID。已有文本哈希字段有缺失:眼镜语料 2 条,家庭机器人语料 1 条,本地 AI 语料 0 条。因此不能把“已有哈希未重复”解释成完整内容去重证明。

交叉重复另外从正文计算:Unicode NFKC 规范化、连续空白合并并去掉首尾空白,按唯一非空文本比较。这里只查完全一致,不查近似改写,也不关联个人身份。

两组语料 共享的规范化唯一文本
本地 AI / AI 眼镜 104
本地 AI / 家庭机器人 133
AI 眼镜 / 家庭机器人 72

两两交集可能包含同一文本,不能简单相加扣除得到全局去重数量。

机器标签应怎样阅读

本地 AI 所选主快照没有 E0–E5 编码字段,因此统一记为 not-coded。这不表示其他派生文件从未做过编码。

眼镜与家庭机器人中的 E0–E5 数字,是历史处理产生的候选标签数量。本次重计没有逐条验证语义。存在 E3 标签不表示方案接受已经成立,存在 E5 标签也不表示对我们正在研究的产品有留存证据。

使用标签前,需要核对发言对象、方案、场景、角色与上下文。等级含义见需求证据,方法协议见 SURE

为什么不能与旧文章直接混算

历史研究中同时存在原始采集、产品反馈筛选集、开放场景材料、平衡抽样与编码集。此前需求研究文章引用的产品反馈子集,与本轮 209,862 条眼镜组合语料不是同一分母。

更新结论时要先确认快照与过滤条件。不能只把正文数字替换为更大的那个。

复现到什么程度

JSON 保留输入文件摘要、统计口径与全部汇总。公开读者可以复算比例、分组总和以及 CSV 与 JSON 的一致性。完整逐条重计需要获得授权的原始快照;这不是一份可以独立重建的公开原始数据集

原始正文、平台账户、用户标识、原帖地址集合与逐条内容哈希未进入本次发布。也没有开放涉及企业内部材料的文件。输入文件级 SHA-256 只用于固定本次快照,不提供个人关联信息。

本仓库已有许可保持不变。本页不授予原始平台内容或第三方材料的新权利,也不以“开源研究”为由代替授权。

如何使用

适合用来理解这批材料的规模、来源集中度与结构问题,或检查数字在后续文章中是否被错误放大。它不适合直接用来估算购买率、留存率、市场份额、全国用户需求或产品效果。

下一次发布将优先补充可审查的任务级分析和人工复核方法,保留拒绝、满意替代方案和证据不足的情况。研究价值取决于判断质量,不取决于下载文件的大小。