数据与表格 · 仅汇总数据
本地 AI 与个人算力 · 语料汇总
本地 AI 与个人算力研究所用语料的结构统计,包含记录范围、来源分布和质量检查。仅公开汇总,不含原始用户文本。
- 资料版本
- 2026-08-31 汇总快照
- 最近复核
- 来源
- 本站已公开数据汇总
- 复核状态
- 汇总算术、来源合计与公开字段已复核
使用边界
使用前先看
核对本地 AI 研究语料的规模、时间范围、来源构成与结构质量。
211,088 条记录的聚合统计;7 类来源;JSON 与 CSV 汇总。
不含原始文本;记录数不是人数、市场份额或已验证购买需求。
公开汇总
数据概览
统计单位是记录,不是人数或已验证需求。以下字段来自 2026-08-31 的公开汇总。
- 记录
- 211,088
- 来源类型
- 7
- 时间字段
- 2024-01
— 2026-07
主要来源
- Reddit190,42590.21%
- Hacker News12,4565.9%
- 公开论坛2,8101.33%
结构检查
- 重复记录 ID
- 0
- 无效 JSON 行
- 0
- 缺少既有文本哈希
- 0
- 逐条语义复核
- 未进行
最大来源占 90.21%。这是来源集中度,不是市场份额;机器候选标签也不是人工确认的需求。
查看三组数据的方法、交叉重复与完整边界 →这份快照固定了什么
快照把本地 AI 与私有算力研究使用的一批记录固定在 2024-01 至 2026-07。公开层保留总量、七类来源的计数、时间字段、结构检查和输入快照摘要;原始帖子、账户、用户标识及逐条文本均未发布。
来源高度集中:Reddit 占 90.21%,Hacker News 占 5.90%。因此它适合发现部署、配置、隐私和持续运行中的问题,不适合估计不同人群的市场比例。
分母与跨组重复
211,088 指反馈记录,不是独立用户。主快照没有 E0–E5 编码字段,下游文件中的机器标签不能倒填成原始数据事实。
按 Unicode NFKC、空白折叠和首尾清理后的完全相同文本检查,本组与 AI 眼镜组共享 104 条文本,与家庭机器人组共享 133 条。这个检查不包含模糊匹配或人物关联,所以三组记录既不能直接相加,也不能据此宣布完成语义去重。
复核到哪里
公开 JSON 与 CSV 可以复算来源合计、比例和结构质量字段;输入摘要通过 SHA-256 绑定到本轮私有快照。本次没有重新爬取,也没有逐条进行语义审核。完整重算仍需要获得原始快照的合法访问权限。
引用时请注明 Roy.Tong、标题、资料版本和本页地址。公开阅读不扩大第三方内容的再分发权。查看收录与引用规则