20 万条用户反馈,不等于真实需求
三个行业如何得到同一套寻找真实需求的方法
过去一个月,我先后做了三次大规模用户研究。
一次研究私有算力和本地 AI 设备,一次研究 AI 眼镜,一次研究空间显示、3D 与虚拟世界。
题目隔得很远。一个关心隐私、算力成本和本地部署;一个关心佩戴、续航、拍摄和随身交互;另一个横跨游戏、3D 创作、工业、医学和数字孪生。
刚开始时,我也把它们当成三项独立任务。关键词不同,平台不同,用户不同,连要抓的网站都不一样。
把三次研究过程放在一起后,我才发现,自己一直在追同一组问题。
谁在什么情况下,要完成什么事?
他现在怎么做,哪里不顺,代价有多大?
这种不满有没有大到让他换一种做法、掏钱,或者买完以后继续用?
研究领域一直在变,这套逻辑没有变。
三次研究最终留下了一套可以跨行业复用的方法。这套方法不依赖具体行业。只要目标是从公开讨论、评论、工单、论坛和电商评价里理解场景、用户与需求,主要步骤基本一致。
我一开始以为,最大的难点是把数据抓到 20 万条。
后来发现,数量反而是最好解决的问题。
一轮私有算力研究最终留下了 211,088 条符合筛选条件的反馈,但 Reddit 仍占 90.21%。AI 眼镜第一轮抓到 200,732 条原始数据,经过日期、完整性、相关性和去重筛选,进入主样本的只有 45,630 条。
这两个结果给我泼了两盆很有用的冷水。
二十多万条数据,可能仍然只是同一群人在反复说话。看上去规模很大的原始数据,能支撑判断的也可能不到四分之一。
所以这项工作的重点逐渐从「多抓一些」变成了「每条材料究竟能说明什么」。
我最后把研究主线写成这样。
用户 × 场景与触发时刻 × 要完成的任务 × 现在的做法 × 卡点与代价 × 结果和行为
1. 先写清楚要做什么决定
很多数据研究是从平台清单开始的。
Reddit、YouTube、X、Instagram、Amazon、小红书、B 站、知乎,全都抓一遍。听起来覆盖很广,可研究做到后面,经常会卡在一个很朴素的问题上。
这些数据最后要帮我做什么决定?
如果要判断一类硬件值不值得做,最需要找的是高频任务、现有做法的代价,以及用户有没有换方案和付费的迹象。如果要从多个场景里找切入口,还要比较每个场景的严重程度、使用频率、现有方案和进入门槛。
问题不同,所需材料也不同。
现在每次开题,我都会先写一页说明。里面写明研究结束后要做的决定,目标市场和时间范围,一条数据代表什么,哪些材料可以进入结论,以及这批数据肯定回答不了什么。
还有一个问题必须提前写下来:看到什么证据时,我会放弃目前最相信的判断?
这个问题不能省略。否则,数据抓得越多,越容易变成一次昂贵的自我证明。
2. 从场景地图出发,别把自己困在产品词里
AI 眼镜研究进行到一半时,我回头看了一遍搜索词,突然觉得不太对。
如果一直搜索 AI glasses、AR glasses、smart glasses,找到的主要是已经知道这类产品、愿意讨论这类产品的人。正在游泳时想看运动数据、旅行时需要实时翻译、维修设备时腾不出手看屏幕的人,未必会在原文里提到 AI 眼镜。
产品词越精准,漏掉的人有时越多。
后来我把寻找材料的入口扩成了六类。
一类直接围绕产品和品类,找真实使用体验。另一类进入相关生态,例如 Blender、Unity、Unreal、CAD、BIM、DICOM、Minecraft 和数字孪生社区。接着从任务出发,研究建模、评审、维修、训练、旅行、运动、协作这些活动。
还要主动看替代办法。普通屏幕、VR 头显、物理样机、3D 打印、多显示器和人工流程,为什么已经够用,为什么又不够用。
拒绝购买、退货、退款、吃灰、放弃部署的人也要单独找。新品发布、降价、故障和平台政策变化前后的讨论,则单独标记,避免一次热点被误认成长期趋势。
六种入口只有第一种依赖产品词,其他入口都在找产品词背后的任务。
这里要守住一个边界。开放场景材料只能说明活动存在、任务困难或者现有做法麻烦。它不能直接说明用户会选择你正在研究的产品。
游泳的人需要实时数据,不代表他愿意戴 AI 眼镜。医生觉得 2D 切片难以理解,也不能直接推出他会接受一块空间显示设备。形态、精度、舒适度、工作流程、价格和责任,每一项都可能让需求停在半路。
场景地图负责帮我们看见更多问题。产品是否成立,还要继续验证。
3. 平台数量不等于样本丰富
我早期也觉得,多加几个平台,数据就会更全面。
实际并没有这么简单。十个技术论坛可能仍然聚集着相似的人。几个平台上的产品爱好者,也可能只是同一个群体换了地方发言。
我现在更关心每一批材料负责回答什么问题。
| 样本类型 | 主要回答什么 | 常见来源 | 容易偏向谁 |
|---|---|---|---|
| 直接使用反馈 | 好不好用、哪里坏、愿不愿意接受 | 产品社区、评测、发布评论 | 已购买者和爱好者 |
| 开放场景材料 | 用户要完成什么、现在如何处理 | 职业社区、任务论坛、活动社区 | 只能证明问题,不能证明产品偏好 |
| 替代与放弃 | 为什么不买、不换或试过以后放弃 | 竞品社区、退货帖、取消讨论 | 搜集难度高,数量通常较少 |
| 购买后与支持记录 | 可靠性、部署、维护和退款原因 | 电商评价、GitHub Issues、支持论坛 | 故障用户更愿意发声 |
| 对照样本 | 普通用户是否已经有够用的办法 | 泛用户社区、相邻品类、非用户 | 与研究产品的直接关联较弱 |
私有算力研究后期,补进放弃本地部署的人、觉得云服务更省事的人、支持工单和购买后评价后,判断质量才有改善。
支持记录能看到驱动、权限、性能和维护问题。退货与放弃能看到用户在哪一步流失。那些对现有办法很满意的人,则会提醒我们,有些市场压根不需要进入。
某类样本缺失时,继续用容易获得的社区评论补数量没有用。
这块空白应该被明确写进报告。
4. 先保留原话,再做分类
三次研究里,完整反馈始终是底稿。关键词、情绪和摘要都在后面生成。
原因很简单。采集阶段一旦只保存标签,研究者就提前替未来的自己做了判断。后来想看新的场景、新的替代办法,或者怀疑第一次分类有问题时,已经无法回到原文。
现在我的数据会保留几个不同版本。
最初版本保存完整正文、发布时间、来源链接、抓取方式和已知限制。主样本会再做时间、质量、相关性和重复内容筛选。为了避免某个月、某个平台或某类渠道压过其他材料,还会另做一份相对平衡的分析版本。
完整数据不会被平衡版本覆盖。分类规则、模型版本和人工修改也会留下记录。
这套做法看起来有点笨,一开始甚至比直接让模型总结慢得多。但它保留了重新判断的余地。
分类错了还可以重来。原话丢了,后面再精细的分析都救不回来。
5. 把需求拆成不同强度的证据
有人在评论里说,普通屏幕上看复杂 3D 模型很费劲。
这条材料只能证明问题存在。它还不能证明空间显示是合适的办法,也不能证明这个人愿意付钱。
为了控制结论的分寸,我把每条材料能够支持的判断分成七档。
| 等级 | 原文里实际出现了什么 | 可以下到哪一步判断 |
|---|---|---|
| E0 | 活动或场景 | 这个场景值得继续观察 |
| E1 | 明确任务、困难或期望结果 | 问题真实出现过 |
| E2 | 现在的做法、绕行办法及其代价 | 已经能看到现有方案的不足 |
| E3 | 明确接受或偏好新的解决办法 | 新方案获得了条件性接受 |
| E4+ | 价格讨论、购买意愿或付费表达 | 出现了直接的购买信号 |
| E4- | 拒绝、取消、退货或弃用 | 出现了直接的负面选择 |
| E5 | 已购买、已部署、持续使用或扩大使用 | 需求已经落到实际行为 |
做需求判断时,我会顺着这张表往后追。
问题有没有真实出现,用户现在怎么处理,这种做法造成了什么损失。接着看用户是否接受新方案,是否愿意付钱,买完以后有没有持续使用。
材料只走到 E1 或 E2,适合进入访谈和概念测试。走到 E3,可以讨论方案是否有吸引力。到了 E4、E5,才开始接近商业判断。
难的是按照证据等级收住结论。
E0、E1 往往数量最大,很容易做出漂亮的词云和百分比。付费、退货、持续使用的材料数量少,还散落在电商、支持记录和长期使用讨论里,搜集成本高,展示出来也没那么热闹。
但产品能否成立,往往取决于这些小数字。
6. 大样本要同时公布三组数字
二十万条数据有价值。它能让低频的退货原因、专业工作流程和高后果问题浮出来,也更容易区分一次热点和长期存在的任务。
可这个数字不会自动带来客观。
我现在会同时公布原始数据量、筛选后的主样本量和用于比较的平衡样本量。
AI 眼镜那轮研究里,原始数据有 200,732 条,最后进入主样本的是 45,630 条。中间去掉了日期不符、正文不完整、相关性不足和重复内容。这个过程必须摊开写,读者才能判断研究到底损失了什么。
时间变化也要看采样过程。
某个月的讨论突然暴涨,可能来自真实需求,也可能碰上新品发布、一次争议,或者采集器在那个社区抓得更深。缺少连续月份、事件标记和渠道对照时,趋势线很可能只是抓取方式留下的影子。
遇到这种情况,我宁愿在质量报告里写明暂时不能判断,也不把一次尖峰包装成增长。
7. 机器扩大阅读范围,人来校准结论
几十万条原文没法全靠人读。规则和大模型可以做初筛、找出新词、聚类相似内容、打初步标签,也可以把最值得复核的记录排到前面。
这些结果都需要人工校准。
我会按平台、月份、样本类型、场景和正负立场,抽出一批人工标注基准。关键字段让两个人分别判断,再计算一致性。Cohen’s kappa 或 Krippendorff’s alpha 如果低于 0.70,我会先检查分类边界是否写得含糊。
这时候急着换更大的模型,通常解决不了问题。
热门词也不能只按出现次数排序。一个争论激烈的长帖可能贡献几百条回复,却只代表一件事。新场景至少要在多个独立讨论、不同渠道和不同月份里反复出现,还要回看原文和反例。
机器帮我读得更广。结论下到什么程度,仍然要由人负责。
8. 把需求写成一段能被复查的判断
需求分析很容易停在词频表。
续航出现 12,384 次,价格出现 9,210 次,隐私出现 7,630 次,兼容性出现 5,422 次。数字很整齐,但很难直接指导产品。
续航是谁在什么情况下抱怨?他要完成什么事?现在有什么替代办法?续航不足只是有点烦,还是会导致任务中断、退货和拒绝购买?有没有另一批人觉得现有续航已经够用?
这些关系没连起来,词频只能说明讨论热度。
我现在会把每项需求写成一段完整判断。
某类用户在某个场景下要完成某项任务,目前使用某种办法。它会带来哪些麻烦和后果。用户在什么条件下接受新的解决办法,是否出现购买、部署或持续使用行为。现有材料里还有哪些拒绝、退货和满意替代方案的反例。
这段话后面直接附上原文索引、数据范围、反例和仍未回答的问题。别人可以沿着链接回到材料,检查我的判断有没有跨得太远。
确定优先级时,再分别看出现频率、问题后果、现有办法的代价、付费行为、产品是否真的能解决,以及它和当前方向是否匹配。
这些因素可以评分,但不要一上来就揉成一个看似精确的总分。换一组权重,排名就从第一掉到第十,说明这项需求还没那么确定。
研究的价值是把分歧落到具体材料上。大家可以争论问题是否严重、证据是否充分、方案是否值得做,不必争论一个来历不明的总分。
9. 数据抓到什么时候可以停
我会在开题说明里提前写停止条件。
主样本通过质量检查,关键类型的材料不再空缺,时间和语言分布能够解释,单一渠道没有压过其他样本,新数据带来的新主题已经连续下降,重要分类也经过人工校准。到这一步,下一项产品决策应该已经可以做了。
满足这些条件以后,再多抓五万条,价值可能还不如做十五个深访或一次价格测试。
反过来看,如果二十万条材料里找不到退货者、付费者和对现有办法满意的人,研究还要继续。
问题出在关键材料缺失,与总数大小无关。
写在最后
三次研究的对象看起来没什么关系。私有算力、AI 眼镜、空间显示,各自有不同的产品、用户和行业语言。
可研究做到深处,需要回答的始终是那几件事。
人在什么情况下要完成什么任务,现在怎么做,哪里付出了代价。他是否接受另一种办法,有没有真的掏钱,买完以后还用不用。
关键词帮我们找到已经被说出来的需求。开放场景让我们看见那些还没有产品名字的任务。拒绝者、退货者和满意的替代方案用户,则负责给最兴奋的判断降温。
我越来越觉得,用户研究有点像画地图。
数据量决定我们走过多少地方。采样方法决定我们是否困在同一条路上。保留原文、标出空白和限制,才能让后来的人知道这张地图是怎么画出来的。
地图当然不是世界。
但它至少应该让人看得出,哪里真的走过,哪里只是猜测,哪里还根本没去过。