← 返回文章

AI 产品怎样从“做得到”走到“值得用”:采用、交付与验收的三道门槛

把拍摄、端侧 AI、创作软件与 Agent 计量放在一起,区分问题存在、方案采用、完整交付和可验证结果,并给出下一轮实验方法。

研究问题:用户究竟在验收哪一件事?

一台相机能追踪人物,一套本地模型能回答问题,一个 Agent 能连续调用工具。这些能力都可能有用,但它们还没有回答同一个问题:用户原来要做的事,到底有没有更容易完成?

我把拍摄、端侧 AI、家庭机器人、创作软件与 Agent 计量的研究放在一起,得到一个值得继续检验的判断:产品定义容易在三个地方越级。发现问题,就推定用户会采用某个方案;看到局部能力,就推定完整任务已经交付;拿到成功日志,就推定结果被使用并创造了价值。

这份报告将它们整理为采用、交付与验收三道门槛。它是一套跨项目的分析与实验设计框架,不是市场规模预测,也不是已经完成的跨行业因果实验。公开依据来自既有研究笔记、固定版本的开源项目与本轮核对的官方文档。

第一道门槛:有困难,不等于愿意采用你的方案

用户希望拍好视频,不等于愿意增加一台会移动的设备;希望降低 AI 成本,不等于愿意维护本地服务器。一个方案即使解决了旧问题,也可能同时带来安装、学习、维护或使用环境的新要求。

研究首先应记录用户现在怎样完成任务。是在忍受繁琐步骤,还是已有足够好的替代方案?困难发生在什么时刻,谁承担后果?接受新方案的条件是什么?这些问题需要放在同一个角色和场景里解释。不能把一个人的抱怨、另一个人的购买和第三个人的长期使用,拼成一位不存在的完整用户。

我使用的 SURE 方法区分场景、问题、替代行为、方案接受与商业行为。工具可以检查字段和证据门槛,却不能替研究者证明需求真实存在。大量讨论材料适合帮助发现待验证的问题;若缺的是原型接受或实际使用证据,继续扩充背景语料不会自动填上这个缺口。

第二道门槛:衡量完整任务,保留被省略的人类工作

评价自动化时,先把任务的起点和终点画出来。拍摄任务可能从架设设备开始,到挑选片段、修改并获得可用内容结束;本地 AI 任务可能包括安装模型、授权数据、检索、生成、校对与保存。只测中间最快的一段,会把前后的劳动藏起来。

一个假设例子:旧方案的准备和收尾一共需要八分钟;新设备将拍摄操作减少四分钟,却多了三分钟配对和四分钟选片。这里不能仅凭“拍摄少四分钟”宣称效率提升。数字只是解释测量口径的演示,不是任何产品的实测。

更可靠的记录方式,是分别保留准备时间、主动操作时间、等待时间、返工时间、维护时间与任务质量。等待可以与其他工作重叠,用户注意力不能简单按墙钟时间相加。不同角色的成本也应分开:购买者得到方便,维护者可能承担额外劳动。

拍摄和创作:短而可靠的承诺也可能有价值

从可靠记录到解释、建议乃至代替用户行动,并不存在一条自动增加价值的阶梯。对某个用户,稳定留下可用片段已经解决了重要问题;对另一个用户,拍完之后仍需要大量整理。产品应该先识别哪段工作最阻碍任务完成,再决定承诺到哪里。

在拍摄场景中,可以比较固定机位、转动跟随和移动机位,让用户在相同任务下选择哪些片段值得保留。需要观察移动是否增加了真正需要的内容,也要记录设置、噪声、空间占用和后续处理。这个设计不预设移动更好,更不预设固定设备永远足够。没有实际完成对照前,它只是一份验证方案。

创作软件则可以用一次明确的修改请求测试:只更换背景,保留已确认的人物、台词和节奏。除了修改成功,还应记录其他部分是否被意外改变。OpenTimelineIO 提供片段、轨道、时间和元数据等剪辑信息的交换结构,不内嵌音视频。这说明生产过程可以保留可操作的结构,但这个格式本身并不证明某个 AI 工具已能稳定完成修改。

资料:OpenTimelineIO 官方文档,2026-10-10 查阅。

端侧 AI:先确定必须留在本地的任务

端侧讨论很容易从设备参数开始。我更愿意先问:哪些步骤必须断网完成,哪些数据不能离开边界,任务多久发生一次,失败以后谁恢复?这些约束决定应该比较什么设备和软件,而不是反过来。

LM Studio 的官方说明确认,下载好模型后可以进行本地聊天、文档处理与本地服务;模型搜索、下载及更新等功能仍需要联网。这为研究提供了一个现有电脑上的替代基线。它不能证明接入外部工具后的整条 Agent 链路也都离线,更不能直接证明用户需要额外购买专用设备。

Ollama 文档说明,增加上下文长度会提高模型运行所需的内存。因而比较不能只列模型参数量或峰值算力。应在同一任务、质量要求和数据边界下,比较现有电脑、专用本地设备与允许使用的云端方案,并记录安装维护、上下文需求、失败处理和结果可用性。这里提出的是评估条件,不宣称任何路线已经在总成本上胜出。

资料:LM Studio 离线说明、Ollama 上下文说明,2026-10-10 查阅。

第三道门槛:执行成功之后,结果仍需验收

一次工具调用完成,可以证明该次调用返回了某种结果;它未必证明用户目标实现。报告文件生成了,不代表内容准确;预约创建了,不代表时间和对象符合用户要求;两次重试,也不一定代表两次独立任务。

Agent 计量研究因此要区分尝试、逻辑操作、任务结果、结果采用与业务价值。每个数字必须说明分母和可观察范围。若缺少可靠标识,无法将多次尝试归入同一操作,就保留无法判断的部分,而不是强行输出精确的成功率。

AgentMeasure 的固定版本 README 明确采用 PASS、FAIL 和 UNPROVABLE,并将执行事实、规则核验与经济结算分开。这里引用的是项目的设计边界,不是对行业采纳程度、客户收益或审计战绩的独立验证。付费记录可以证明发生了支付,仍不能单独证明增量价值;退款或让步也应与原先提出的主张分开记录。

把三道门槛变成一个可执行的对照

第一步,写清一个用户、一个场景、一项承诺和现有替代方案。例如“在固定室内活动结束后,得到可用的拍摄片段”。“更智能”“更懂用户”不够具体,无法告诉评审者什么结果算通过。

第二步,在测试前定义可接受结果、不可接受的副作用和需要接管的条件。对同一类任务比较既有方案与新方案,尽量保持材料和环境一致;让评审者依据事先约定的标准检查结果。若条件不能一致,保留差异,不假装完成了严格因果实验。

第三步,分别记录采用、交付和验收。采用看用户是否在给定条件下选择并实际使用;交付看合格完成、操作负担、维护与恢复;验收看结果是否满足标准、是否被采用、还缺什么证据。对娱乐和表达任务,结果标准可以是用户选择保留、分享或重复体验,不必强行换算成生产效率。

第四步,保存不成功和被放弃的任务,复核最强反例。若用户喜欢结果却不愿意日常设置设备,先研究部署负担;若任务完成却经常需要重验,先研究可检查性;若结果可靠但不被选择,再回到任务重要性和替代方案。不同断点需要不同实验,不能统一归因为模型不够强。

研究边界:这套框架还不能证明什么

这些研究横跨不同产品,尚未使用统一样本与任务完成跨领域实验。因此,三道门槛是整理问题的方法,不能合成一个具有统计效力的行业总分,也不能据此预测某家公司成败。

它更适合任务承诺明确、需要反复交付的产品。娱乐、陪伴、身份表达与探索型创作也有价值,但采用与验收方式不同。不能因为难以量化,就删去这些动机;也不能因为动机存在,就宣称某种硬件、价格或商业模式已经成立。

本轮没有把私有项目预算、合作资料、会话全文或原始平台用户内容放进公开报告。已有语料规模不等于独立用户数;不同快照也未做统一重算。下一步最有价值的工作,是选一个具体任务,带着同一份验收条件,比较旧方案和新方案,再用实际结果修订判断。

参考资料