AI Wearable 的竞争,不是眼镜对耳机
要比较的是模态、控制、身体位置与长期佩戴成本组成的整套系统。
打开一份 AI Wearable 竞品表,第一列通常是眼镜、耳机、戒指、手表和挂坠。
这种分类适合摆放商品,却不适合解释竞争。
两副外形相似的眼镜,可能是完全不同的产品:一副用摄像头和麦克风理解环境,再通过声音回答;另一副增加显示,把导航、翻译和消息直接放进视野。它们的输入、输出、交互带宽、功耗和使用场景都不同。
反过来,一副眼镜、一只耳机和一枚戒指,也可能在竞争同一件事:谁能最自然地获得用户当下的上下文,理解他的意图,并在不打断现实任务的情况下给出帮助。
因此,AI Wearable 的竞争不能只看“眼镜对耳机”。更有解释力的分析单位是四层组合:
- 输入与输出模态怎样配对;
- 用户通过什么方式控制系统;
- 设备占据身体哪个高上下文区域;
- 用户愿意为这套能力承担多少佩戴成本。
产品形态只是这四层约束共同作用后的结果。
一、先比较模态组合,不要先比较设备名字
多模态要落到输入、输出与任务的匹配,不能只数摄像头、麦克风和模型。
输入模态决定系统能理解什么,输出模态决定系统能怎样回应。两者必须与具体任务一起比较。
W3C 很早就把语音、触摸、键盘和手写等视为不同输入,把显示、语音、音频和触觉视为不同输出。进入 AI Wearable 时代,模型开始在这些模态之间理解语义、保持上下文并生成回应。
可以把一款产品写成一个组合:
输入模态 × 输出模态 × 用户任务 × 使用环境
同样叫“AI 助手”,不同组合会形成不同产品。
| 模态组合 | 适合的任务 | 主要优势 | 主要限制 |
|---|---|---|---|
| 图像 + 语音输入 → 语音输出 | 询问眼前物体、实时翻译、环境提示 | 用户不用描述现场,也不用盯屏幕 | 复杂信息难以靠声音快速浏览和回看 |
| 语音输入 → 图像输出 | 导航、字幕、清单、短消息 | 结果可扫视、可持续留在界面 | 需要显示系统,增加功耗、重量与视觉干扰 |
| 图像 + 语音输入 → 图像 + 语音输出 | 现场指导、空间提示、分步骤任务 | 输入和反馈带宽都高 | 系统复杂,对延迟、配准、散热和交互要求更高 |
| 语音 + 动作输入 → 语音或触觉输出 | 运动、通勤、免手操作 | 不占用视线,反馈及时 | 难承载结构复杂或需要比较的信息 |
| 生理 + 动作输入 → 图像或语音输出 | 健康趋势、运动建议、异常提醒 | 能持续感知身体状态 | 数据解释、误报、权限和医疗边界更敏感 |
这些组合没有统一的高低顺序。
声音输出适合即时、线性的短信息,却不适合同时比较多个选项;视觉输出带宽更高,但会占用视野和注意力;触觉非常离散和私密,却很难解释复杂内容。摄像头能获得第一视角环境,但也带来功耗、隐私和旁观者接受问题;麦克风适合自然语言,却会受到噪声、公开场合和口音影响。
Google 对 Android XR 眼镜的公开描述就展示了这种组合差异:摄像头、麦克风和扬声器可以提供视觉与语音输入、声音输出,显示则是可选能力。是否增加显示,不只是“高配或低配”,而是产品任务、反馈带宽和佩戴代价的重新分配。
所以比较 AI Wearable 时,第一列不该是“眼镜/耳机”,而应该是:它能看到、听到或感知什么,又能用什么方式把结果交还给人。
二、控制方式要按任务分工
输入与输出回答系统如何感知和表达,控制方式则回答:用户怎样把意图可靠地交给系统。
语音很自然,但不是万能入口。
用户在安静的家里可以直接说出复杂意图,在会议、地铁和面对陌生人时却可能不愿开口;高噪声环境会影响识别,涉及密码、回复和确认时也不适合公开说出。对“开始录制”“确认支付”“关闭提醒”这类确定性动作,实体按钮或清晰手势通常比开放语句更可预期。
一套完整的交互系统更可能把任务分配给多种控制:
- 语音:表达开放、语义复杂的意图;
- 按钮与触摸:执行高频、确定、需要盲操作的动作;
- 视觉界面:展示状态、选项、差异和确认;
- 手势、戒指或腕带:在不说话、不触碰面部设备时发出离散指令;
- 手机:承担首次设置、复杂编辑、权限管理和异常恢复。
这些入口要根据动作的频率、风险、隐私和认知负担分工,而不是全部堆进一台设备。
已经出现的产品路径也说明,控制器不必长在主设备上。Apple 在 visionOS 中把眼睛用于指向、手势用于确认;Meta 的显示眼镜把 EMG 腕带作为控制器,用细微手部动作发出命令;Samsung 的智能戒指则能通过双指捏合控制手机拍摄或关闭闹钟。
这些例子指向一个更重要的变化:
AI Wearable 可以是一套分布在眼睛、耳朵、手指、手腕和手机之间的个人交互系统。
眼镜负责第一视角和显示,耳机负责私密音频,戒指或腕带负责静默确认,手机负责高密度管理。此时,竞品分析不能只比较主机,还要比较配对、连接、充电、状态同步和异常恢复组成的整条交互链。
三、稀缺的是身体上的“上下文位置”
手机通常在口袋或桌面上。要获得上下文,用户需要掏出、解锁、对准、输入;任务结束后再收起。
Wearable 的价值,是把传感器和反馈通道放在更接近用户感官、动作与意图的位置,减少这段启动成本。
不同身体区域承载的上下文并不相同。
| 身体区域 | 最容易获得的上下文 | 最适合的反馈或控制 | 核心代价 |
|---|---|---|---|
| 眼睛与面部附近 | 第一视角画面、注视方向、环境空间 | 视觉显示、声音、触摸镜腿 | 光学、重量、热、外观、处方适配与拍摄隐私 |
| 耳朵附近 | 环境声音、对话、头部运动 | 私密音频、触摸、头部动作 | 长期堵塞感、听觉占用、卫生与续航 |
| 嘴与喉部附近 | 语音、呼吸、细微发声与交流意图 | 语音输入、静默语音潜力 | 社交可见性、噪声、隐私与贴肤舒适 |
| 手腕与手指 | 手部动作、确认意图、生理与活动信号 | 手势、触觉、按钮、离散命令 | 场景理解较弱,动作误触与双手占用 |
| 脖子与胸前 | 较稳定的朝向、声音、运动与更大承载空间 | 音频、触觉、摄像头或作为算力电池载体 | 摆动、衣物遮挡、压迫、发热与外观接受度 |
“上下文密度”取决于某个位置能否持续接近用户正在看、听、说、做和决定的事情,而非传感器数量。
五官附近尤其重要,因为它同时接近现实输入和人的主要感知通道。眼镜获得与视线接近的第一视角,耳机靠近听觉并能私密输出,嘴部附近最接近语言意图。脖子和胸前则提供另一种可能:把部分重量、摄像头、扬声器、电池或计算从面部移开,换取更大的承载空间。
但身体位置不是一块被抢到就永久拥有的“地盘”。它是一份持续许可。设备只有在用户愿意戴、允许感知、并能在真实场景使用时,才拥有上下文。
因此,最强的竞争对手经常仍是手机。手机虽然启动摩擦更大,却拥有成熟显示、输入、算力、连接和应用生态。Wearable 必须证明,它在某些高频或关键时刻减少的摩擦,足以覆盖新增设备带来的佩戴、充电和管理成本。
四、舒适性直接决定产品能力
AI 产品依赖上下文,Wearable 获取上下文的前提是它真的在用户身上。
一款设备拥有再多传感器,如果用户一小时后就摘下,实际可用上下文仍然很少。可以把有效能力粗略写成:
有效上下文 = 感知能力 × 实际佩戴时长 × 场景覆盖 × 用户授权
其中任何一项接近零,最终结果都会大幅下降。
重量只是佩戴舒适性的一部分。
1. 物理舒适
总重量、重心、接触面积、夹持力、局部压力、温升、透气、材质和尺寸适配共同决定体感。针对头戴显示的研究发现,重量会影响疲劳,而重心位置会改变这种影响;同样的克数,以不同方式分布在鼻梁、耳朵和头部,感受并不相同。
2. 感官舒适
显示亮度、视野遮挡、文字位置、声音泄漏、耳道占用、持续提示和震动强度都会消耗注意力。设备没有压痛,不代表它不会造成视觉、听觉或认知疲劳。
3. 交互舒适
频繁说唤醒词、抬手、捏合、触摸镜腿或重复确认,都属于交互成本。一个动作第一次很酷,不代表每天执行一百次仍然自然。
4. 社会舒适
用户是否愿意戴着设备见客户、坐地铁、与朋友交谈?旁观者能否知道摄像头何时工作?公开说话、凝视界面或做特殊手势,会不会让用户和周围的人不自在?这些问题直接决定可用场景。
5. 维护舒适
每天要充几次电,需要携带几个盒子,沾汗或下雨后怎样清洁,镜片和耳塞如何更换,忘带控制器后是否还能使用,设备故障如何维修——这些都构成长期佩戴成本。
因此,舒适性会直接约束传感器、算力、结构、交互和商业模式,不能留到产品完成后再优化。
五、从设备品类转向四种系统路线
把模态、控制、位置和舒适性放在一起,可以看到几种不同的系统路线。
| 系统路线 | 典型组合 | 优势 | 必须接受的取舍 |
|---|---|---|---|
| 感知优先 | 图像 + 语音输入,声音输出,语音/按钮控制 | 轻反馈、少占视线,适合问答、记录和环境帮助 | 难浏览复杂信息,很多结果仍需回到手机 |
| 扫视反馈 | 图像 + 语音输入,视觉 + 声音输出,手势/腕带控制 | 信息密度更高,可做导航、字幕和短交互 | 显示、控制和功耗提高系统复杂度与佩戴成本 |
| 听觉伴随 | 语音 + 环境声音 + 动作输入,声音/触觉输出 | 形态成熟、私密、适合通勤和免手任务 | 缺少第一视角图像与视觉反馈 |
| 分布式系统 | 眼镜或耳机 + 戒指/腕带 + 手机 | 不同身体位置各司其职,控制更丰富 | 多设备购买、配对、充电、丢失与状态同步 |
这四种路线并不互斥,也不是固定终局。它们只是帮助产品团队看清:增加一项模态或一个控制器,会改变整套系统的收益和成本。
一个产品也不需要覆盖所有路线。清楚的定位应说明:服务谁、在什么情境、完成什么任务、为什么这组模态和身体位置比手机或现有设备更好,以及不适合谁。
六、怎样验证一款 AI Wearable 是否成立
如果仍按形态做问卷,用户很容易回答“更喜欢轻一点的眼镜”或“希望耳机增加摄像头”,却无法证明他会长期佩戴。
更有效的验证从代表性任务开始。
1. 用同一任务比较不同系统组合
例如在步行导航、现场翻译、家庭记录或设备维修中,同时测试手机、声音型 Wearable、带显示 Wearable 和分布式控制方案。不要先规定答案一定是眼镜。
2. 覆盖真实环境,而不只在演示空间测试
安静与嘈杂、室内与户外、独处与社交、双手空闲与被占用、网络良好与中断,都可能改变最合适的模态。
3. 记录整天的佩戴行为
观察用户什么时候戴上、摘下、静音、改用手机、忘记充电,以及为何放弃某次交互。实验室里的十分钟任务无法替代连续数日的行为。
4. 同时测任务结果与佩戴成本
至少记录:启动时间、任务完成率、纠错次数、误触发、人工确认、摘下次数、有效佩戴时长、续航覆盖、社交中断、旁观者反应和次日复用。
5. 预先写出推翻条件
如果高频任务仍要回到手机;如果显示提高了完成率却显著缩短佩戴时长;如果语音在多数目标场景无法公开使用;如果分布式控制带来的增益小于多设备管理成本,就应该收缩方案,而不是继续增加参数。
AI Wearable 的验证要检验用户是否愿意为了持续完成一组任务,把某套系统长期留在身体上。单问他喜不喜欢一种形态,得不到这个答案。
结语:下一代入口是一套组合
眼镜、耳机、戒指、手表和挂坠当然会继续存在,但这些名字越来越难解释产品边界。
竞争集中在四件事上:
- 哪些输入能获得任务所需的上下文;
- 哪些输出能以最低打扰交付结果;
- 哪些控制方式能让用户可靠、私密地表达意图;
- 哪个身体位置能让这套能力被长时间接受。
传感器最多、显示最强或模型最大的设备未必胜出。产品还要把模态、交互、身体位置与舒适性组合成一套低摩擦的使用流程。
所以,分析 AI Wearable 时,不妨先把“眼镜对耳机”从标题里删掉。
先问:在真实任务中,用户愿意让哪一组感知与反馈通道,留在自己身上多久?