← 返回文章

AI 交互在等它的“触控时刻”

眼镜、耳机、戒指不会自己长成一套语言。看、指、捏、说要成为公共语法,先要解决模态分工、身体位置与佩戴成本。

打开一份 AI Wearable 竞品表,第一列通常是眼镜、耳机、戒指、手表和挂坠。这种分类适合摆放商品,不适合解释竞争:两副外形相似的眼镜可能是完全不同的产品,而一副眼镜、一只耳机和一枚戒指,也可能在竞争同一件事——谁能最自然地获得用户当下的上下文,理解意图,在不打断现实任务的情况下给出帮助。

把这些设备挨个上手,你会发现另一个更根本的问题。眼睛、手、语音、控制器都能输入,系统也确实都支持,但“支持四种输入”和“用户掌握一套交互语言”中间隔着很远:可以看,可以捏,可以说,演示很顺,可换一个应用,用户不知道该看、该指还是该开口,设计师也不知道该把确认交给谁。

我把这个缺口称为:AI 交互还没有迎来自己的“触控时刻”。

触摸屏并不是从 iPhone 才出现。改变移动计算习惯的,是点按、滑动、拖拽、双指缩放逐渐获得了稳定含义——换一个 App 不需要重新学习怎样浏览、选择和返回,做一个新 App 也不必重新发明最基础的操作。空间与穿戴设备的交互,今天正处在“有触摸屏、还没有触控语法”的阶段。

它到来的标志会是:面对一个陌生的空间应用,用户已经大致知道怎么开始;系统也能稳定回答——你在看什么、你选中了什么、接下来会发生什么、做错了怎样回来。

这篇文章把这个问题拆成四层:输入怎样分工,语言的原语是什么,语法长在身体的什么位置,以及怎样验证一套语法是否真的成立。

一、输入已经够多,分工还没形成

今天的空间设备已经能追踪视线和双手、识别环境、把窗口固定在真实空间。Apple 在 visionOS 中以眼睛和手作为主要输入:先看向目标,再用拇指和食指轻点;Android XR 则把手、眼、语音、键鼠和控制器都纳入系统交互。这些能力操作“放进空间里的 GUI”已经够用。

问题在于,操作一个悬浮窗口和操作真实世界不是一回事。屏幕有稳定平面,鼠标有明确光标,手指能得到桌面支撑;空间里有深度、遮挡和不断移动的人。视线会自然扫过物体,手会抖,手臂悬空久了会累(对头戴显示的研究早就量化过悬空手势的疲劳,即 consumed endurance),在办公室或地铁里,用户也未必愿意持续说话、挥手。Hincapié-Ramos et al.:Consumed Endurance 更要紧的是,空间动作可能触及真实设备:误点一个图标最多关掉窗口,误关一个阀门、误移动一台机器,后果完全不同。

所以键鼠和触控不能原样搬进三维世界,多模态的价值也不是让用户从四种入口里任选一种,而是把一句完整的意图拆给最合适的输入:

  • 语音:表达开放、语义复杂的意图——但它不擅长从密集物体里精确指出“右边第三个零件”,在会议和地铁里也未必开得了口;
  • 视线:建立注意与上下文,最自然,但“看见”不能直接冒充“同意”;
  • 捏合与按钮:表达承诺并直接操作,适合确认和连续动作,复杂手势难学,也不适合长时间悬空——对“开始录制”“确认支付”这类确定性动作,实体按钮通常比开放语句更可靠;
  • 手势、戒指、腕带:在不说话、不触碰面部设备时发出离散指令;
  • 手机:承担首次设置、复杂编辑、权限管理和异常恢复。

W3C 很早就把语音、触摸、键盘、手写视为不同输入,把显示、语音、音频、触觉视为不同输出;进入 AI 时代,真正的新问题是模型开始在这些模态之间理解语义、保持上下文并生成回应,于是“哪种输入负责哪段意图”第一次成为必须设计的产品决策,而不是系统自带的默认。W3C:Multimodal Architecture and Interfaces

一句话:输入与输出回答系统如何感知和表达,控制方式回答用户怎样把意图可靠地交出去,而 AI 眼镜、AI 耳机这类产品竞争的第一层,就是这组配对选得对不对。Google 对 Android XR 眼镜的公开描述就是一例:摄像头、麦克风和扬声器提供视觉与语音输入、声音输出,显示是可选能力——是否加显示不是“高配低配”,而是产品任务、反馈带宽和佩戴代价的重新分配。Google:Android XR

二、四个原语:看、指、捏、说

分工之上还需要一套稳定的语义。我愿意把空间交互压缩成四个原语:

原语 主要职责 适合做什么 不能默认等于什么
看 建立注意与上下文 高亮候选、读取状态、缩小范围 确认、授权或执行
指 明确对象、区域与方向 消除“这个”“那里”的歧义 高精度连续操控
捏 表达承诺并直接操作 选择、抓取、拖动、缩放、细调 描述复杂目标
说 表达目标、关系与约束 提问、比较、生成、安排多步任务 独自完成精确空间定位

看,让系统知道我此刻关注哪里。指,把“眼前这一片”收窄成一个对象或区域。捏,把关注变成一次明确的确认,也承担拿取、移动和调整。说,负责手势很难表达的部分:为什么改、要改成什么样、还要满足哪些条件。

这四个词不是行业标准,也不要求每台设备用同一套传感器。需要稳定的是语义边界:可以用眼睛也可以用头部朝向建立焦点,可以捏手指也可以按实体键完成确认——输入方式可以适配,核心含义不能每到一个应用就重来一遍。OpenXR 的 action 机制已经体现了这个思路:应用声明“选择”“抓取”这类有业务含义的动作,运行时把不同设备的具体输入映射过来。平台该固定的是动作的公共含义,不是某一枚按钮。Khronos:OpenXR Action

三、组合起来:从 Point and Click 到 Point and Ask

有了原语,就会出现比桌面时代更自然的组合。

我指向一台陌生设备,问:“这个灯为什么一直闪?”——指向提供对象,现场提供上下文,语音提供问题。用户不必先查设备型号,也不用描述“左侧第二排的黑色圆柱体”,空间本身已经进入提示词。这是 Point and Ask。

我指向机械结构里的一个部件,说“把这部分拆开给我看”,或者指向客厅一块区域说“把这里改成六个人能讨论、又不挡通道的布局”——前半句确定对象,后半句表达目标,Agent 再把目标拆成步骤、调用工具或生成方案。这是 Point and Act。

麻烦也从这里开始。系统必须先让我看见它选中了什么,而不是直接猜;修改真实状态前要给预览,高风险动作要再次确认;执行中要显示进度和影响范围;做错后要能撤销、回滚或交还人工。没有这些反馈,Point and Ask 只是更方便的提问;没有这些控制,Point and Act 会变成一句话触发的黑箱。

这同时引出了两条回路。我抓住一个三维模型把它转过来,这件事应该立即发生——如果每次旋转都要等 Agent 理解、规划和回复,哪怕只慢半秒,手里的控制感也会消失,这是快环:看向对象、捏合确认、直接改变局部状态、立即反馈。而当我说“把这套结构改得更适合儿童使用,先给三个方案,并检查容易夹手的位置”,它就进入慢环:指明对象、说出目标、Agent 规划、展示预览、用户确认、执行与回退。

产品最难的是两个回路怎样交接。用户要知道当前是谁在控制——是我的手在直接移动对象,还是 Agent 已经开始修改多个状态;它做到了哪一步,哪里用了推测,什么时候需要我确认;如果我现在接管,真实世界和数字状态会停在哪里。Agent 越强,这些边界问题越重要:能力增加了,控制边界却不清楚,系统只会变得更难预测。

四、这套语法长在身体的什么位置

公共语法不能悬空,它要部署在具体的设备上,而设备长在身体的具体位置。手机通常在口袋或桌面,要获得上下文,用户需要掏出、解锁、对准、输入;Wearable 的价值,是把传感器和反馈通道放在更接近感官、动作与意图的位置,消掉这段启动成本。

不同身体区域承载的上下文并不相同:

身体区域 最容易获得的上下文 最适合的反馈或控制 核心代价
眼睛与面部附近 第一视角画面、注视方向、环境空间 视觉显示、声音、触摸镜腿 光学、重量、热、外观、处方适配与拍摄隐私
耳朵附近 环境声音、对话、头部运动 私密音频、触摸、头部动作 长期堵塞感、听觉占用、卫生与续航
嘴与喉部附近 语音、呼吸、细微发声与交流意图 语音输入、静默语音潜力 社交可见性、噪声、隐私与贴肤舒适
手腕与手指 手部动作、确认意图、生理与活动信号 手势、触觉、按钮、离散命令 场景理解较弱,动作误触与双手占用
脖子与胸前 较稳定的朝向、声音、运动与更大承载空间 音频、触觉、摄像头或作为算力电池载体 摆动、衣物遮挡、压迫、发热与外观接受度

“上下文密度”取决于一个位置能否持续接近用户正在看、听、说、做和决定的事情,而不是传感器数量。五官附近重要,因为它同时接近现实输入和人的主要感知通道;脖子和胸前则提供另一种可能——把部分重量、摄像头、电池或计算从面部移开,换取更大的承载空间。

但身体位置不是一块抢到就永久拥有的地盘,它是一份持续许可:设备只有在用户愿意戴、允许感知、并能在真实场景使用时,才拥有上下文。因此最强的竞争对手经常仍是手机——手机启动摩擦更大,却拥有成熟显示、输入、算力、连接和应用生态。Wearable 必须证明,它在高频或关键时刻减少的摩擦,足以覆盖新增设备带来的佩戴、充电和管理成本。

控制器也不必长在主设备上。Apple 在 visionOS 中把眼睛用于指向、手势用于确认;Meta 的显示眼镜把 EMG 腕带作为控制器,用细微手部动作发出命令;Samsung 的智能戒指能通过双指捏合控制手机拍摄或关闭闹钟。Apple:Design for spatial input、Meta:显示眼镜与 EMG 腕带、Samsung:Galaxy Ring 的 Double Pinch 这指向同一个变化:AI 设备可以是一套分布在眼睛、耳朵、手指、手腕和手机之间的个人交互系统——眼镜负责第一视角和显示,耳机负责私密音频,戒指或腕带负责静默确认,手机负责高密度管理。此时竞品分析不能只比主机,还要比配对、连接、充电、状态同步和异常恢复组成的整条交互链。

五、佩戴是语法成立的前提

一套语法再漂亮,用户一小时后把设备摘了,实际可用的上下文仍然很少。有效上下文不只取决于感知能力,还取决于实际佩戴时长、场景覆盖和用户授权——任何一项接近零,设备真正能拿到的上下文都会大幅缩水。

重量只是佩戴成本的一部分,至少有五个维度:

  1. 物理舒适:总重量、重心、接触面积、夹持力、温升、材质与尺寸适配。头戴显示的研究发现,重量影响疲劳,而重心位置会改变这种影响——同样的克数,分布在鼻梁、耳朵和头部的不同方式,感受完全不同。Applied Sciences:头戴显示重量与重心
  2. 感官舒适:显示亮度、视野遮挡、声音泄漏、持续提示——设备没有压痛,不代表它不会造成视觉、听觉或认知疲劳。
  3. 交互舒适:频繁说唤醒词、抬手、捏合、重复确认都是成本。一个动作第一次很酷,不代表每天执行一百次仍然自然。
  4. 社会舒适:用户是否愿意戴着它见客户、坐地铁;旁观者能否知道摄像头何时工作。
  5. 维护舒适:每天充几次电、要带几个盒子、沾汗后怎么清洁、忘带控制器还能不能用。

舒适性会直接约束传感器、算力、结构和商业模式,不能留到产品完成后再优化。目前很多 AI 硬件停留在两个极端:一种只是给传统硬件加聊天能力,另一种擅长展示技术,却没有形成值得反复使用的完整体验。AI 输出的不确定,与硬件需要稳定、及时、可预测之间,也存在天然矛盾。用户愿意长期使用的产品,仍然要回答那些朴素的问题:是否解决高频而明确的需求?是否比拿出手机更省事?关键任务能否稳定完成?

六、再往远处:从 Spatial App 到 World Canvas

今天的大部分软件仍由 App 组织:修图打开图像软件,导航打开地图。空间设备也沿用了这套结构——打开一个 App,把窗口摆进房间。但真实空间不是一组窗口:一把椅子有位置、朝向、所属人;一台机器有结构、状态、历史和权限;同一个对象会被设计工具、维修工具和家庭 Agent 同时使用。

如果空间计算继续发展,它的组织单位会逐渐从 App 走向一张“世界画布”:真实对象与数字对象共同组成一个可被理解、操作和授权的整体,用户表达的也不再是某个菜单命令,而是“希望这部分世界变成什么状态”——告诉我这里为什么漏水;把这张桌子挪到不挡门的位置;冻结现在的布置试一下另一种规则,效果不好就恢复。

这是一种产品方向,不是已经完成的行业事实。要让它成立,平台需要为对象提供稳定身份、维护空间关系和状态、处理跨应用访问、定义人和 Agent 各自的权限——这比在房间里多放几个窗口难得多,也更接近空间计算与桌面计算的真正差别。

七、别用一个漂亮 Demo 证明一套语法

空间产品很容易用一次视觉效果跨过所有难题。为了判断产品到底走到了哪里,我会用一套朴素的五级尺度:

等级 用户获得的能力
L0 展示 能在空间中看见窗口、图像或三维内容
L1 指认 能稳定发现、指向和选中对象
L2 操作 能拿取、移动、组合或修改对象,并获得清楚反馈
L3 完成任务 系统能理解目标、协调多步动作,用户可以确认和接管
L4 持续协作 对象、关系、权限与任务状态可以跨时间、场景和工具延续

一个视觉震撼的 Demo 可能仍在 L0;一个画面朴素、却能稳定完成维修指导并随时回退的系统,可能已经走到 L3。任何平台都要从显示开始,问题在于不能用“第一次看很惊艳”证明用户会每天使用。

所以如果现在做空间交互原型,我不会先造宏大的虚拟世界,会先做三个普通人能在 30 到 60 秒内判断成败的任务。第一个,遮挡与探身:目标被挡住一部分,用户侧身看过去再指向它,系统能不能持续认出同一个对象,用户能不能看懂自己选中了哪一个。第二个,指认、询问与拆解:指向陌生装置问它的作用,再要求显示拆解顺序,后续每一步能否延续同一个对象上下文,说明是否准确落在对应部件,用户能否随时纠错暂停。第三个,冻结、改规则与回退:冻结场景、提出新约束,系统先预览再由用户确认执行,效果不好能一键回到修改前。

这三个 Demo 分别检验对象选择、上下文延续和 Agent 控制。测试要覆盖真实环境——安静与嘈杂、独处与社交、双手空闲与被占用——要记录整天的佩戴行为(什么时候戴上、摘下、静音、改用手机、忘记充电),同时记录任务结果与佩戴成本:启动时间、完成率、误触发、摘下次数、有效佩戴时长、续航覆盖、旁观者反应。还要预先写出推翻条件:如果高频任务仍要回到手机;如果显示提高了完成率却显著缩短佩戴时长;如果语音在多数目标场景无法公开使用——就应该收缩方案,而不是继续增加参数。

判断标准最后收敛为一句话:用户有没有学会一个以后还能复用的动作,而不只是觉得画面很酷。

结语:先把“眼镜对耳机”从标题里删掉

眼镜、耳机、戒指、手表和挂坠会继续存在,但这些名字越来越难解释产品边界。竞争集中在四件事上:哪些输入能获得任务所需的上下文,哪些输出能以最低打扰交付结果,哪些控制方式能让用户可靠而私密地表达意图,哪个身体位置能让这套能力被长时间接受。

传感器最多、显示最强或模型最大的设备未必胜出。胜出的更可能是把模态、交互、身体位置与佩戴成本组合成一套低摩擦使用流程的产品。

所以分析 AI 交互时,不妨先把“眼镜对耳机”从标题里删掉,先问:在真实任务中,用户愿意让哪一组感知与反馈通道,留在自己身上多久?当面对不同的应用,人已经自然地知道先看哪里、怎样指明、何时确认、如何说出目标,系统也稳定地知道什么只是注意、什么才是授权——看、指、捏、说才算真正成为人、Agent 与空间对象共同工作的公共语法。


延伸资料