← 返回文章

Agent 向左,具身向右:AI 在信息空间与物理世界的分岔

它们共享模型与规划能力,却分别受数字世界的可逆性和物理世界的不可逆后果约束。

把 AI Agent 和具身智能放进同一个故事,很自然。模型越来越强,AI 开始理解环境、规划步骤、调用工具,也开始替人完成任务。

故事讲到这里,往往会再往前推一步:具身智能是 Agent 的下一站,机器人就是给 Agent 装上一副身体。 这个推论忽略了两类系统行动后果的差异。

两者都在从“生成内容”走向“采取行动”,但它们行动的对象不同:

Agent 主要改变信息世界的状态;具身系统直接改变物理世界的状态。

改变的状态不同,错误能否撤销、系统如何评测、安全责任如何划分、产品怎样部署、公司如何规模化,也会随之分岔。

这一区分,决定了两套不同的产品与产业逻辑。

一、它们为什么看起来像同一股浪潮

Agent 与具身智能确实拥有一段相似的过去。

在信息世界,自动化先从脚本和固定规则开始。RPA 按预先配置的步骤点击界面,传统软件按照明确流程处理输入。模型能力提升之后,Copilot 开始参与局部工作;再往前一步,Agent 可以理解目标、选择工具、执行多步操作,并根据结果继续调整。

在物理世界,自动化也曾主要依赖固定程序和结构化环境。工业机器人在确定的位置、节拍和安全边界内重复动作;后来,视觉感知、学习控制和策略模型逐步提高了系统处理变化的能力。RT-2 把视觉、语言与机器人动作放进同一模型,Open X-Embodiment 则尝试通过跨机器人数据提高策略的迁移能力。Google DeepMind 后续发布的 Gemini Robotics,也把泛化、交互和灵巧操作列为机器人模型的关键能力。

两条路线的共同变化是:

  1. 环境不再需要被完全预定义;
  2. 系统开始理解自然语言和多模态上下文;
  3. 系统不只给出建议,还会选择并执行动作;
  4. 动作之后会读取反馈,再决定下一步。

因此,从模型能力看,它们确实越来越相似。Agent 调用 API,机器人调用运动控制器;Agent 读取网页和数据库,机器人读取摄像头、深度信息和关节状态;两者都需要规划、记忆、工具和反馈。

但共同的模型能力,不等于共同的产品规律。

二、分岔点:AI 到底改变了什么

Agent 处理的通常是文件、代码、消息、日程、数据库、账户和业务流程。它执行一次操作,改变的是某个数字系统里的状态。

具身系统处理的是位置、姿态、物体、空间、能量和人与设备之间的安全关系。它执行一次操作,改变的是现实世界中的状态。

这一区别最先体现在错误上。

一封邮件发错了,可能还能补充说明;一段代码写错了,可以回滚;数据库被错误修改,可能通过日志和备份恢复。数字世界当然也存在不可逆操作——例如转账、公开发布和数据删除——但软件通常能够通过权限、沙箱、版本、日志和人工审批,把高风险动作单独隔离出来。

物理世界的错误更难被抽象掉。机械臂碰坏一个物体,损失已经发生;移动机器人撞到人,不能靠“重试”恢复;设备因为电量不足停在危险位置,问题不只是任务失败,还可能引入新的风险。

两条路线的分岔发生在这里:系统是否直接承担现实世界中的不可逆后果。

这也解释了为什么一个在 Benchmark 上表现很好的模型,并不自动等于一个可以持续交付的机器人产品。模型只是物理闭环中的一层,传感器、状态估计、控制、结构、执行器、能耗、安全、维护与异常恢复必须同时成立。

三、两条路线会沿八个维度越走越远

维度 AI Agent 具身智能 / 机器人
主要操作对象 文件、消息、代码、账户、数据库与业务状态 位置、物体、空间、能量与人的安全边界
错误可逆性 多数操作可回滚、重试、补偿或转人工 物理后果可能即时发生,部分错误不可逆
复制与扩张 软件可快速分发,同一套能力服务大量用户 每增加一个执行单元,都要生产、部署和维护实体设备
数据闭环 操作日志天然产生,反馈成本相对较低 真实数据采集昂贵,且受本体、环境和任务差异影响
评测环境 可以用测试集、沙箱、历史任务和数字孪生反复运行 必须面对真实摩擦、遮挡、磨损、时延和环境长尾
安全与权限 重点是数据、账户、合规、越权与错误执行 还要处理碰撞、力、稳定性、故障与人身安全
部署与运维 版本可以集中更新,问题能够快速回滚 涉及硬件版本、备件、充电、维修、现场支持与寿命
单位经济 主要受推理、软件服务和人工复核成本影响 还要承担 BOM、制造、渠道、库存、售后与现场服务

这张表并不意味着 Agent 一定简单,机器人一定缓慢。

金融、医疗、企业核心系统里的 Agent 同样可能面临很高的错误成本;扫地机这类高度收敛的机器人产品也已经实现大规模商业化。但不能用一条路线的速度和成功标准直接推断另一条路线。

四、Agent 向左:竞争会落到任务交付

当基础模型逐渐成为可替换的公共能力,Agent 产品的差异不会只来自“模型更聪明”,而会越来越多地来自它是否真的接入了一套任务系统。

一套可用的 Agent,至少要解决五件事。

1. 它是否理解任务,而不只是理解一句提示词

“生成一份报告”不是完整任务。还要说明报告给谁看、支持什么决定、使用哪些材料、哪些信息不能使用、什么结果算完成,以及失败后如何处理。

更长的 Prompt 解决不了这些问题。Agent 需要一份清楚的结果契约。

2. 它能访问什么,又不能访问什么

工具越多不等于能力越强。Agent 一旦接入邮件、代码库、支付、客户数据和内部系统,权限边界就会成为产品的一部分。

低风险操作可以自动执行,高风险操作需要确认;只读、建议、起草、提交和正式执行,应当是不同权限等级。

3. 过程是否留下可检查的状态变化

一个可靠的 Agent 不应只给出最终答案,还应该让用户知道:它读取了什么、依据什么做出判断、改变了哪些对象、哪些步骤失败、哪里需要人工介入。

这也是为什么当前的 Agent 开发框架开始强调工具、Guardrails、Tracing 和可观测性。产品需要管理的是整条任务执行链,而非一段对话。

4. 错误能否被发现、回滚和补偿

Agent 的优势不只是自动化,还包括数字世界可建立版本、Diff、日志、沙箱和审批机制。产品应主动利用这些特性,而不是让模型直接操作所有系统。

5. 人在什么时候接管

Human-in-the-loop 不应是一句模糊的安全口号。产品必须明确:什么置信度继续执行,什么动作必须确认,出现什么异常立即停止,用户如何快速理解现场并接管。

因此,Agent 的长期竞争更像“任务交付系统”的竞争:谁拥有更完整的上下文、更合理的工具与权限、更清晰的结果契约,以及更低成本的异常处理。

五、具身向右:竞争发生在持续可靠的物理闭环

具身智能当然也需要更好的模型,但模型能力必须进入一条更长、约束更多的系统链路。

一个机器人完成任务,至少要连续处理:

感知环境 → 判断状态 → 理解意图 → 规划动作 → 控制执行 → 检查结果 → 处理异常。

任何一环不稳定,最终任务都可能失败。

机器人面对的是一个持续变化的世界,远比一张静态图片复杂。物体会滑动,人会突然进入,光照会改变,地面有摩擦差异,传感器会被遮挡,执行器会发热,电量会下降,零件会磨损。

这也是为什么机器人安全天然需要分层。高层模型可以理解任务和语义风险,但底层仍需要碰撞避免、接触力限制、动态稳定和针对具体本体的安全控制。Google DeepMind 在 Gemini Robotics 的公开说明中也明确把低层安全控制与高层语义理解分开处理。

对于具身产品,一次 Demo 成功远远不够。更有意义的指标包括:

  • 在明确环境里,连续多少次可以完成任务;
  • 遇到哪些变化会失败,失败是否可恢复;
  • 多久需要人工介入一次;
  • 一次任务的时间、能耗和服务成本是多少;
  • 设备在数周、数月使用后是否仍保持可靠;
  • 出现故障时,用户和服务团队能否快速定位与修复。

因此,具身智能早期更适合从边界清楚的窄任务长出来:环境相对清晰、任务重复、价值足够高、失败可以被安全处理。先把一个物理任务稳定做成,再逐步扩大环境和任务边界,通常比一开始追求“通用机器人”更接近产品现实。

六、商业化速度不能互相套用

Agent 产品可以通过软件快速分发。一次能力更新,可以同时服务大量用户;新工具能够通过 API 接入;任务数据也会在使用中持续产生。

机器人每扩大一份收入,往往需要多生产、交付和维护一台设备。规模增长会同时带来制造、供应链、现场部署、维修和客服压力。即使模型可以在线升级,身体仍然受到既有传感器、算力、结构和执行器的限制。

两类产品的验证顺序也不同:

  • Agent 更容易先验证“有没有人愿意把任务交给它”;
  • 机器人必须同时验证“任务有价值、系统做得到、长期交付得起”;
  • Agent 的早期瓶颈常是信任、接入与组织采用;
  • 机器人的早期瓶颈还包括可靠性、成本、生产与服务。

所以,不能因为 Agent 在几个月内进入大量工作流,就推断通用机器人会以相同速度进入家庭和企业;也不能因为机器人商业化更慢,就认为它的长期价值更低。

它们只是受到不同的约束。

七、两条路会合流,但不会重新变成一条路

未来很多完整任务会同时包含信息行动和物理行动。

例如,一套现场巡检系统中,Agent 可以读取工单、理解设备历史、规划任务、调度机器人、整理异常证据并生成报告;机器人负责移动、观察、测量和现场操作。

两者能否协作,取决于一份清楚的任务协议:

  • 目标是什么;
  • 允许采取哪些信息与物理动作;
  • 成功、失败和异常分别如何定义;
  • 哪些条件必须停止;
  • 什么时候请求人工接管;
  • 最终需要留下什么证据。

Agent 与机器人会协作,但仍由两套不同的工程、产品和运营系统支撑。前者负责理解、协调和管理信息状态;后者负责安全、可靠地改变物理状态。

八、这一区分如何改变产品判断

判断一个 Agent 产品,可以先问:

  1. 它替用户完成的是哪一段真实工作,而不是生成什么内容?
  2. 它需要接入哪些数据、工具和权限?
  3. 什么结果算完成,如何评测?
  4. 哪些动作可以回滚,哪些必须审批?
  5. 人工介入发生在哪里,成本是多少?

判断一个具身产品,则应继续问:

  1. 它在什么环境、面对什么对象、完成什么高频任务?
  2. 当前本体和模型能否形成持续闭环,而不只是完成一次演示?
  3. 最危险、最常见和最昂贵的失败分别是什么?
  4. 设备如何充电、维护、恢复和升级?
  5. 把制造、部署和服务算进去后,单位经济是否成立?

如果不先区分信息行动与物理行动,我们很容易高估模型能力的迁移速度,也容易低估产品仍需补齐的系统能力。

结语:两条路,两套产品规律

Agent 与具身智能共享模型、自然语言、多模态和规划能力,也会在越来越多任务中彼此连接。

但它们不会收敛成同一种产品。

Agent 向左,进入更深的信息上下文、工具权限与组织工作流;具身向右,进入更复杂的物理环境、可靠性、安全与交付系统。

一条路的核心问题是:AI 能否可信地替人改变信息状态。

另一条路的核心问题是:AI 能否安全、持续、经济地改变现实世界。

这两条路都很重要。判断它们时,应该先看各自能否持续交付任务,而不是把每一次模型进步都装进同一个“AI 下一站”的故事。


延伸资料