Agent 向左,具身向右:AI 在信息空间与物理世界的分岔
它们共享模型与规划能力,却分别受数字世界的可逆性和物理世界的不可逆后果约束。
把 AI Agent 和具身智能放进同一个故事,很自然。模型越来越强,AI 开始理解环境、规划步骤、调用工具,也开始替人完成任务。
故事讲到这里,往往会再往前推一步:具身智能是 Agent 的下一站,机器人就是给 Agent 装上一副身体。 这个推论忽略了两类系统行动后果的差异。
两者都在从“生成内容”走向“采取行动”,但它们行动的对象不同:
Agent 主要改变信息世界的状态;具身系统直接改变物理世界的状态。
改变的状态不同,错误能否撤销、系统如何评测、安全责任如何划分、产品怎样部署、公司如何规模化,也会随之分岔。
这一区分,决定了两套不同的产品与产业逻辑。
一、它们为什么看起来像同一股浪潮
Agent 与具身智能确实拥有一段相似的过去。
在信息世界,自动化先从脚本和固定规则开始。RPA 按预先配置的步骤点击界面,传统软件按照明确流程处理输入。模型能力提升之后,Copilot 开始参与局部工作;再往前一步,Agent 可以理解目标、选择工具、执行多步操作,并根据结果继续调整。
在物理世界,自动化也曾主要依赖固定程序和结构化环境。工业机器人在确定的位置、节拍和安全边界内重复动作;后来,视觉感知、学习控制和策略模型逐步提高了系统处理变化的能力。RT-2 把视觉、语言与机器人动作放进同一模型,Open X-Embodiment 则尝试通过跨机器人数据提高策略的迁移能力。Google DeepMind 后续发布的 Gemini Robotics,也把泛化、交互和灵巧操作列为机器人模型的关键能力。
两条路线的共同变化是:
- 环境不再需要被完全预定义;
- 系统开始理解自然语言和多模态上下文;
- 系统不只给出建议,还会选择并执行动作;
- 动作之后会读取反馈,再决定下一步。
因此,从模型能力看,它们确实越来越相似。Agent 调用 API,机器人调用运动控制器;Agent 读取网页和数据库,机器人读取摄像头、深度信息和关节状态;两者都需要规划、记忆、工具和反馈。
但共同的模型能力,不等于共同的产品规律。
二、分岔点:AI 到底改变了什么
Agent 处理的通常是文件、代码、消息、日程、数据库、账户和业务流程。它执行一次操作,改变的是某个数字系统里的状态。
具身系统处理的是位置、姿态、物体、空间、能量和人与设备之间的安全关系。它执行一次操作,改变的是现实世界中的状态。
这一区别最先体现在错误上。
一封邮件发错了,可能还能补充说明;一段代码写错了,可以回滚;数据库被错误修改,可能通过日志和备份恢复。数字世界当然也存在不可逆操作——例如转账、公开发布和数据删除——但软件通常能够通过权限、沙箱、版本、日志和人工审批,把高风险动作单独隔离出来。
物理世界的错误更难被抽象掉。机械臂碰坏一个物体,损失已经发生;移动机器人撞到人,不能靠“重试”恢复;设备因为电量不足停在危险位置,问题不只是任务失败,还可能引入新的风险。
两条路线的分岔发生在这里:系统是否直接承担现实世界中的不可逆后果。
这也解释了为什么一个在 Benchmark 上表现很好的模型,并不自动等于一个可以持续交付的机器人产品。模型只是物理闭环中的一层,传感器、状态估计、控制、结构、执行器、能耗、安全、维护与异常恢复必须同时成立。
三、两条路线会沿八个维度越走越远
| 维度 | AI Agent | 具身智能 / 机器人 |
|---|---|---|
| 主要操作对象 | 文件、消息、代码、账户、数据库与业务状态 | 位置、物体、空间、能量与人的安全边界 |
| 错误可逆性 | 多数操作可回滚、重试、补偿或转人工 | 物理后果可能即时发生,部分错误不可逆 |
| 复制与扩张 | 软件可快速分发,同一套能力服务大量用户 | 每增加一个执行单元,都要生产、部署和维护实体设备 |
| 数据闭环 | 操作日志天然产生,反馈成本相对较低 | 真实数据采集昂贵,且受本体、环境和任务差异影响 |
| 评测环境 | 可以用测试集、沙箱、历史任务和数字孪生反复运行 | 必须面对真实摩擦、遮挡、磨损、时延和环境长尾 |
| 安全与权限 | 重点是数据、账户、合规、越权与错误执行 | 还要处理碰撞、力、稳定性、故障与人身安全 |
| 部署与运维 | 版本可以集中更新,问题能够快速回滚 | 涉及硬件版本、备件、充电、维修、现场支持与寿命 |
| 单位经济 | 主要受推理、软件服务和人工复核成本影响 | 还要承担 BOM、制造、渠道、库存、售后与现场服务 |
这张表并不意味着 Agent 一定简单,机器人一定缓慢。
金融、医疗、企业核心系统里的 Agent 同样可能面临很高的错误成本;扫地机这类高度收敛的机器人产品也已经实现大规模商业化。但不能用一条路线的速度和成功标准直接推断另一条路线。
四、Agent 向左:竞争会落到任务交付
当基础模型逐渐成为可替换的公共能力,Agent 产品的差异不会只来自“模型更聪明”,而会越来越多地来自它是否真的接入了一套任务系统。
一套可用的 Agent,至少要解决五件事。
1. 它是否理解任务,而不只是理解一句提示词
“生成一份报告”不是完整任务。还要说明报告给谁看、支持什么决定、使用哪些材料、哪些信息不能使用、什么结果算完成,以及失败后如何处理。
更长的 Prompt 解决不了这些问题。Agent 需要一份清楚的结果契约。
2. 它能访问什么,又不能访问什么
工具越多不等于能力越强。Agent 一旦接入邮件、代码库、支付、客户数据和内部系统,权限边界就会成为产品的一部分。
低风险操作可以自动执行,高风险操作需要确认;只读、建议、起草、提交和正式执行,应当是不同权限等级。
3. 过程是否留下可检查的状态变化
一个可靠的 Agent 不应只给出最终答案,还应该让用户知道:它读取了什么、依据什么做出判断、改变了哪些对象、哪些步骤失败、哪里需要人工介入。
这也是为什么当前的 Agent 开发框架开始强调工具、Guardrails、Tracing 和可观测性。产品需要管理的是整条任务执行链,而非一段对话。
4. 错误能否被发现、回滚和补偿
Agent 的优势不只是自动化,还包括数字世界可建立版本、Diff、日志、沙箱和审批机制。产品应主动利用这些特性,而不是让模型直接操作所有系统。
5. 人在什么时候接管
Human-in-the-loop 不应是一句模糊的安全口号。产品必须明确:什么置信度继续执行,什么动作必须确认,出现什么异常立即停止,用户如何快速理解现场并接管。
因此,Agent 的长期竞争更像“任务交付系统”的竞争:谁拥有更完整的上下文、更合理的工具与权限、更清晰的结果契约,以及更低成本的异常处理。
五、具身向右:竞争发生在持续可靠的物理闭环
具身智能当然也需要更好的模型,但模型能力必须进入一条更长、约束更多的系统链路。
一个机器人完成任务,至少要连续处理:
感知环境 → 判断状态 → 理解意图 → 规划动作 → 控制执行 → 检查结果 → 处理异常。
任何一环不稳定,最终任务都可能失败。
机器人面对的是一个持续变化的世界,远比一张静态图片复杂。物体会滑动,人会突然进入,光照会改变,地面有摩擦差异,传感器会被遮挡,执行器会发热,电量会下降,零件会磨损。
这也是为什么机器人安全天然需要分层。高层模型可以理解任务和语义风险,但底层仍需要碰撞避免、接触力限制、动态稳定和针对具体本体的安全控制。Google DeepMind 在 Gemini Robotics 的公开说明中也明确把低层安全控制与高层语义理解分开处理。
对于具身产品,一次 Demo 成功远远不够。更有意义的指标包括:
- 在明确环境里,连续多少次可以完成任务;
- 遇到哪些变化会失败,失败是否可恢复;
- 多久需要人工介入一次;
- 一次任务的时间、能耗和服务成本是多少;
- 设备在数周、数月使用后是否仍保持可靠;
- 出现故障时,用户和服务团队能否快速定位与修复。
因此,具身智能早期更适合从边界清楚的窄任务长出来:环境相对清晰、任务重复、价值足够高、失败可以被安全处理。先把一个物理任务稳定做成,再逐步扩大环境和任务边界,通常比一开始追求“通用机器人”更接近产品现实。
六、商业化速度不能互相套用
Agent 产品可以通过软件快速分发。一次能力更新,可以同时服务大量用户;新工具能够通过 API 接入;任务数据也会在使用中持续产生。
机器人每扩大一份收入,往往需要多生产、交付和维护一台设备。规模增长会同时带来制造、供应链、现场部署、维修和客服压力。即使模型可以在线升级,身体仍然受到既有传感器、算力、结构和执行器的限制。
两类产品的验证顺序也不同:
- Agent 更容易先验证“有没有人愿意把任务交给它”;
- 机器人必须同时验证“任务有价值、系统做得到、长期交付得起”;
- Agent 的早期瓶颈常是信任、接入与组织采用;
- 机器人的早期瓶颈还包括可靠性、成本、生产与服务。
所以,不能因为 Agent 在几个月内进入大量工作流,就推断通用机器人会以相同速度进入家庭和企业;也不能因为机器人商业化更慢,就认为它的长期价值更低。
它们只是受到不同的约束。
七、两条路会合流,但不会重新变成一条路
未来很多完整任务会同时包含信息行动和物理行动。
例如,一套现场巡检系统中,Agent 可以读取工单、理解设备历史、规划任务、调度机器人、整理异常证据并生成报告;机器人负责移动、观察、测量和现场操作。
两者能否协作,取决于一份清楚的任务协议:
- 目标是什么;
- 允许采取哪些信息与物理动作;
- 成功、失败和异常分别如何定义;
- 哪些条件必须停止;
- 什么时候请求人工接管;
- 最终需要留下什么证据。
Agent 与机器人会协作,但仍由两套不同的工程、产品和运营系统支撑。前者负责理解、协调和管理信息状态;后者负责安全、可靠地改变物理状态。
八、这一区分如何改变产品判断
判断一个 Agent 产品,可以先问:
- 它替用户完成的是哪一段真实工作,而不是生成什么内容?
- 它需要接入哪些数据、工具和权限?
- 什么结果算完成,如何评测?
- 哪些动作可以回滚,哪些必须审批?
- 人工介入发生在哪里,成本是多少?
判断一个具身产品,则应继续问:
- 它在什么环境、面对什么对象、完成什么高频任务?
- 当前本体和模型能否形成持续闭环,而不只是完成一次演示?
- 最危险、最常见和最昂贵的失败分别是什么?
- 设备如何充电、维护、恢复和升级?
- 把制造、部署和服务算进去后,单位经济是否成立?
如果不先区分信息行动与物理行动,我们很容易高估模型能力的迁移速度,也容易低估产品仍需补齐的系统能力。
结语:两条路,两套产品规律
Agent 与具身智能共享模型、自然语言、多模态和规划能力,也会在越来越多任务中彼此连接。
但它们不会收敛成同一种产品。
Agent 向左,进入更深的信息上下文、工具权限与组织工作流;具身向右,进入更复杂的物理环境、可靠性、安全与交付系统。
一条路的核心问题是:AI 能否可信地替人改变信息状态。
另一条路的核心问题是:AI 能否安全、持续、经济地改变现实世界。
这两条路都很重要。判断它们时,应该先看各自能否持续交付任务,而不是把每一次模型进步都装进同一个“AI 下一站”的故事。