← 返回文章

WAIC 之后:AI 产业开始为“把事做成”买单

从 Coding、Agent、RSI 到具身智能,2026 年的竞争单位正在从模型变成系统

过去半年,我用 iRead 持续跟踪 AI 应用、具身智能和 AI 硬件。到 7 月 21 日,本地资料库里已经积累了 23,930 篇文章,来自 112 个信源。WAIC 四天里,与大会直接相关的文章就有 166 篇。

这些材料反复指向同一个变化:产业判断一款 AI 产品的方式正在改变。

模型跑分、机器人动作和硬件参数依然重要,但客户已经开始追问更多:长期运行的表现如何,失败时谁来接管,一次成功任务究竟要花多少钱?

WAIC 2026 也反映了这个变化。行业还没有进入规模化收获期,却开始认真为“把事做成”买单。

WAIC 改变的是评价尺度

今年的展商结构很能说明问题。

甲子光年的大会资料统计,WAIC 2026 有 1100 余家中外企业和 4000 余款展品。机器人与智能硬件相关企业有 242 家,算力、芯片与基础设施企业有 206 家。在大模型与生成式 AI 参展主体中,83 家把 Agent 或智能应用作为主要标签,基础大模型只有 18 家。

基础模型仍然重要。它正在变成整个产业的生产资料。企业接入一个强模型后,还要处理数据、权限、流程、评测、成本和组织改造,模型能力才能变成结果。

WAIC 上能看到三种很具体的变化:

  • 芯片公司开始讨论有效 Token 的产量、能效和系统稳定性;
  • Agent 公司不再满足于回答问题,开始对任务结果负责;
  • 机器人和 AI 硬件离开聊天框,必须面对空间、功耗、安全与真实用户。

我更愿意把 2026 年看作系统交付开始受检验的一年。竞争单位正在从单个模型、单颗芯片和单台机器人,变成一套能够稳定完成任务的系统。

Coding 为什么站在这轮变化的最前面

Coding 是目前最接近“任务经济”的 AI 应用。原因很朴素:代码能编译,测试能运行,需求有没有完成可以被机器和人共同验证。

有了可验证的反馈,Agent 才能连续工作更长时间。它可以读代码、修改文件、运行测试、观察错误,再继续修正。设计、文档和视频创作当然也能用 AI,但“作品是否可交付”往往依赖人的审美和业务判断,反馈远没有代码清楚。

晚点聊 LateTalk 的 2026 年 Q2 季报解释了 Coding 的另一层意义:它既是眼下最明确的收入入口,也可能成为下一代 AI 的研发基础设施。

当长程 Agent 能够读论文、提出假设、写代码、跑实验并分析结果,Coding 除了帮助程序员提高效率,也开始进入 Auto Research。它甚至在尝试改进模型训练本身。

这条路径常被概括为:

Coding + 长程 Agent → Auto Research → Recursive Self-Improvement

RSI,也就是递归自我改进,是一个很容易被提前宣布成功的概念。当前公开证据更接近研究流程自动化和局部自我改进:AI 可以优化代码、实验工具、训练配方或 GPU Kernel,人仍在选择研究方向、判断结论是否新颖,并处理评测没有覆盖的失败。

刷高一个 Benchmark 只能证明一次局部优化。更能说明问题的是,同一套系统能否在不同任务上持续变强。到那一步,领先公司的优势才可能从“领先一个身位”变成“拥有更快的加速度”。

今天还没有足够证据证明通用 RSI 已经出现。但 Coding 正在让 AI 参与制造下一代 AI,这件事已经值得长期跟踪。

Agent 的难题已经进入组织内部

个人使用 Agent 时,失败一次通常只是多花几分钟。企业把 Agent 放进采购、财务、客服或研发流程后,错误可能意味着泄露数据、越权操作、错误付款或生产中断。

企业 Agent 因此需要三类上下文:公共知识、企业私有知识和组织运行规则。传统知识库只覆盖其中一部分。信息时效、访问权限、审批关系,以及任务失败后的中止与回滚,才是进入核心流程后的麻烦。

一批过去不太显眼的能力开始变得重要:

  • Context:把分散的文档、业务对象和隐性经验整理成可调用的信息;
  • Runtime:为长时间任务提供沙箱、浏览器、工具和资源调度;
  • Evals:上线后持续检查结果质量;
  • Governance:控制权限、预算、审计与人工接管。

WAIC 上,PPIO 披露 Agent 沙箱上线一年后业务规模增长 123 倍。这个数字来自公司口径,仍需要客户侧验证;访谈中提出的评估方式更完整:不要只看一次模型调用有多便宜,要把上下文、工具调用、失败重试和人工检查全部算进一次成功任务。

这也解释了为什么推理单价下降后,算力需求未必下降。Agent 会增加调用轮次和上下文长度。一枚 Token 变便宜了,一个任务消耗的 Token 却可能更多。

接下来,Agent 产品应优先看交付率、人工修改量、接管率和单位成功任务成本,而不是生成次数。

机器人开始谈“工作”,但还没有证明规模经济

WAIC 过去最容易传播的机器人内容,是跳舞、奔跑和翻跟头。今年的展台里,药房、仓储、汽车线束、光模块检测、零售货架和洗衣房明显多了起来。

AI 科技评论走访 100 多个机器人展台后,把变化概括为“应用展示取代功能表演”。几家公司的展示也开始接近生产问题:

  • 银河通用把单次任务延长到 3 至 5 分钟;
  • 它石智航展示柔性线束的精细插接;
  • 乐聚披露标准工业场景可以在两周内落地;
  • 极智嘉让人形机器人与原有仓储系统协同;
  • 苏度用目标移动、视觉干扰和题库外任务测试在线反应。

这些演示比单纯表演有价值,但展台落地和工厂落地仍然是两回事。

虎嗅记录的一次泡茶演示花了约六分半,期间出现抓取失败、反复对齐、运行中后仰,还需要工程师协助。它没有说明机器人“做不到”,却清楚地展示了 Demo 与产品之间的距离。

机器人公司接下来应该公开另一套指标:付费部署数、连续运行小时、平均无故障时间、人工接管率、节拍、部署人数、维护成本和客户扩点。

一套系统成功 99 次、失败 1 次,听上去已经很好。但如果它每天要完成数万次动作,剩下的 1% 依然会变成大量异常。单次成功率离生产可用还有连续运行和失败恢复两道门。

具身智能需要什么样的数据

今年的具身论坛反复讨论数据。真机数据最直接,但慢且昂贵;人类第一视角数据更容易扩大规模,却需要解决人与机器人动作空间的差异;互联网视频数量巨大,缺少力、触觉和失败标签;仿真数据便宜可控,又绕不开 Sim-to-Real。

我不认为某一种数据会单独胜出。我更看好能把真机、人类示范、仿真和线上失败统一进训练与评测的公司:它们记录机器人为什么失败、如何恢复,以及下一版是否真的因此变好。

这和数字世界里的 Auto Research 有相似结构:执行任务,获得反馈,形成新数据,再更新系统。区别是,代码世界可以快速回滚,物理世界的失败会损坏设备、影响生产,甚至伤害人。

机器人可能成为 RSI 的另一类载体,但自主试错必须受到安全边界、仿真、真机评测和人工接管的约束。否则,所谓数据飞轮只是在更快地制造事故。

理查德·萨顿在 WAIC 谈“经验时代”时,把这一点说得很清楚:仅仅学习人类已有知识还不够,持续学习的智能需要通过行动、观察和奖励获得第一视角经验。与此同时,他也提醒听众,今天的 AI 仍然不可靠,会产生幻觉。这份演讲整理值得和热闹的机器人演示放在一起看。

AI 硬件争夺的是行动权

AI 手机、眼镜、耳机、戒指和陪伴硬件都在争夺持续感知入口。设备离用户越近,获得的上下文越连续,能够完成的任务也越多。

但一个系统可以读取相册、消息和位置,可以调用地图、订单和支付,意味着它也拥有了犯大错的权限。

AI 硬件需要先获得用户的长期授权,模型能力才有机会转化成产品价值。低风险任务可以自动完成,高风险操作应该交还用户确认;敏感数据尽量本地处理,复杂推理再进入云端;每一次关键操作还要能够审计和有限回滚。

阶跃在 WAIC 展示的 Agentic OS采用了类似思路。它还没有证明大规模量产和长期留存,但已经提出跨 App 操作之外的信任问题:操作能力需要建立在用户授权之上。

这场竞争也会重新分配服务入口。如果系统 Agent 只能打开 App,选择权仍在超级 App 手里;如果它可以替用户筛选、下单和支付,手机系统和模型公司就会重新获得分发权。AI 硬件能否成立,可能取决于模型、系统、供应链、渠道和服务生态能不能被组织成一件完整产品。

“强者愈强”只在一些条件下成立

领先模型公司确实拥有一套复利结构:更强的模型带来更多用户,更多使用产生更多失败样本和偏好数据,收入支持算力和人才,研发工具又帮助开发下一代模型。

Coding 是这套结构里很特殊的一环,因为它既产生收入,也提高研发效率。

但过去三年的模型竞争一直在交替领先。人才会流动,研究路线会变化,开源模型也在用成本和可控性进入企业。垂直公司如果掌握专用数据、领域评测和客户流程,仍然有机会在局部建立更强的系统。

产品能力也不会由模型分数自动生成。企业销售、权限治理、硬件量产、售后服务和客户关系,都需要另一套长期积累。

因此,我对“强者愈强”的判断是:收入、分发和研发效率会先集中,技术领先未必永久集中。只有当某家公司率先实现可迁移、可持续的 RSI,现有平衡才可能被真正打破。

未来半年,我会盯着这些数字

行业里不缺新概念,缺的是能跨季度比较的指标。未来 3 至 6 个月,我最关注下面几组数字:

AI 应用与 Agent

  • 一次成功任务的总成本;
  • 结果直接进入生产的比例;
  • 人工接管发生在哪一步,是否随使用下降;
  • 续费和付费用户的实际使用深度。

具身智能

  • 连续数百小时运行后的成功率;
  • 抓空、遮挡、目标移动后能否自主恢复;
  • 一个新工位需要多少数据、工程师和调试时间;
  • 客户是否从单台试点扩展到多台、多工位。

AI 硬件

  • 30 天和 90 天留存;
  • 每台设备每月的云端推理成本;
  • 高风险操作的确认率、误操作和隐私事件;
  • 续航、发热、退货率和量产良率。

Auto Research 与 RSI

  • 研究方向、实验设计和最终判断还需要多少人工;
  • 同一系统能否在不同任务上重复产生改进;
  • 结果能否被独立团队复现;
  • 能力提升后是否重新完成安全回归测试。

这些指标可能没有发布会视频好看,却更接近产业进步。

2026:交付开始受检验,收获尚早

今年以来,我的资料库里,标题明确讨论 Agent 的文章占比从 1 月约 3.5% 上升到 6 月约 6.8%;具身智能与机器人长期保持在约 12% 至 14%;融资、估值和 IPO 讨论在 5 月、6 月明显升温。

这些数字只能反映注意力,不能代替收入和客户复购。资本热度已经跑在商业成熟度前面,大量产品仍停留在展会、试点和小批量部署阶段,公开指标也主要来自公司自己。

WAIC 2026 让行业开始用更严格的方式谈产品:Agent 要承担结果,机器人要接受节拍和稳定性检验,AI 硬件要处理权限与信任,算力要计算有效 Token 和单位任务成本。

接下来,能够留下来的公司会持续记录失败,把失败变成数据,再把数据变成更稳定、更便宜的交付。

AI 会什么,仍然重要。接下来更值得跟踪的是,哪些系统能长期、稳定地把事情做好。


关于这篇研究

本文基于 iRead 截至 2026 年 7 月 21 日采集的 23,930 篇文章、112 个信源,以及 WAIC 期间 166 篇专项材料整理,并整合了晚点聊 LateTalk《AI 季报 26Q2》的访谈观点。

文中涉及公司成功率、客户数、融资、性能和部署规模的数据,若无特别说明,均来自公司、媒体报道或访谈嘉宾,不能视为独立审计结果,也不构成投资建议。

延伸阅读:

  1. 甲子光年:WAIC 2026 大洗牌
  2. AI 科技评论:走访 100+ 机器人展台
  3. 具身智能之心:数据、模型与具身智能的分歧
  4. 硅星人 Pro:AI 手机的真问题是信任
  5. 晚点聊 LateTalk:AI 季报 26Q2,从 Coding 到 RSI