← 返回文章

每个 Agent 用量数字,都是自报的

对六个真实声称的一次现场审计,以及它对 Agent 经济意味着什么

现场审计于 2026-08-16 完成,是 AgentMeasure Benchmark Run #001 的一部分。所有声称均真实、可溯源、可重放。

实验

“Agent 用量”正在成为 2026 年的社会证明——徽章、对比、计量和支付的依据。所以我们去找真实的公开用量声称,对每一个只问一个问题:这个数字能验证吗?

六个声称,六个来源,一个下午的阅读:

声称 来源 分级
“x402 结算第 1.62 亿笔支付;平均客单价 $0.25” X 帖子,2026-08-13 E1
“Base 上 x402 30 天内有 4.8 万活跃商家” X 帖子,2026-08-16 E1
“约 39,000 个 llms.txt 文件;97% 收到零 AI 请求” 第三方审计 E3
“ClaudeBot 冒充行为本季度增长 400%” 安全厂商帖子 E0/E1
MCP server 评分徽章 注册表(glama.ai) E2/E3
“42 次调用,126 条观察,0 拒绝” 我们自己的报告(合成流量) E2

证据阶梯(E0–E5):无证据 → 自报聚合 → 披露方法 → 第三方验证 → 独立观察 → 交叉验证观察。

发现

1. 每个数字都是自报的。 声称之间的差别不是诚实度,而是可重放性。两个 x402 数字可能真实、但无法验证——没有披露计数方法,没有公开原始数据。冒充统计无法验证,且关键术语未定义。

2. 最强的声称来自唯一的独立观察者。 llms.txt 审计(E3)打败了所有数据完美的平台。独立性胜过体量。

3. 徽章是薄弱环节。 注册表徽章继承了其来源的验证语义。一个没有披露方法的徽章,是穿着高分级外衣的低分级。

4. 没人发布单位定义。 六个声称没有一个说明”一笔支付”“一个商家”“一次 AI 请求”“一次冒充”到底指什么。这是最关键的缺口:你无法审计你无法定义的东西。

为什么现在重要

支付轨道正在建在这些数字之上。当 x402 以每笔 $0.25 结算 1.62 亿笔时,一个错误定义的单位就是财务完整性问题,而不是分析问题。Agent 经济即将让真金白银流过没人能验证的测量。

标准的工作

这就是 AgentMeasure 存在的原因:让 E3(独立重放)变得便宜,而不是对 E1 说教。具体来说:

  • 单位定义必须随每个公开指标发布。 什么算尝试、操作、交付、被消费的结果——写清楚,而不是暗示。
  • 观察发生在 callee 侧。 调用者不能自报自己的用量;这是测量与新闻稿的区别。
  • unknown 是默认值。 每条观察从不合格开始,只有证据才能升级它。CI、基准测试和健康检查不能再悄悄污染公开数字。

完整评分表与来源在 Benchmark Run #001。如果你发布用量数字,告诉我们它是怎么分级的。如果你有我们该审计的声称,发过来——下一轮审计已经排期。