每个 Agent 用量数字,都是自报的
对六个真实声称的一次现场审计,以及它对 Agent 经济意味着什么
现场审计于 2026-08-16 完成,是 AgentMeasure Benchmark Run #001 的一部分。所有声称均真实、可溯源、可重放。
实验
“Agent 用量”正在成为 2026 年的社会证明——徽章、对比、计量和支付的依据。所以我们去找真实的公开用量声称,对每一个只问一个问题:这个数字能验证吗?
六个声称,六个来源,一个下午的阅读:
| 声称 | 来源 | 分级 |
|---|---|---|
| “x402 结算第 1.62 亿笔支付;平均客单价 $0.25” | X 帖子,2026-08-13 | E1 |
| “Base 上 x402 30 天内有 4.8 万活跃商家” | X 帖子,2026-08-16 | E1 |
| “约 39,000 个 llms.txt 文件;97% 收到零 AI 请求” | 第三方审计 | E3 |
| “ClaudeBot 冒充行为本季度增长 400%” | 安全厂商帖子 | E0/E1 |
| MCP server 评分徽章 | 注册表(glama.ai) | E2/E3 |
| “42 次调用,126 条观察,0 拒绝” | 我们自己的报告(合成流量) | E2 |
证据阶梯(E0–E5):无证据 → 自报聚合 → 披露方法 → 第三方验证 → 独立观察 → 交叉验证观察。
发现
1. 每个数字都是自报的。 声称之间的差别不是诚实度,而是可重放性。两个 x402 数字可能真实、但无法验证——没有披露计数方法,没有公开原始数据。冒充统计无法验证,且关键术语未定义。
2. 最强的声称来自唯一的独立观察者。 llms.txt 审计(E3)打败了所有数据完美的平台。独立性胜过体量。
3. 徽章是薄弱环节。 注册表徽章继承了其来源的验证语义。一个没有披露方法的徽章,是穿着高分级外衣的低分级。
4. 没人发布单位定义。 六个声称没有一个说明”一笔支付”“一个商家”“一次 AI 请求”“一次冒充”到底指什么。这是最关键的缺口:你无法审计你无法定义的东西。
为什么现在重要
支付轨道正在建在这些数字之上。当 x402 以每笔 $0.25 结算 1.62 亿笔时,一个错误定义的单位就是财务完整性问题,而不是分析问题。Agent 经济即将让真金白银流过没人能验证的测量。
标准的工作
这就是 AgentMeasure 存在的原因:让 E3(独立重放)变得便宜,而不是对 E1 说教。具体来说:
- 单位定义必须随每个公开指标发布。 什么算尝试、操作、交付、被消费的结果——写清楚,而不是暗示。
- 观察发生在 callee 侧。 调用者不能自报自己的用量;这是测量与新闻稿的区别。
- unknown 是默认值。 每条观察从不合格开始,只有证据才能升级它。CI、基准测试和健康检查不能再悄悄污染公开数字。
完整评分表与来源在 Benchmark Run #001。如果你发布用量数字,告诉我们它是怎么分级的。如果你有我们该审计的声称,发过来——下一轮审计已经排期。