Agent 系统与能力计量
Agent 真正使用软件时,应该记录哪些动作、结果和价值?
阶段判断
目前能确认什么
一次调用、一次任务、一次结果被使用和一次业务收益属于不同分母。运行时还要同时记录上下文、状态与权限,才能解释任务为什么成功或失败。
- 工具调用成功只能证明动作发生,不能自动证明结果被采用或产生价值。
- 能力发现与执行权限必须分开记录,避免把可见能力误当作可用能力。
现有材料
AgentMeasure 白皮书全文,以及上下文、软件能力、计量和研究工作流四份笔记。
待补证据
真实任务基准、跨产品事件对照,以及规范字段与当前实现版本的持续校准。
档案内容
资料路径
报告与数据负责保存材料,工作笔记负责记录阶段分析。
主要资料
-
研究报告网页查看
如何度量 AI Agent 对软件的使用
AgentMeasure 计量白皮书,解释发现、选择、使用、结果与价值的区分,以及计量口径的设计假设。
工作笔记
-
研究笔记网页查看
Agent 运行时:上下文、状态与权限
把 Context Recommendation 收敛为可实现的职责:这一步需要什么信息、能做什么,以及如何恢复。
-
研究笔记网页查看
软件重构与能力经济
界面、可调用能力、交付资产和经济价值是四个不同对象;分别判断谁掌握了什么。
-
研究笔记网页查看
Agent 计量:执行事实、任务结果与价值
明确分母和证据边界,避免把重试、调用成功、被使用和业务收益混成一个数字。
-
研究笔记网页查看
把研究工作流接到可检查的产物上
用 iRead 发现变化,用 SURE 组织证据,用知识页维护判断;工具与研究结论各自负责。
文章
相关表达
文章围绕一个观点组织叙述。这里标的是同题关系;正文中的具体引用才代表直接证据关系。