KNOWLEDGE NOTE · 持续修订
灵巧操作:手、触觉与数据如何互相约束
以目标任务和可观测的接触过程评价灵巧手,避免自由度、数据小时数与平台价值之间的跳跃。
灵巧操作同时面对物体形状、接触、摩擦、形变和控制误差。一只手能摆出很多姿态,不等于它能稳定操作目标物体;一批视频看起来丰富,也不等于提供了训练所需的动作信息。
我的研究重点是硬件、感知、数据与任务之间的适配。特定公司的非公开路线和参数不进入这个公共框架。
先定义任务空间,再讨论自由度
抓取刚性盒子、插拔线束、拧盖子和整理织物,要求不同。评估时先写出物体变化、成功条件、允许耗时和失败后果,再比较夹爪、欠驱动手与高自由度手。
增加自由度可能扩大可达动作,也增加驱动、控制、故障点与学习空间。它的收益应该表现为目标任务覆盖或可靠性提升,不应只靠外观接近人手来证明。
数据需要记录什么
| 数据来源 | 能提供什么 | 不能直接补齐什么 |
|---|---|---|
| 普通视频 | 语义、物体和动作线索 | 执行器状态、接触力、可执行动作 |
| 人类第一视角 | 实际工作情境与行为变化 | 人手到机器人动作的对应关系 |
| 真机遥操作 | 观察、机器人状态、动作与结果 | 采集成本、覆盖偏差、示范质量 |
| 仿真 | 可控条件与大量试错 | 未建模的材料、接触和真实差异 |
| 实际部署 | 目标任务、失败与人工介入 | 自动形成高质量训练集 |
DROID把跨环境操作数据和采集体系一起公开;OpenVLA提供视觉语言动作模型的研究路径。两者说明数据与模型可以被具体检查,但不能单凭数据集规模判断某款手或某项家庭任务已经可用。
触觉的价值要落在接触问题上
视觉主要帮助定位与识别,力觉和触觉可以补充接触后的信息。但不同传感器能测什么、噪声有多大、如何标定、能用多久,并不一致。
有触觉传感器,不代表策略有效利用了触觉。验证时应比较同任务的视觉基线与加入触觉后的表现,保留滑移、遮挡、材料变化和传感器退化条件。额外维护与系统成本也要计入。
数据基础设施何时可能成为平台
如果某种硬件拥有稳定接口、可批量供给和维护能力,算法与数据有机会围绕它积累。这个平台假设还需要跨客户复用、独立开发者采用和持续任务效果来验证。
卖出许多只手,与形成通用技能生态之间隔着数据协议、标注、评测和权利边界。下一步值得跟踪的,是一项技能换手、换物体、换场地后的效果,而不仅是新增多少数据小时。