KNOWLEDGE NOTE · 持续修订

灵巧操作:手、触觉与数据如何互相约束

以目标任务和可观测的接触过程评价灵巧手,避免自由度、数据小时数与平台价值之间的跳跃。

作者分析 · 复核于 · 如何使用这些判断

灵巧操作同时面对物体形状、接触、摩擦、形变和控制误差。一只手能摆出很多姿态,不等于它能稳定操作目标物体;一批视频看起来丰富,也不等于提供了训练所需的动作信息。

我的研究重点是硬件、感知、数据与任务之间的适配。特定公司的非公开路线和参数不进入这个公共框架。

先定义任务空间,再讨论自由度

抓取刚性盒子、插拔线束、拧盖子和整理织物,要求不同。评估时先写出物体变化、成功条件、允许耗时和失败后果,再比较夹爪、欠驱动手与高自由度手。

增加自由度可能扩大可达动作,也增加驱动、控制、故障点与学习空间。它的收益应该表现为目标任务覆盖或可靠性提升,不应只靠外观接近人手来证明。

数据需要记录什么

数据来源 能提供什么 不能直接补齐什么
普通视频 语义、物体和动作线索 执行器状态、接触力、可执行动作
人类第一视角 实际工作情境与行为变化 人手到机器人动作的对应关系
真机遥操作 观察、机器人状态、动作与结果 采集成本、覆盖偏差、示范质量
仿真 可控条件与大量试错 未建模的材料、接触和真实差异
实际部署 目标任务、失败与人工介入 自动形成高质量训练集

DROID把跨环境操作数据和采集体系一起公开;OpenVLA提供视觉语言动作模型的研究路径。两者说明数据与模型可以被具体检查,但不能单凭数据集规模判断某款手或某项家庭任务已经可用。

触觉的价值要落在接触问题上

视觉主要帮助定位与识别,力觉和触觉可以补充接触后的信息。但不同传感器能测什么、噪声有多大、如何标定、能用多久,并不一致。

有触觉传感器,不代表策略有效利用了触觉。验证时应比较同任务的视觉基线与加入触觉后的表现,保留滑移、遮挡、材料变化和传感器退化条件。额外维护与系统成本也要计入。

数据基础设施何时可能成为平台

如果某种硬件拥有稳定接口、可批量供给和维护能力,算法与数据有机会围绕它积累。这个平台假设还需要跨客户复用、独立开发者采用和持续任务效果来验证。

卖出许多只手,与形成通用技能生态之间隔着数据协议、标注、评测和权利边界。下一步值得跟踪的,是一项技能换手、换物体、换场地后的效果,而不仅是新增多少数据小时。

公开来源与适用范围

  • OpenVLA

    研究项目与论文 · 视觉语言动作模型的训练与评测;只支持论文所披露的任务和实验条件。

  • DROID

    研究数据集 · 跨场景真机操作数据及采集基础设施;规模不能替代特定任务适配。