拿起一枚生鸡蛋,手指需要施加恰到好处的力:既要防止滑落,又不能捏碎。拧一条湿毛巾,指尖的力道也要随着水分挤出不断调整。对人类而言,这些操作几乎出于本能。但如果只依赖视觉,摄像头拍得下手部轨迹,却捕捉不到手指接触的位置与按压的力度。
(相关资料图)
过去几年,在学术界,第一视角人类视频已经快速扩展到数万小时,越来越多工作也开始看到数据规模增长带来的收益。视觉 — 触觉数据却远没有达到这样的规模:此前公开的人类视触觉数据集大多只有几小时到几十小时。若简单将多个小数据集合并,各家的触觉传感器、采集流程和数据格式又不相同。数据量虽然上去了,硬件和流程也跟着变化,“更多数据” 究竟贡献了多少反而难以单独判断。
近日,来自德州农工大学(Texas A&M)、Google DeepMind、卡内基梅隆大学(CMU)、斯坦福大学、加州大学伯克利分校、耶鲁大学、微软、英伟达(NVIDIA)、利物浦大学、Meta、华盛顿大学、西北大学、索尼、佐治亚理工学院(Georgia Tech)以及 Overfit Lab (数据供应商) 等 15 家机构的研究者发布了TouchScale:一个在统一传感器、统一采集与同步流程下构建的500 小时人类视觉 - 触觉数据集
团队希望借此回答一个关键问题:如果不再拼接不同来源的数据,而是在同一套传感与采集体系下,把高质量的第一视角视觉 — 触觉数据真正扩展到数百小时,它是否也会像大规模视频一样,显现出随数据规模增长而来的 Scaling 收益?这些Scaling 收益,又有多少能够进一步转化为机器人的操作能力?
TouchScale 带来了什么?
1.500 小时统一穿戴设备采集。TouchScale 包含 500 小时人类双手视觉-触觉同步数据,全部由同一套穿戴式系统采集,同步记录头部 RGB-D、双腕 RGB 和双手全手触觉信号。
2.人类「手感」能迁移到机器人。无需人类动作标签,也不把人手动作映射到机器人,只用人类视触觉数据做 mid-training,机器人 4 个真机接触任务的平均成功率从 22.5% 升到 57.5%。
3.数百小时的人类视觉-触觉数据开始显现明显的 Scaling 收益。TouchScale 用于 mid-training 时,真机操作随着数据规模扩大整体变强;在独立的零样本触觉预测实验中,也观察到了同样的上升趋势。规模收益从感知一路延伸到了机器人控制。
- 题目:TouchScale: 500 Hours of Human Vision and Touch for Visual-Tactile Learning
- 论文链接:https://arxiv.org/abs/2610.10288
- 项目主页:https://touch-scale.github.io/
- 数据集地址:https://huggingface.co/datasets/2077AIDataFoundation/TouchScale
500 小时触觉数据,难的不只是「采得多」
对 TouchScale 来说,真正的难点不是把小时数简单堆到 500,而是在同一套传感器、同一套同步与采集流程下持续扩展。此前公开的人类视觉-触觉数据集大多不足 30 小时;如果直接把多个小数据集拼在一起,不同硬件和采集流程会与数据规模一起变化,很难把规模本身的影响单独拿出来研究。
TouchScale 因此从采集端就固定硬件。头部 RGB-D 相机记录整体操作过程和场景深度,两侧腕部 RGB 相机则近距离记录手与物体的交互细节;双手佩戴全手触觉手套,每只手套包含 880 个触觉传感器单元 (taxel),覆盖五指和手掌,用于记录接触时的法向压力。
为了保证大规模触觉数据的质量,TouchScale 从硬件和算法两端共同把控数据质量。采集端使用高精度、低噪声的柔性皮肤触觉传感器,稳定记录手指和手掌在交互过程中的压力变化;采集完成后,再通过 VLM 辅助的自动质检流程,只根据腕部视频判断抓握、释放和参与接触的手指,并与实际触觉响应进行交叉比对。明显的传感器失效会被直接筛除,单指缺失、遮挡严重或视觉证据不足等不确定样本则自动进入人工复核。
500 小时里,到底采了什么?
TouchScale 包含约 8.7 万条交互录制、约 2000 条任务描述和 1500 多个物体,覆盖 9 类采集环境、800 多种场景配置,并由约 20 名采集者参与完成。任务既包括日常操作,也覆盖更细粒度的接触与工具使用。例如,将水从水壶倒入广口瓶中,需要持续调整容器姿态;卷起笔记本充电线并用魔术贴固定,涉及双手配合和连续接触;用胶带封住纸箱顶部接缝,则包含抓取工具、定位和持续按压等操作。不同任务、物体和执行方式,也带来了不同的手-物姿态和触觉接触模式。
与已有公开的人类视觉-触觉数据相比,TouchScale 不仅将规模扩展到 500 小时,还始终保持统一的传感器和采集流程,并提供双手全手触觉采集,每只手包含 880 个 taxel。这为单独研究数据规模本身带来的影响提供了条件。
从感知到真机:500 小时数据带来了什么?
同样 16 小时,跨传感器泛化更好
第一组实验考察零样本跨传感器触觉预测。模型根据第一视角和腕部视频预测手部触觉,再直接在另一套触觉手套采集的 EgoTactile 上测试,不使用目标数据微调。由于不同手套的传感布局不同,评估时将结果映射到统一的 12 个手部解剖区域。
先把训练数据量控制在同样约 16 小时:用 TouchScale 子集训练的模型,接触 cIoU(contact intersection over union)达到 0.181,高于 EgoTouch 的 0.134。这个对比把 “数据更多” 排除掉了,说明在相同训练量下,TouchScale 也更有利于跨传感器泛化。
触觉监督,也能反过来帮助视觉
第二组实验把触觉作为视觉编码器的监督信号,再将学到的视觉表征迁移到动作识别任务。研究者分别使用 TouchScale、OpenTouch、FEEL 和 EgoTouch 进行预训练,并保持相同的初始化和训练预算。
在 MECCANO、Something-Something V2 和 Ego-Exo4D 三个基准上,与使用 OpenTouch、FEEL 和 EgoTouch 预训练相比,使用 TouchScale 预训练的视觉编码器在线性探测和端到端微调两种设置下都取得了最高准确率。
最后看真机:人类的「手感」能不能被机器人用上?
真机实验使用 xArm6 机械臂和 BrainCo Revo 2 灵巧手,设置软硬物体分拣、瓶盖移除、试管转移和白板擦拭四项接触密集型任务。每项任务使用 50 条机器人示范,并进行 20 次测试。
对照设置很简单:两个版本都从同一个 N0-VTLA checkpoint 出发,都使用视觉和触觉输入,也都用完全相同的机器人示范进行 post-training。唯一的区别是,其中一个版本在 post-training 之前先经过 TouchScale mid-training。
TouchScale mid-training 不使用人类动作标签,也不把人手轨迹映射成机器人动作。它沿用 N0-VTLA 的未来触觉预测目标,让模型根据当前视觉、语言和触觉去预测后续触觉变化。换句话说,机器人从人类数据里学到的不是 “手该怎么动”,而是 “接触会怎样发生”。
加入 TouchScale mid-training 后,四项任务的平均成功率从 22.5% 提升到 57.5%,四项任务全部提升:
- 软硬物体分拣:10% → 60%
- 瓶盖移除:40% → 70%
- 试管转移:30% → 60%
- 白板擦拭:10% → 40%
数据越多,效果还能继续涨吗?
真正令人兴奋的是,当 TouchScale 的数据规模继续往上加,模型和机器人都还在继续变好。
在触觉预测任务中,模型和评测设置保持不变,只增加训练数据。TouchScale 从 10% 扩展到 100% 后,cIoU 从 0.311 提升到 0.383。也就是说,见过的人类视觉-触觉交互越多,模型面对一套从未见过的触觉传感器时,依然能做出更准确的接触预测。
而这条趋势并没有停在感知层面。机器人使用的真机示范数据始终不变,仅增加 TouchScale mid-training 的人类数据,四项任务的平均成功率就从 22.5% 提升到 57.5%。
写在最后:触觉也走到了 Scaling 的起点
TouchScale 想回答的,是在传感器和采集流程保持一致的前提下,单纯扩大人类视觉-触觉数据规模,究竟能带来什么。现在看来,答案已经相当清楚:随着数据量增加,跨传感器的触觉预测整体变得更准确,经过 TouchScale mid-training 的机器人也获得了更强的真机操作能力。
这意味着,触觉不再只能是机器人系统里昂贵、零散的附加模态。它同样可以像第一视角视频一样,被规模化采集、规模化学习,并进一步转化为机器人需要的物理交互经验。 更重要的是,TouchScale 展示出的并不只是一个更大的数据集,而是一条新的数据扩展路径:当人类操作中的 “手感” 被系统地记录下来,机器人可以从这些没有动作标签的人类经验中获得可迁移的物理交互经验。
当然,这条路才刚刚开始。目前的真机实验还只覆盖一个机器人平台和四项接触密集型任务,人类触觉经验究竟通过什么机制转化为更好的机器人控制,也还有很多问题值得继续研究。但 TouchScale 已经给出了一个明确的信号:视觉已经走过的 Scaling 之路,触觉也开始走上去了。
作者介绍
本文的共同第一作者是德州农工大学博士生 Dayou Li,Google DeepMind 高级研究工程师 Hao Wang,卡内基梅隆大学博士生 Qianqian Yang 及德州农工大学博士生 Zihao Zhu。通讯作者为德州农工大学助理教授 Zhiwen Fan,研究方向涵盖机器学习和具身智能。