触觉正在成为机器人训练的下一种数据
日期:2026-10-02 20:45:06 / 人气:13

2026年9月27日,美国匹兹堡,IROS(智能机器人与系统国际会议)正式开幕。作为机器人领域顶会之一,IROS议题覆盖机器人全赛道,但今年现场出现了一个极具风向标意义的现象:多场触觉技术分会场全程座无虚席,场内席位早早占满,会场大门敞开,门外仍挤满站立旁听的参会者。
在机器人视觉、大模型、自主导航百花齐放的当下,原本小众的触觉研究,集中成为全场焦点。三场核心报告勾勒出行业最新变革趋势:MIT Edward Adelson教授系统复盘光学触觉技术的迭代取舍;哥伦比亚大学李云竹团队拆解低成本触觉传感器的规模化落地路径;Amazon齐昊志分享触觉手套与力感设备的产业落地逻辑。
三家顶尖机构、三条差异化技术路线,最终指向同一个行业共识:机器人视觉的标准化、规模化时代已然成型,但真实物理交互的核心数据——触觉,长期处于缺失、分散、无法通用的状态。如今机器人学习进入数据驱动阶段,触觉数据的规模化采集、建模与通用化,已然成为物理AI进化的下一个核心瓶颈与增量赛道。
一、视觉的盲区:机器人缺的不是动作,是物理感知
触觉并非新兴方向,其技术根基早已筑牢。早在2009年,MIT团队便在CVPR发表开创性研究,奠定经典GelSight光学触觉技术基础。通过透明弹性体叠加反射薄膜结构,将物体按压产生的微观纹理、表面形变,转化为摄像头可捕捉、计算机视觉可处理的图像信号,让原本难以量化的接触物理信息实现数字化采集。
十余年来,行业陆续衍生出压阻、电容、压电、磁性等多类触觉传感方案,技术迭代从未停滞,但始终无法复刻视觉技术的标准化成果。正如2025年IEEE触觉机器人综述总结:目前行业多条技术路线并行,传感器形态、安装方式、输出信号完全不统一,没有形成任何通用技术范式。
这种差距直观体现在行业认知中:摄像头已是所有机器人的标配,业界早已无需讨论“机器人是否需要视觉”;而触觉至今仍是可选配件,是锦上添花的功能,而非支撑精细交互的刚需能力。
随着机器人基础模型快速发展,行业大规模复用互联网视频、第一视角演示、遥操作轨迹数据训练模型,视觉感知的短板彻底暴露:视觉可以记录世界样貌、手部运动轨迹,却完全记录不了接触瞬间的物理真相。
哥伦比亚大学李云竹团队在IROS现场展示的葡萄抓取实验,精准印证了这一缺陷:机器人抓取袋中葡萄时,袋体遮挡形成视觉盲区,纯视觉训练的机器人只能输出标准化抓取动作,无法判断指尖与果实的真实接触状态,频繁出现空抓、夹取过紧捏坏果实的问题。接入触觉反馈后,机器人可实时感知夹持力度、贴合状态、滑移趋势,遭遇外部干扰时能自主调整姿态、重新稳定抓取,交互容错率大幅提升。
类似场景贯穿机器人精细操作全场景:透明试管插拔、精密零件装配、擦拭、拧紧、柔性物体夹持,视觉都无法捕捉滑移、摩擦、法向力、剪切力等微观交互状态。人类依靠皮肤触觉动态调整发力与姿态,完成稳定操作;而纯视觉机器人,始终缺失这套闭环物理感知能力。
更关键的是,触觉绝非简单的“力控数据补充”,而是一套多维物理信息体系:包含接触位置、压力分布、多维受力、局部形变、表面纹理、材料刚度与摩擦特性。不同传感技术只能捕捉部分维度,数据形态、表征逻辑天差地别,这也是触觉建模难度远高于视觉的核心原因。视觉拥有统一的像素空间标准,跨设备数据可通用适配;而更换一款触觉传感器,观测维度、信号逻辑、数据特征会彻底重构,无法通用、无法规模化、无法统一建模,成为行业长期痛点。
二、硬件破局:从“追求高精度”到“可量产、可复用”
2026年IROS释放的核心信号,是触觉传感器的评价体系彻底重构:行业不再单一追逐超高分辨率、极致精度,而是转向低成本、高耐久、可批量量产、跨设备兼容、数据长期有效的规模化落地能力。
MIT出身的李云竹团队带来的FlexiTac传感器,走出了一条适配AI训练的平民化量产路线。不同于GelSight追求极致几何细节的光学方案,FlexiTac采用成熟压阻阵列架构,将传感单元间距控制在2mm,贴合人类指尖感知阈值,足以覆盖绝大多数日常精细交互任务。
其核心突破在于制备效率与成本控制:初代手工制备单块传感器需30分钟、成本5美元;二代工艺优化后,单块制备时长压缩至3分钟,千片量产单价低至1.36美元。同时软硬件全开源、支持100Hz高频采集,可任意弯曲裁剪,适配夹爪、指尖、全身电子皮肤等多场景部署。
更关键的是解决了行业普遍存在的批次一致性、长期有效性难题。团队实测数据显示,2024年为NVIDIA制作的早期传感器,时隔一年半仍可稳定工作,历史训练的模型策略依旧有效,彻底解决了软材料传感器易老化、数据易失效的问题。同时通过弹簧阻尼系统仿真建模,仅需少量参数即可复现真实触觉信号,大幅降低仿真训练成本。
与低成本量产对应的,是行业对耐久性与硬件一致性的极致探索。Edward Adelson在大会上重点剖析了光学触觉的天然权衡:越轻薄的弹性凝胶层,形变细节越丰富、精度越高,但磨损、撕裂、分层风险急剧上升。2mm厚高韧性橡胶材质可大幅提升耐用性,却会让分辨率回落至毫米级,精度与耐久难以兼得。
现场加速老化测试数据直观展现行业短板:主流GelSight Mini、DIGIT传感器在4kg持续撞击的磨损测试中,仅30分钟便彻底失效;加装TPU保护层的改良版本,最长可稳定工作6天。更关键的是,目前行业无统一耐久性测试标准,传感器损耗后的信号偏移、数据失效、模型兼容问题,成为大规模数据采集的巨大阻碍。
针对这一痛点,AnySkin创新性采用模块化分体设计,将易磨损的传感表层与底层电子硬件分离,支持快速换皮复用,同时优化跨设备信号一致性。实测显示,换皮后无需重新校准,模型策略性能仅衰减13%–15.6%;而同场景下传统ReSkin传感器性能衰减高达43%,模块化设计为规模化、持续性数据采集提供了可行方案。
硬件迭代最终服务于数据采集体系升级。行业主流的UMI演示采集范式,可灵活记录人类操作的视觉画面与运动轨迹,但原生设备无法留存接触力、滑移等物理信息。搭载FlexiTac后,同一套采集流程可同步生成视觉+触觉双模态数据,既弥补了精细交互信息的缺失,也让传统演示数据具备了物理真实性与可泛化性。
三、数据扩容:从机器人自研,到人类触觉数据迁移
触觉数据难以规模化的核心瓶颈,在于采集逻辑与视觉完全不同:视觉是被动拍摄、无限生成;触觉必须依托真实物理挤压、摩擦、滑移交互,采集过程损耗硬件、变量复杂、成本极高。单纯依靠机器人自主采集,难以快速补足数据体量缺口,人类操作触觉数据迁移,成为行业增量关键路径。
Amazon Frontier AI&Robotics齐昊志团队的OSMO触觉手套,率先打通人类触觉数据采集链路。设备在指尖、手掌布置12个三轴磁性触觉传感器,通过磁场形变解算法向力、剪切力等多维交互信息,核心设计亮点在于人机传感接口统一:同一套手套可采集人类操作数据,也可直接适配机器人真机,最大限度缩小人机数据分布差异。
擦拭任务实测中,仅依靠人类触觉演示数据训练、无机器人真机数据微调的策略,任务成功率可达72%,相比纯视觉基线大幅降低压力控制失误、滑移失效等问题,印证了人类触觉数据的训练价值。
但穿戴式触觉手套存在天然短板:长时间佩戴舒适性差、硬件持续损耗、规模化采集成本高昂。为此团队迭代出轻量化ForceBand腕带方案,跳出指尖传感逻辑,通过8通道表面肌电模块+惯性测量单元,采集前臂肌肉活动信号,依托EMG2Force模型映射还原指尖受力状态。
训练阶段以指尖传感器数据为真值、肌电与惯性信号为输入,完成模型映射学习后,正式采集时可完全移除指尖传感设备,仅靠腕带+相机即可生成高精度力值曲线。实测数据显示,该方案相比纯视觉力估计误差下降超50%,精细压力控制抓取任务成功率达87%。
这套迭代路径清晰展现行业取舍逻辑:触觉数据规模化,不再追求单设备极致精度,而是通过分层传感、轻量化硬件、间接估算,平衡采集成本、佩戴体验、数据质量、时序同步、硬件寿命等多重变量,为百万小时级人机多模态数据集搭建可行基建。
四、模型进阶:从单点感知,到触觉世界模型与通用表征
硬件成本下降、采集链路打通,仅解决了触觉数据的“有无问题”,行业下一阶段的核心攻坚目标,是触觉通用表征与世界模型融合,解决多设备、多场景、多任务的数据泛化难题。
视觉的成熟,依托ImageNet级别的海量统一数据集与通用像素表征;而触觉数据体量小、设备差异大、场景碎片化,长期缺乏统一预训练体系。2024年Meta、华盛顿大学团队推出的Sparsh项目,率先对标视觉预训练范式,依托46万余张多设备触觉图像开展自监督预训练,搭建TacBench评测基准。实测显示,预训练通用表征在多任务评测中,相比单任务端到端训练平均提升95.1%,验证了触觉通用预训练的可行性。
但触觉数据的特殊性,暗藏极易被忽视的训练陷阱。德累斯顿工业大学RCT研究指出核心问题:触觉数据具备强时序关联性,单次按压产生的连续数十帧画面,本质是同一次物理交互。传统随机划分训练集、测试集的方式,会造成样本重叠、虚高泛化效果。
团队使用122种工业材料、2.9万帧完整按压数据测试,剔除时序样本重叠后,触觉文本检索Recall@1大幅下降17.7个百分点;针对全新未知材料的泛化准确率仅25.1%。这意味着:触觉数据的统计口径需要彻底重构,帧数量不等于交互次数,数据量不能直接等价于模型能力。
破除数据陷阱后,行业正式进入触觉世界模型迭代阶段,实现从“事后感知”到“事前预测”的跨越式升级。传统触觉传感器是被动反馈器件,交互完成后才输出状态数据;而触觉世界模型可在动作执行前,预判接触位置、滑移趋势、受力变化,实现主动预判与动态调控。
李云竹团队在IROS现场展示的视触觉联合预测模型,运行速率达15Hz,可提前预判物体滑移、对齐偏差,依托视觉与触觉双模态预测驱动精细插入、装配操作。TouchWorld、DexTouch-WM等系列工作进一步完善分层建模、残差修正、人机数据融合体系:TouchWorld在强接触灵巧任务中,相较传统基线成功率提升15个百分点以上;DexTouch-WM通过扩充100小时人类触觉数据,将机器人接触交并比从0.415提升至0.588,彻底打通人机触觉数据协同训练路径。
五、产业终局:触觉复刻视觉进化史,定义物理AI新标准
纵观整场IROS 2026,触觉技术的爆发并非单点突破,而是完整产业链路的成型。行业正在复刻计算机视觉的十年进化路径:先完成硬件标准化、低成本量产,再搭建规模化数据集、建立通用表征体系,最终融入基础模型与世界模型,成为通用机器人的底层标配能力。
但触觉的进化难度,远高于视觉。视觉是光学信号的数字化,而触觉是真实物理世界的数字化,必须兼顾材料力学、摩擦特性、时序关联、硬件损耗、跨设备泛化等多重物理约束。
当下行业的核心变革,早已跳出技术单点创新:评价体系从“精度至上”转向“规模化适配”,数据来源从“机器自主采集”转向“人机协同扩容”,模型能力从“被动感知”转向“主动预测”。
未来机器人的核心竞争力,不再只是看得清、跑得快、动得准,而是摸得稳、控得住、判得准、学得快。当视觉解决了机器人“看见世界”的问题,触觉正在解决机器人“理解物理世界”的核心命题。
在通用机器人从“仿生演示”走向“落地实用”的关键阶段,触觉数据,正是撑起物理AI下一阶段增长的核心底座。
作者:星辉注册登录平台
新闻资讯 News
- 房地产20余年的嬗变:从“增长引...10-08
- 迟到的诚实:许鞍华为何总在多年...10-08
- 新鲜零食疯狂开店:行业内卷的尽...10-08
- 阿迪耐克傻眼:亚瑟士为何逆势大...10-08

