数据血缘:追溯每一条机器人轨迹

数据血缘追踪每一条机器人轨迹的来源。为什么认真的训练数据买家如今都会追问它,一份真正的记录又该包含什么。

阅读约 6 分钟

一位机器人采购方坐在谈判桌对面,抛出一个能让交易停滞的问题:告诉我这条轨迹从何而来。不是模型,而是数据。是谁录制的,用的什么设备,在何种知情同意下采集,以及在进入训练集之前经过了哪些清洗步骤。大多数团队答不上来。

这是一个数据血缘(data lineage)问题,它正悄然成为一道门槛,决定一个机器人数据集是否值得购买。多年来,这个领域一直在为规模而优化:更多的示范、更多的时长、更多的本体。规模依然重要。但一个来源无法追溯的庞大语料库,一旦监管机构、客户或失败的策略提出尖锐问题,就会立刻变成负债。

数据血缘记录的是每条轨迹的来源,以及此后发生在它身上的一切。对于机器人训练数据而言,这比文本更难,因为单次示范交织了视频、关节状态、力反馈读数和人的身份,而它们是在真实的地点、由真实的人、在物理硬件上采集的。

为什么这个问题越来越尖锐

有三股力量,正在把血缘从锦上添花,推向尽职调查清单上的必选项。

第一是法律。根据 GDPR,一个被拍摄执行任务的人就是数据主体,其同意是有范围的。如果你无法追溯哪些轨迹来自哪份同意书,你就无法履行撤回请求,也无法证明处理数据的合法依据。EU AI Act 又叠加了一层:高风险 AI 系统的提供方必须保留关于训练数据及其治理的记录。一个进入受监管部署场景的机器人策略,会继承这项义务。

第二是调试。当一个策略学到了坏习惯,最快的修复方法,是找到并移除教出这个习惯的那些示范。没有血缘,你只能靠猜。有了血缘,你可以按操作员、按设备、按场次、按日期来筛选,然后在干净的切片上重新训练。

第三是质量与价格。一个按示范时长付费的买家,想知道自己不会为近乎重复的场次重复付费,也想知道标注是由一个他们可以审查的流程产出的。血缘就是你证明语料库与发票所述相符的方式。

没有血缘的数据集不是资产,而是一场赌注:赌没有人会对它提出尖锐的问题。

一份真正的血缘记录包含什么

血缘不是单个字段,而是一条从采集设备一直跟随轨迹到训练批次的链条。任何一环断裂,整条链就所剩无几。下面这些层,正是认真的买家会去追问的。

表 1:机器人数据血缘记录的各个层级及其重要性
层级记录内容买家为何在意
来源操作员 ID、设备、地点、场次、时间戳同意范围、可复现性、去重
同意同意书版本、范围、撤回状态GDPR 合法依据、被遗忘权
采集配置传感器组合、标定、采集频率可复现性、按传感器筛选
变换每一步清洗、重定向和重新标注审计是什么塑造了最终张量
构成每条轨迹来自哪个源厘清聚合语料库

最难的一列是变换。一次原始示范,很少就是训练模型的那份东西。它会被同步、重定向到机器人本体、降采样、过滤并重新标注。每一步都是引入误差的机会,也是丢失回溯至源头那条线索的机会。

同意值得单独强调。它不是一个简单的是或否。它有版本,因为同意书会随时间变化;它也有范围,因为一个人可能同意用于研究,却不同意用于商业转售。一份把同意压缩成布尔值的血缘记录,恰恰扔掉了监管机构将会追问的那份细微差别。

聚合带来的难题

开放语料库把这个问题摆到了明面上。Open X-Embodiment 把来自众多实验室和机器人类型的数据,缝合进一个训练混合集,这恰恰是它对跨本体学习有用的原因。这也意味着,在它之上训练的策略,继承了来自数十个上游采集工作的溯源信息,而每一个都有自己的约定。DROID 走了另一条路。它在众多站点上标准化了单一的硬件配置,这让它的血缘干净得多,但多样性也更窄。

两种做法都没有错。它们是在多样性与可追溯性之间做权衡。对今天任何一个构建语料库的人来说,教训是:你要么从一开始就把血缘设计进去,要么日后花上数年去事后重建它。像 Hugging Face LeRobot 这样的工具,已经开始标准化片段的存储和描述方式,这降低了把事情做对的成本。

血缘无法事后再补

那个诱人的错误,是许诺自己等数据集变得重要时再去补上血缘。等到那时,通常已经太迟。设想一个团队,在三个站点采集了一年的示范,同意书锁在文件柜里,视频在一个存储桶,传感器日志在另一个,彼此之间只靠松散的文件命名约定相连。让他们证明哪些轨迹来自某个后来撤回了同意的操作员,诚实的答案是一项耗时数周、且带着无法填补的缺口的取证工程。

血缘在采集时记录起来很便宜,事后重建却很昂贵,因为那些连接信息会衰减。时间戳会漂移,员工会离职,存储桶会被重新整理,而一个原始文件与约束它的那份同意之间的映射,会悄然腐坏。一份在场次结束那一刻写下的记录,携带着任何日后的考古都无法复原的上下文。

有一种技术形态会有帮助。在采集时就给每条轨迹一个稳定的标识符。附上一份清单,写明操作员、设备、同意书版本和传感器配置。把每一次变换都记录为一个引用其输入标识符的步骤,好让这条链在两个方向上都可追溯。这些都不玄乎。这只是普通的数据工程,只不过施加在数据存在之前,而不是在它已经丢失了历史之后。

认真的买家深知这一点,所以他们的尽职调查追问的是流程,而不只是数字。他们会要求端到端地追溯一条随机的轨迹。一个把血缘设计在内的团队,几分钟就能做到。一个没有的团队,则会当场发现,自己那令人印象深刻的时长,建立在一个它无法出具凭证的地基之上。

溯源就是新的护城河

赢得机器人数据市场的团队,不会是那些拥有最大一堆无差别数据的团队,而会是那些能够毫不迟疑地回答买家问题的团队:这条轨迹从何而来,是谁同意了它,以及在通向模型的路上它经历了什么。血缘并不光鲜。但它也正是一个数据集能不能卖进严肃部署场景的分界线。

data-lineageprovenancetraceabilitydatasetscompliance

来源