欧盟《AI 法案》与机器人训练数据:要点解读
EU AI Act 对具身训练数据究竟有何要求:Article 10 的质量与数据治理规则、GPAI 的来源透明义务,以及机器人在 2026 至 2027 年的合规时间表。
设想一次审计。德国一家物流企业的安全负责人,就正在 7 号通道搬运料箱的人形机器人只问了一个问题:教它抓取的数据从何而来,你能否证明训练视频里的人同意被拍摄?在通常被称为 EU AI Act 的 Regulation (EU) 2024/1689 之下,这个问题不再是反问,而成了一项书面记录义务。
多数概述都弄错了一点。AI 法案并不直接监管数据集。它监管投放到欧盟市场的 AI 系统,以及驱动这些系统的通用人工智能模型。没有哪一条规定说机器人训练集必须包含固定的视频时长或演示配额。然而只要细读那些义务,几乎全部分量最终都落在数据上。法案把你的数据,变成你证明系统行为合规的地方。
对于构建具身基础模型的团队,这种间接性就是全部关键。无论你是抓取第一人称视频、在实验室里遥操作机械臂,还是像 Open X-Embodiment 那样把超过一百万条真实机器人轨迹跨机构汇集起来,合规面对应的都是同一组问题:来源、代表性、同意与偏差。本文梳理法案对具身数据集究竟提出了什么要求,哪些现在生效,哪些要到 2026 年和 2027 年才动真格。
法案监管的是系统,不是数据集
适用范围决定其余一切。AI 法案适用于在欧盟市场投放 AI 系统、或在欧盟投入使用的提供者,以及通用人工智能(GPAI)模型的提供者,无论其身处何地。输出在欧盟境内被使用同样计入。单独的数据集不是被监管对象。它变得相关,是在训练某个触及欧盟的系统或模型的那一刻。
法案按风险给系统分级:一小份被禁止的做法、一个更大的高风险层级、负有透明度义务的有限风险系统,以及其余全部。作为工业机械安全部件、或置于其他受监管产品之中的人形机器人,可以通过 Annex I 落入高风险层级,这一附件把 AI 法案与既有的产品安全法(例如机械法规)绑在一起。正是这种分级,把数据治理规则拉入生效。
所以诚实的说法是:你的具身数据集是被间接监管的。它从所训练的系统、以及你所发布的模型那里,继承了义务。忽视这一点,你就会把 Article 10 当成可选项。它不是。
Article 10:高风险机器人的数据治理门槛
对任何组建机器人数据的人来说,Article 10 是最要紧的条款。它要求支撑高风险系统的训练、验证与测试数据集满足质量标准。措辞刻意偏重实践,而非数字。
法案从不告诉你数据集必须包含什么。它告诉你系统必须如何行为,再把数据变成你证明这一点的地方。
| 要求 | 法律依据 | 对机器人数据集的实际检验 |
|---|---|---|
| 相关性与代表性 | Art. 10(3) | 数据是否覆盖机器人将真正运行的地理、行为与功能设定? |
| 错误与完整性检查 | Art. 10(3) | 误标轨迹、丢帧与缺口是否已记录并纠正? |
| 偏差检查 | Art. 10(2) | 你是否排查过体型、利手性、光照与地域上的偏斜? |
| 来源与采集过程 | Art. 10(2)、Annex IV | 你能否说明每段片段从何而来、同意如何取得? |
| 训练内容摘要 | Art. 53(1) | 对于 GPAI 机器人模型,你能否公开一份足够详尽的训练内容摘要? |
代表性检验,正是机器人与语言模型分道扬镳之处。Article 10 追问数据是否反映预期使用的特定地理、情境、行为与功能设定。只在明亮实验室遥操作下训练的操作策略,显然不能代表一间昏暗的欧洲厨房。DROID 作为约 76,000 次、跨 13 家机构采集的遥操作演示而存在,部分正是因为单一站点的数据无法泛化。法案给这条工程直觉配上了法律锋刃。
有一条反直觉的许可。Article 10(5) 允许提供者处理特殊类别个人数据,即敏感数据,但严格限于检测和纠正偏差,并须配套保障。对记录了面孔、手部与体型的第一人称采集而言,这是让偏差审计合法、而非构成新违规的那扇狭窄法律之门。
你的基础模型就是一个 GPAI 模型,来源要公开
多数机器人基础模型,在法案意义上都是通用人工智能模型,而 GPAI 义务自 2025 年 8 月 2 日起适用。提供者须保存技术文档、向下游集成方传递信息、制定尊重欧盟版权的政策,并依据 AI Office 发布的模板,公开一份关于训练所用内容的足够详尽的摘要。
最后一条值得读两遍。来源不再是私事。如果你的模型是从抓取的视频里学会叠衣服,摘要就得在有意义的细节层面如实说明。如果它是从经同意、有记录的人类演示里学到,摘要既好写也好辩。监管者、或下游 OEM 的律师要求查看的那一天,两条路径就此分岔。
有一个数字值得记住。法案把最重的 GPAI 义务,留给以超过约 10^25 次浮点运算训练的模型,并推定其带有系统性风险。今天的机器人基础模型远在这条线之下,因此属于普通 GPAI,而非系统性风险 GPAI。透明度与版权义务照常适用;额外的评估与事故报告负担则不然,至少目前如此。
GDPR 与 Data Act 并没有消失
AI 法案叠加在具身数据不断触及的另外两套制度之上。第一套是 GDPR。第一人称影像里满是个人数据:路人的面孔、某人家中的内景、工人的步态。这些不会因为如今成了机器人训练输入,就不再是个人数据。合法性基础、最小化与留存期限依旧适用,而且 AI 法案明确保留 GDPR 不受影响。
第二套是 EU Data Act,自 2025 年 9 月 12 日起生效,规范对联网产品所生成数据的访问。一支机器人机队,就是一支联网产品机队。谁可以访问它们生成的数据流、以何种条件访问,如今有了成文答案。对任何打算跨伙伴汇集机器人生成数据的团队,Data Act 在 AI 法案还没看向模型之前,就已经塑造了合同。
这对你如何构建数据集意味着什么
日程表是最实际的部分。禁止性规定自 2025 年 2 月起适用。GPAI 义务自 2025 年 8 月起。包括 Article 10 在内、与训练数据相关的高风险与数据治理义务,正在 2026 年至 2027 年间分阶段生效,其中针对机械等受监管产品内 AI 的规则属于更晚的一批。确切的适用日期在实施过程中已有变动,因此应以当前的时间表为准,而非任何单一截止日。如果你的机器人在这段窗口内进入欧盟市场,你在 2026 年做出的数据决策,正是你 2027 年要拿去备案的。
跑得最快的团队,把数据治理当作设计约束,而非事后补救。落到实处,这意味着:
- 在采集当时就记录来源,而不是等审计时再回溯拼凑;
- 把同意作为结构化元数据来记录,而不是抽屉里一份签好的 PDF;
- 在训练之前、而不是审计者来问之后,就跨地域、光照、利手性与体型度量代表性。
Ego4D 以约 3,670 小时、来自 9 个国家数百名相机佩戴者的第一人称视频,展示了经同意的第一人称采集究竟需要多少支撑结构。法案把这套支撑结构,从良好实践变成了要求。
这一切并不需要先有一个合规部门才能起步。它需要你尽早决定:数据从何而来,与模型的权重一样,都是模型的一部分。法案只是让这个决定,对其他所有人也变得清晰可读。