返回概览

平台

Roborecs 如何采集数据。

从第一人称的人类示范,到一段带标注、可直接授权的训练场次:运行流程、八条采集通道、第二阶段精度设施,以及由语料训练而成的专用模型。

( 01 / 02 )

工作原理

一次示范如何转化为可直接训练的数据、阶段路线图,以及每次采集所记录的全部通道。

运行流程

从人类示范到机器人训练数据。

01 / 采集

自我视角示范

训练有素的操作员以头戴加手腕的可穿戴设备,从第一人称视角记录真实的双手任务:同步的 RGB、深度、3D 手部姿态与骨架、运动与音频。它随训练有素的操作员线性扩展,每小时成本仅为遥操作的一小部分,无需实验室或机器人即可记录。

头戴 + 手腕设备 · 多视角 RGB · 亚毫秒同步
02 / 同步与标注

对齐并标注

亚毫秒级时间戳对齐每一路通道;较快的数据流降采样,较慢的则插值。每个场次按任务与步骤切分,并附物体与接触标签、知情同意与溯源。

亚毫秒同步 · 任务 + 步骤标注 · 溯源
03 / 交付

可直接授权的场次

输出:带标注的训练场次,采用生态已在使用的格式,可直接接入人形机器人基础模型训练流程。

GDPR · EU AI Act · HDF5 / LeRobot v3

发展路线 · 从采集到语料到模型

一个数据引擎,三段构建而成。

起步第一阶段

自我视角采集

以头戴加手腕的可穿戴设备采集第一人称人类示范。这是产出每一个人形机器人模型底层数据成本最低、最具扩展性的方式。

语料的宽广底层,也是我们的起点。

下一步第二阶段

多模态精度

设施内采集补充可穿戴设备遗漏的信号:力、力矩、接触与视线。这正是力控双手装配所要求的精度。

底层向上攀登所指向的精度目标。

规划中第三阶段

专用模型

语料不断复利累积,且始终归我们所有。当其达到规模,并在我们为此阶段引入的机器学习研究负责人的带领下,我们训练由其驱动的垂直模型,兼容 NVIDIA Isaac GR00T N1.7、Physical Intelligence π0 与 Hugging Face LeRobot。

数据护城河由此转化为模型护城河。

任务执行

这曾是机器人技术的样子。

动作
-
方块
-
从 → 到
-
循环次数
-
已渲染帧数
-
采集基元RB-CAP / 融合模块

八条同步通道,融合为一帧带标注数据。 人形机器人赖以训练的多模态数据供给。

Roborecs 正在构建这样一条数据管线:以第一人称采集这些通道,其中六条来自第一阶段,力与视线则在第二阶段设施中补充,再融合为训练帧,采用行业已在使用的格式。

规格
240 Hz 采集 · 30 Hz 输出
6/8 通道 · 2 第二阶段 · 欧盟

采集规格:目标通道、各自速率与融合输出。仅作示意,非实时或已记录的传感器数据。

01第一阶段
3D 手部姿态与骨架
SK-01 · RB-CAP
POSE60 Hz
02第一阶段
3D 场景几何
DG-02 · RB-CAP
DEPTH30 Hz
03第一阶段
物体跟踪与速度
OT-03 · RB-CAP
VELOCITY100 Hz
04第一阶段
场景分割
SG-04 · RB-CAP
SEGMENTS30 Hz
05第二阶段
力与接触压力
FC-05 · RB-CAP
FORCE1 kHz
06第一阶段
声音与音频环境
SA-06 · RB-CAP
DB48 kHz
07第二阶段
视线与注意力
GA-07 · RB-CAP
GAZE120 Hz
08第一阶段
空间定位
LC-08 · RB-CAP
POSITION60 Hz
融合流程 · RB-MERGE / 传感器融合
八条通道输入。一帧带标注数据输出。同步至 LeRobot 标准的 30 Hz。

每条通道以各自的原生速率采集。亚毫秒级时间戳对齐每一个采样点。较快的通道降采样,较慢的通道插值。输出为单帧多模态数据,每秒 30 次。

SK-01
60 Hz第一阶段
DG-02
30 Hz第一阶段
OT-03
100 Hz第一阶段
SG-04
30 Hz第一阶段
FC-05
1 kHz第二阶段
SA-06
48 kHz第一阶段
GA-07
120 Hz第二阶段
LC-08
60 Hz第一阶段
输出 · 合并帧
带标注训练帧
格式LeRobot v3 · HDF5
速率240 Hz 采集 · 30 Hz 输出
兼容GR00T · π0 · LeRobot
法域EU · GDPR
当代人形机器人基础模型,NVIDIA Isaac GR00T N1.7Physical Intelligence π0Hugging Face LeRobot,都基于多模态物理数据训练:视觉、本体感知、力/力矩、IMU、触觉瓶颈在于供给。互联网拥有数万亿个文本 token;人形机器人所拥有的物理数据仅为其所需的一小部分。Roborecs 正是为供给这类数据而建:以第一人称、多模态方式采集,采用 LeRobot 兼容格式,源自欧盟。
交付内容

Roborecs 的数据集以带完整文档、可直接训练的场次形式交付,而非成堆的原始数据。具体可用内容取决于采集阶段。

模态
  • 7 路 RGB 视频
  • 深度
  • IMU(500 Hz)
  • 空间轨迹
  • 音频
  • 手部姿态与骨架
  • 力/力矩与触觉(第二阶段)
标注
  • 任务与步骤分割
  • 物体与交互标签(抓取、放置、插入、布线)
  • 接触与抓握事件
  • 逐场次元数据(任务、环境、操作员)
  • 面向你的模型或基准的定制分类体系
交付
  • LeRobot v3 / HDF5 格式
  • 数据卡与清单
  • 逐场次的知情同意与溯源凭证
  • 欧盟法域内交付
  • 云存储桶或加密传输

采集项目的交付规格。具体可用的模态与标注取决于采集阶段。

索取采集规格说明 →8 种模态 · 索非亚,保加利亚 · LeRobot v3 兼容 · 欧盟 GDPR · 不受 CLOUD Act 约束
( 02 / 02 )

精度层

索非亚设施,以及相机本身无法承载的力与触觉。

索非亚科技园(Sofia Tech Park)规划中的 Roborecs 数据采集设施效果图
设施 · RB-FAC

专为物理 AI 而建,落地欧洲。

规划落地于索非亚科技园(Sofia Tech Park)的专用数据采集设施。首期面积 1,100 m²,可扩展至 5,000 m²。直接对接 STEM 人才、能源基础设施与欧盟物流。目标于 Q3 2027 投入运营。

1,100 m² 首期·5,000 m² 规划·Sofia Tech Park·Q3 2027
第二阶段 · 任务库5 类 · 可定制

力控双手装配,第二阶段的精度任务目录。

第二阶段补充需要力与双手协调的接触密集型任务,超出第一人称视频本身所能承载的范围。机器人厂商客户可委托覆盖以下各类别的任务库,也可就专有需求提出定制委托。

旗舰
电子与精密装配
  • 连接器插接与线缆布线
  • 带扭矩的精密紧固
  • PCB 与元件操作
高需求
工业与仓储
  • 抓取放置装配
  • 质量检测
  • 料箱分拣与打包
高价值
灵巧精细动作
  • 双手协调
  • 工具操作
  • 精细对位
新兴
人机交互
  • 协作任务交接
  • 协助与引导
  • 近距离安全作业
开放
定制委托
  • OEM(厂商)定义的任务规格
  • 定制采集场次
  • IP(知识产权)完全转让
没有找到您需要的任务?

面向 OEM 专属任务库提供定制委托。IP 完全转让。数据溯源自第一天起即符合欧盟 GDPR。

洽谈委托 →
第二阶段 · 精度采集操作员在环

操作员驱动,机器人执行。

第二阶段的精度层,面向最具挑战的接触密集型任务。移动光标以引导操作员指令;机器人随之执行,我们在其作业过程中记录关节状态、力和接触,数据在机器人自身的动作空间中采集,可直接用于训练,无需人到机器人的重定向。

遥操作 · 双手采集概念示意
操作员输入机器人 · 执行中
REC · EP 001
在物体附近按住 · 抓取 | 在垫上松开 · 放置 | 滚动 · 深度 | 拖动 · 环绕
shoulder_pitch_R·
elbow_pitch_R·
wrist_ft·
tactile·
gripper_aperture·
operator_cmd·
rgb_cam·
depth_cam·

示意性遥测 · 实时源自演示运动学,而非记录的传感器数据

已记录场次数
0
同步通道数
8
机器人关节状态
28 DOF · 240 Hz
专用模型 · 复利累积层状态 · 规划中

先有语料,再有以此构建的模型

采集与精度只为构建一样东西:一份专有的、带动作标注的力控装配语料。机器人模型架构正在走向通用化,开放的 GR00T、开放的 LeRobot、开放的 π0,而其底层的数据不会。语料是护城河,专用模型则是它带来的复利回报。

采集
语料
专用模型
部署
每一次部署都反哺下一轮采集。

语料无法从网络抓取,只能一次一项交互地采集,并随我们运行的每一项任务不断增长。循环每转动一圈,数据领先优势便再扩大一分。

状态 · 规划中

目前尚无任何模型基于 Roborecs 数据训练,Roborecs 也尚未交付任何模型。模型层的开启取决于两道门槛:语料规模跨过已发表结果表明专用策略所需的门槛,且我们引入构建它所需的机器学习研究负责人。我们宁可明确说明这些门槛,也不愿暗示一个尚不存在的模型或团队。

中立供给层

我们的专用模型是任务策略,而非机器人,可运行于任何 LeRobot 兼容的技术栈之上。数据才是产品:授权给客户的任何语料,都会从我们自己的模型路线图中划出,因此我们绝不发布与数据客户相竞争的策略。我们确实会构建的策略,用于证明语料能产出什么。

示例策略 · 规划中

RB-VLA-01

电子装配

面向连接器插接、线缆布线与螺丝紧固的专用视觉-语言-动作策略。基于装配语料中的力/力矩与触觉通道后训练,在这些任务中,一毫米与几牛顿即决定成败。以 LeRobot 兼容格式交付。

RB-VLA-02

精密配套

在严格公差下将零件从料箱放置到夹具。相同语料,不同任务族。

这些模型位于开放基础模型的下游,而非与之对立。基于语料后训练,并以同一套 LeRobot 兼容格式交付。与 NVIDIA Isaac GR00T N1.7、Physical Intelligence π0 兼容,而非竞争。

下一步

开展试点。

告诉我们你的机器人与目标任务。我们会规划采集方案、商定样本规格,并在任何批量承诺之前先交付一套评估数据集。