工作原理
一次示范如何转化为可直接训练的数据、阶段路线图,以及每次采集所记录的全部通道。
从人类示范到机器人训练数据。
自我视角示范
训练有素的操作员以头戴加手腕的可穿戴设备,从第一人称视角记录真实的双手任务:同步的 RGB、深度、3D 手部姿态与骨架、运动与音频。它随训练有素的操作员线性扩展,每小时成本仅为遥操作的一小部分,无需实验室或机器人即可记录。
头戴 + 手腕设备 · 多视角 RGB · 亚毫秒同步对齐并标注
亚毫秒级时间戳对齐每一路通道;较快的数据流降采样,较慢的则插值。每个场次按任务与步骤切分,并附物体与接触标签、知情同意与溯源。
亚毫秒同步 · 任务 + 步骤标注 · 溯源可直接授权的场次
输出:带标注的训练场次,采用生态已在使用的格式,可直接接入人形机器人基础模型训练流程。
GDPR · 知情同意 · HDF5 / LeRobot v3发展路线 · 从采集到语料到模型
一个数据引擎,三段构建而成。
自我视角采集
以头戴加手腕的可穿戴设备采集第一人称人类示范。在产出每一个人形机器人模型的底层数据方面,它比遥操作便宜得多、也更具扩展性。
语料的宽广底层,也是我们的起点。
部署与循环
部署在真实工厂任务上的机器人,将捕捉可穿戴设备永远看不到的部署失败。每一个循环都在改进机器人,并以任何仅靠采集设备都无法产出的数据,让语料实现复利式的持续增长。
让数据领先优势不断复利累积的循环。
专用模型
语料不断复利累积,且始终归我们所有。当其达到规模,并在我们为此阶段引入的机器学习研究负责人的带领下,我们训练由其驱动的垂直模型,兼容 NVIDIA Isaac GR00T N1.7、Physical Intelligence π0 与 Hugging Face LeRobot。
数据护城河由此转化为模型护城河。
这曾是机器人技术的样子。
七条同步通道,融合为一帧带标注数据。
人形机器人赖以训练的多模态数据供给。
Roborecs 正在构建这样一条数据管线:以第一人称采集这些通道,再融合为训练帧,采用行业已在使用的格式。
采集规格:目标通道、各自速率与融合输出。仅作示意,非实时或已记录的传感器数据。
需要相机装置尚不具备的眼动追踪能力,将在第二阶段评估层开放时加入。
每条通道以各自的原生速率采集。亚毫秒级时间戳对齐每一个采样点。较快的通道降采样,较慢的通道插值。输出为单帧多模态数据,每秒 30 次。
Roborecs 的数据集以带完整文档、可直接训练的场次形式交付,而非成堆的原始数据。具体可用内容取决于采集阶段。
- 7 路 RGB 视频
- 深度(多视角生成)
- IMU(500 Hz)
- 空间轨迹
- 音频
- 手部姿态与骨架
- 任务与步骤分割
- 物体与交互标签(抓取、放置、插入、布线)
- 接触与抓握事件
- 逐场次元数据(任务、环境、操作员)
- 面向你的模型或基准的定制分类体系
- LeRobot v3 / HDF5 格式
- 数据卡与清单
- 逐场次的知情同意与溯源凭证
- 欧盟法域内交付
- 云存储桶或加密传输
采集项目的交付规格。具体可用的模态与标注取决于采集阶段。
精度层
索非亚设施,以及可直接训练数据背后的多模态流程。

专为物理 AI 而建,落地欧洲。
规划落地于索非亚科技园(Sofia Tech Park)的专用数据采集设施。首期面积 1,100 m²,可扩展至 5,000 m²。直接对接 STEM 人才、能源基础设施与欧盟物流。目标于 Q3 2027 投入运营。
双手工业装配,任务目录。
需要真实工业示范的接触密集型双手任务,连接器作业、紧固、精密操作,将在机器人部署的工业场景中采集。客户可委托覆盖以下各类别的任务库,也可就专有需求提出定制委托。
- →连接器插接与线缆布线
- →带扭矩的精密紧固
- →PCB 与元件操作
- →抓取放置装配
- →质量检测
- →料箱分拣与打包
- →双手协调
- →工具操作
- →精细对位
- →协作任务交接
- →协助与引导
- →近距离安全作业
- →OEM(厂商)定义的任务规格
- →定制采集场次
- →IP(知识产权)完全转让
执行任务的机器人。
这是循环的部署端:一台机器人正在执行操作任务。移动光标以引导它;它随之执行,我们在其作业过程中记录发生的一切,成功与失败,并将这些反馈回去以改进下一个版本。语料正是在这里复利累积。
示意性遥测 · 实时源自演示运动学,而非记录的传感器数据
先有语料,再有以此构建的模型。
采集与部署只为构建一样东西:一份专有的、带动作标注的真实工业操作语料。机器人模型架构正在走向同质化,开放的 GR00T、开放的 LeRobot、开放的 π0,而其底层的数据不会。真正复利累积的,是这个循环,真实部署反哺语料,以及在其上构建的专用模型。
语料中的一切,皆因我们亲自采集才存在,一次一项交互,并随我们运行的每一项任务不断增长。循环每转动一圈,数据领先优势便再扩大一分。
目前尚无任何模型基于 Roborecs 数据训练,Roborecs 也尚未交付任何模型。模型层的开启取决于两道门槛:语料规模跨过已发表结果表明专用策略所需的门槛,且我们引入构建它所需的机器学习研究负责人。我们宁可明确说明这些门槛,也不愿暗示一个尚不存在的模型或团队。
我们的专用模型是任务策略,而非机器人,可运行于任何 LeRobot 兼容的技术栈之上。数据才是产品:授权给客户的任何语料,都会从我们自己的模型路线图中划出,因此我们绝不发布与数据客户相竞争的策略。我们确实会构建的策略,用于证明语料能产出什么。
示例策略 · 规划中
电子装配
面向连接器插接、线缆布线与螺丝紧固的专用视觉-语言-动作策略。基于装配语料的多模态通道后训练,在这些任务中,一毫米即决定成败。以 LeRobot 兼容格式交付。
精密配套
在严格公差下将零件从料箱放置到夹具。相同语料,不同任务族。
这些模型位于开放基础模型的下游。基于语料后训练,并以同一套 LeRobot 兼容格式交付。与 NVIDIA Isaac GR00T N1.7、Physical Intelligence π0 兼容,而非竞争。