自我视角、多模态人类示范数据 · 面向物理 AI

物理 AI 背后的数据,以及以此构建的模型。

人形机器人必须学会精细的双手作业,这类工作无法通过编程实现,只能在实践中习得。Roborecs 在欧盟采集这类数据,从第一人称的人类示范起步,并逐步补充摄像头无法捕捉的力与触觉。我们采集这类数据以授权给机器人厂商,同时构建由其驱动的专用模型。

第一人称素材结构化训练数据

瓶颈所在

机器人数据无法从网络抓取,只能采集而来,一次一项示范。

~5,000
现存的全部开源机器人操作数据小时数。DROID 与 Open X-Embodiment 合计。
数百万
一个人形机器人基础模型达到可靠水平所需的数据小时数。

谁能以规模化、低成本且在明确知情同意下采集这类数据,谁就将成为行业的供给方。这正是 Roborecs 的使命所在。

来源:Scale AI · Bessemer Venture Partners

( 01 / 02 )

数据

什么是自我视角采集、它覆盖的完整任务范围,以及证明其可训练机器人的研究。

我们采集什么

自我视角数据,就是一个人在完成任务时所看到的一切

它以机器人在实际部署时所具有的第一人称视角记录下来。我们的采集设备,一套 300 度头戴式相机加上每只手腕各一台相机,从任务内部记录场景、双手、接触与步骤顺序,而非依赖墙上的一台相机。

Wall-camera third-person view of a maker at a workbench, their back turned so the hands and the work are hidden
外部视角 · 第三人称

模型从外部学会识别任务。

First-person head-mounted-camera view of the same task, both hands and the point of contact clearly visible
自我视角 · 第一人称

模型从内部学会执行任务,与机器人在运行时所见完全一致的视角。

墙上的相机永远看不到手的抓握,操作员的视角却能看到。

这类数据在机器人训练中的位置

  • 机器人遥操作
    数量最少,成本最高
  • 仿真与合成
    生成数据,中等规模
  • 人类自我视角视频
    覆盖最广、成本最低、与具身形态无关
    Roborecs 在此层采集

基础模型先在人类视频这一宽广的底层上完成预训练,再向上逐层微调。底层是规模最大、成本最低、复用性最强的一层,也是无法以训练所需的保真度抓取的一层。此框架参考 NVIDIA Isaac GR00T N1。

任务多样性

各类体力劳动,尽在第一人称视角

以第一人称记录机器人必须学习的各类任务,从厨房台面到工作台,再到工业现场,均通过头部与腕部相机装置采集。

每次采集 · 7 路 RGB · 深度 · IMU · 音频 · 姿态 · 空间轨迹

日常操作
  • First-person capture: 自行车保养
    自行车保养
  • First-person capture: 果蔬采摘
    果蔬采摘
  • First-person capture: 包制饺子
    包制饺子
  • First-person capture: 剥虾
    剥虾
  • First-person capture: PCB 焊接
    PCB 焊接
  • First-person capture: 刀工切配
    刀工切配
现场与工业场景
  • First-person capture: 物流拣配
    物流拣配
  • First-person capture: 数控加工
    数控加工
  • First-person capture: 砌砖
    砌砖
  • First-person capture: 钳工作业
    钳工作业
  • First-person capture: 质量检测
    质量检测

代表性采集任务与场景,用于说明该项目所记录的多样性。

证据

从自我视角数据起步的理由。

01 · 研究已经证明

以下均为外部研究结果,并非 Roborecs 自测数据。

+54%

在 20,000 小时以上人类自我视角视频上预训练后,机器人任务成功率相较从零训练的提升幅度。

NVIDIA EgoScale
400%

仅用 90 分钟第一人称采集所带来的任务表现提升。

EgoMimic · Georgia Tech
70%

每项任务仅用 20 分钟人类数据、训练中不含任何机器人数据,在 7 项任务上取得的成功率。

EgoZero
5.8x

跨具身形态泛化能力的提升倍数。

DexWild

02 · 我们为何从这里起步

遥操作
自我视角采集
设备成本
每个工位 $5k 至 $50k
每位采集者几百美元
每日采集时长
每位操作员 2 至 4 个有效小时
整个工作日,被动佩戴
具身形态
锁定单一机器人
与具身形态无关

对大多数操作任务而言,一小时自我视角采集可媲美一小时机器人遥操作,成本却仅为其一小部分。而对力与接触至关重要的任务,正是第二阶段精度层的用武之地。

来源:roboticscenter.ai、Unidata、EgoMimic、HumanScale

03 · 该领域的数据规模

前沿模型所学习的数据集中的自我视角视频小时数。

Apple
829
1,286
Meta
3,670
NVIDIA
20,854

Roborecs 正是为产出这一类数据资产而建:多模态、带动作标注、并在欧盟完成知情同意采集。

平台

数据是如何制成的。

运行流程、八条同步采集通道、索非亚精度设施,以及由语料训练而成的专用模型。

探索平台
( 02 / 02 )

公司

护城河、市场信号与团队。

战略区位

地处欧洲深科技与亚洲制造的交汇点。

索非亚位于欧洲深科技实验室与亚洲机器人供应链之间,紧邻欧盟的精密制造基地,涵盖电子与汽车产业。那里正是人形机器人最先落地之处,也是欧盟法域内训练数据的天然市场。保加利亚的成本基础带来运营优势,欧盟法域则是护城河。

法兰克福苏黎世慕尼黑伊斯坦布尔特拉维夫迪拜上海首尔东京新加坡旧金山波士顿索非亚
欧洲深科技Frankfurt · Zürich · Munich
亚洲 OEM 枢纽Shanghai · Seoul · Tokyo
美国机器人San Francisco · Boston
贸易与科技门户Tel Aviv · Istanbul · Dubai · Singapore
欧盟法域GDPR · AI Act Article 10
欧盟成员国身份
GDPR + AI Act 原生合规
劳动力成本
约为英国 / 德国 / 法国的 ⅓
STEM 人才储备
每年 50,000+ STEM 毕业生
能源成本
低于欧盟平均水平
运营优势
OPEX(运营支出)降低 30-50%

溯源 · 知情同意 · 法域

欧洲人形机器人厂商可合法部署的训练数据。

已获知情同意逐场次全程溯源GDPR 原生合规对齐 EU AI Act 第 10 条

每一段素材都附带数据卡与完整的保管链。自 2026 年 8 月起,EU AI Act 要求训练数据具备完整的溯源与知情同意记录。我们从第一次录制起便将其内建,而非在审计前才临时加装。

阅读完整论述:欧洲的物理 AI

“我们的欧盟法域来自公司架构本身,而不只是数据所在地。根据美国 CLOUD Act,总部位于美国的数据供应商无论服务器位于何处,都仍受美国传票约束。总部位于欧盟的人形机器人客户无法忽视这一点。”

欧盟政策正朝同一方向发展:2026 年 6 月的欧盟技术主权一揽子计划与拟议中的《云与人工智能发展法案》,正引导公共部门和受监管的采购方转向不受第三国法律管辖的供应商。

公司治理承诺 · 无美国实体 · 无美国控股关系 · 无美国业务关联
主权机器人数据欧盟司法管辖

数据驻留不等于数据主权

数据存放在欧盟的服务器上,若控制它的是一家非欧盟公司,它便未真正受欧盟管辖:美国 CLOUD Act 仍可强制其交出。Roborecs 按公司架构归于欧盟司法管辖,因此知情同意、溯源与控制权自始至终都留在欧洲。

与我们合作
市场时机 · 为何是现在2025 → 2027

欧洲还没有开放的数据层。我们正在构建它。

具身智能数据基础设施是下一个重要的可投资赛道,而市场已经开始为其注资。Roborecs 正在构建其中的欧洲节点。

2025
赛道点燃
人形机器人领域投资超 $6B

人形机器人累计投资突破 $6B。基础模型实验室开始争夺物理世界的训练数据。

Nov 2025
美国 · 家庭数据
Sunday Robotics 融资 $35M

Benchmark 与 Conviction 押注家庭动作捕捉模式。零工佩戴传感手套,美国的家庭数据层逐步成形。

Jan 2026
美国 · 基础模型
Skild AI 融资 $1.4B

SoftBank、Bezos Expeditions、NVentures 押注匹兹堡的通用机器人基础模型。营收在数月内从 $0 攀升至 $30M ARR。

Early 2026
中国 · 规模
中国具身智能融资 $4.1B

20+ 家公司估值超 $1.4B。AgiBot 开源 AGIBOT WORLD 2026。规模化打法牢牢由中国主导。

Jun 1, 2026
美国验证数据供给
Mecka AI 融资 $60M

Framework Ventures 领投本轮。面向机器人训练的人体动作数据采集,如今已成为可独立获得融资的赛道,并获得机构资本的验证。

行业验证

欧洲融资额最高的机器人公司已经印证了这一论断。

NEURA Robotics 证明了欧洲能够引领物理 AI 训练。Roborecs 则将供给侧规模化,向每一家人形机器人厂商开放,而非被垂直整合进单一硬件公司。

NEURA Gyms 是实体训练设施,机器人在受控的变化条件下反复演练复杂任务,由此产生物理 AI 最稀缺的资源:高质量的真实世界训练数据。

NEURA Robotics, April 2026
市场与合作伙伴

没有哪一家厂商能够独自采集到通用操作策略所需的、已获知情同意且位于欧盟法域的广泛多样数据。

重点客户群
Chinese humanoid OEMs

中国厂商主导人形机器人的规模化,并正扩展至欧洲,而已获知情同意、位于欧盟法域的采集,正是外国厂商无法自行运营的。

接洽推进中
EPFL · ETH Zürich · TU Munich · Imperial College

学术研究合作与试点项目。经由保加利亚-中国商会渠道,触达更多中国人形机器人厂商。

符合我们的数据画像
Figure · 1X · Agility · Apptronik

基于多模态物理数据训练的人形机器人厂商与 VLA 实验室。以 Bosch、Schaeffler、Volkswagen、Siemens 为下游集成商,触达欧盟工业企业。

与我们合作

采集你的机器人无法独自获取的数据。

我们为人形机器人厂商与 VLA 实验室搭建欧盟法域内的数据采集项目:视觉、本体感知、力/力矩、IMU 与音频,均以 LeRobot 兼容格式交付。告诉我们你的机器人与目标任务,我们将为你规划试点方案。

开始洽谈 →
团队

Roborecs 背后的团队。

Latchezar Dinev,Roborecs 的 CEO
Latchezar Dinev
CEO

连续创业者。1996 年创办 Internet Bulgaria。保加利亚-中国商会主席:一个网络,既对接用于采集的保加利亚合作工厂,也触达作为买家的中国人形机器人厂商。

Konstantin Dinev,Roborecs 的 CTO
Konstantin Dinev
CTO

EPFL 机器人与 AI 硕士。专注标定、传感器特性分析与力控操作,以保障多模态数据质量。

+ 法律合作伙伴,索非亚一家 20 人律所,自第一天起即覆盖 GDPR、IP(知识产权)、EU AI Act 合规。

面向投资者

与我们一起构建欧洲面向人形机器人 AI 的数据供给。

我们从第一人称的人类示范起步,在欧盟采集,并附带完整的知情同意与溯源记录。接下来是精度层,为接触密集的装配补充力与触觉,随后是由语料驱动的专用模型。这是在一条市场已经出资押注的赛道中,以欧盟法域、自我视角优先切入的定位。

我们的进展
转售渠道
通过一家成熟人形机器人厂商合作方分发(保密协议下)
2026 下半年
自我视角采集在索非亚启动
约 8 小时/天
每个操作员工位的设计采集吞吐量
3 家厂商
通过保加利亚-中国商会直连中国人形机器人厂商

EU AI Act(欧盟人工智能法案)的核心义务自 2026 年 8 月起适用。根据 2026 年的 Digital Omnibus,针对嵌入受监管产品(包括机器人)的 AI,高风险规则将自 2028 年 8 月起适用。对欧盟法域内多模态训练数据的需求正在加速增长,其速度超过了美国或中国的供应商能够合法向欧洲人形机器人客户供货的速度。

索取投资者材料

索取投资者材料。

我们向合格投资者提供投资者材料与数据室访问权限。发送邮件,创始人将在 24 小时内回复。

索取材料 →

常见问题

合作伙伴与投资人常问的问题。

数据归谁所有?

你获得的是一份边界清晰、已获知情同意、并附完整溯源的语料授权。Roborecs 保留在聚合数据之上构建自有专用模型的权利。定制委托可包含完整的知识产权转让。

示范者的知情同意如何处理?

每位操作员在采集前均签署数据使用与肖像授权。录制内容逐场次全程溯源,并在源头完成匿名化:GDPR 原生合规,并对齐 EU AI Act 的溯源要求。

你们以什么格式交付?

LeRobot v3 与 HDF5,各通道均带亚毫秒级时间戳,兼容 NVIDIA Isaac GR00T N1.7 与 Physical Intelligence π0 的训练流程。我们不声称任何模型基于我们的数据训练;我们只交付整个生态已在使用的格式。

为何从自我视角采集起步,而非遥操作?

它是成本最低、最具扩展性的一层;2025 至 2026 年的研究(EgoScale、EgoMimic、HumanScale)表明,人类第一人称数据训练机器人的效果可媲美遥操作,成本却低得多。相机无法承载的力与触觉,属于第二阶段的精度层。

你们与 NEURA、遥操作数据供应商,或自行采集数据的机器人厂商有何不同?

我们从自我视角的人类示范起步,而以遥操作为先的供应商则从成本最高的一层入手。我们是中立的数据供应方,而非机器人厂商,因此任何 OEM 都可授权使用该语料,而不必担心为竞争对手的数据管线添砖加瓦。我们凭借公司架构在欧盟法域内采集,知情同意与溯源从第一次录制起即已内建。NEURA 正投入 €17M 建设服务于自家机器人的内部设施;而我们构建的是整个行业都可授权使用的共享数据供给。

设施何时投入运营?

自我视角采集是我们起步的阶段。补充多模态精度的索非亚设施目标于 2027 年第三季度上线。我们明确区分当下交付的内容与接下来构建的内容,也不以现在时描述这座设施。

合作伙伴如何开展试点?

告诉我们你的机器人与目标任务。我们会规划采集方案、商定样本规格,并在任何批量承诺之前先交付一套评估数据集。发送邮件至 [email protected],创始人将在 24 小时内回复。