事件相机 vs 帧相机:为那 33 毫秒的盲区付费值不值
事件相机以微秒级速度捕捉高速接触,帧相机则有成熟的生态。何时该为那份速度付费?
博客
人形机器人如何学习、它们的训练数据从何而来,以及为什么数据层正成为真正的瓶颈。为工程师、运营者与投资人撰写的清晰、可溯源的文章。
事件相机以微秒级速度捕捉高速接触,帧相机则有成熟的生态。何时该为那份速度付费?
机器人策略在哪里运行,决定了它能有多快的反应,也决定了你必须采集什么样的数据。
为什么双臂操作数据的代价远不止单臂的两倍,协调税从何而来,以及两只协调的手对采集提出了什么要求。
动作捕捉套装锁定指尖精度,无标记视觉在真实环境中规模化。本文讲清人类采集中真实的成本与精度权衡。
手腕相机看见指尖,第三人称视角看见整个房间。本文讲清每种视角教给操作策略什么,以及为什么你要把两者都采下来。
深度相机何时值回它的带宽,何时仅凭 RGB 就足以完成机器人操作,以及该采集什么,才不会在源头丢掉几何信息。
自监督学习让机器人从无标签的交互中学习,而不必依赖昂贵的人工标注;以及为什么自我视角视频是它天然的契合对象。
离线强化学习无需仿真器,就能把记录下来的机器人数据变成策略。它真正的潜力、唯一棘手的失效模式,以及它对数据的胃口。
同样的示范、同样的网络,只因特征不同,泛化结果就天差地别。表征学习如何悄然决定一个操作策略能否泛化。
把三十个可靠步骤串起来,任务仍会五次里失败四次。本文讲任务时程问题、长时程误差为何连乘放大,以及用什么数据来治它。
并非每段示范都能教会机器人。本文拆解单段示范的质量维度,说明坏示范为何会毒害模仿学习,以及它们如何层层放大。
片段式数据,还是连续的数据流?这个藏在每个机器人轨迹数据集背后的框架选择,决定了策略最终能学到什么。
目标条件策略把目标当作输入,于是一个模型可以追求多种目标。本文讲清让它奏效的成对数据,以及事后重标注这个技巧。
手工设计的奖励在真实世界的操作中会失效。本文讲清原因,以及由偏好、示范与视频学习出来的奖励模型如何取代它们。
本体感觉,即机器人对自身关节与用力的感知,是视觉被遮挡时操作所依赖的信号,也是被动视频无法提供的东西。
你选定的动作空间与观测空间,决定了一份数据集究竟能教会什么。这是一份关于那些比机器人更长寿的安静决策的指南。
机器人策略是从观测到动作的映射。看输出频率、动作格式、记忆与确定性如何决定你必须采集哪些数据。
行为克隆是机器人学习的主力方法。它为何成为默认选择,复合误差为何让它失效,以及更好的数据如何补救。
深入探讨数据驻留与数据主权之间的法律边界,以及为什么欧洲买家在采购人类演示机器人数据集时必须关注这一区别。
深入探讨领域随机化如何桥接机器人技术中的模拟与现实差距,它的局限性在哪里,以及为什么真实世界数据依然是终极瓶颈。
探讨模块化策略和技能基元如何解决机器人领域中的长时程任务难题,以及为什么我们的数据策略必须为此做出改变。
仅依赖视觉的模仿学习在接触边界处往往会失效。我们深入探讨主动力反馈如何彻底改变操作员的表现以及具身智能数据的保真度。
探讨如何从第一人称视频中提取 21 个关键点坐标,从而解决双手指尖精细操作中的人机手部动作重定向难题。
欧洲对物理 AI 的押注是真实的,且资金充裕。但硬件与算力可以自由流动,真正搬不走的输入,是具备欧盟司法管辖权的示范数据。
把机器人数据集放在欧盟服务器上,是数据驻留,不是数据主权。为什么美国 CLOUD Act 能够触及欧盟托管的数据,以及真正的控制权需要什么。
世界模型让人形机器人从原始视频里学习动力学,无需机器人进入环路。为何每家实验室都在造一个,以及从视频学习会在哪里失灵。
机器人学习为何统一到第一人称(egocentric)视角,以及在欧洲采集这类数据,如何把知情同意、溯源与 GDPR 变成买家开始索要的数据集规格。
互联网上躺着数十亿小时的人类活动视频。网络视频真正能教给机器人什么,它撞上的那堵墙在哪里,以及仍必须刻意采集的那味成分。
在 EU AI Act 之下,数据溯源不再是事后的文书工作,而是你必须设计进采集流程的工程规格。为什么采集当时就留档才是赢家。
部署、采集、重训:机器人数据闭环真实存在,但只有当你挖掘失败而非堆砌小时数时,它才会复利。一篇面向工程师、OEM 与投资人的行业观察。
从司法管辖、GDPR 合规、数据多样性、贴近欧洲机器人 OEM 与人才这五个维度,论证机器人训练数据为何值得在欧洲采集。
更多数据是否意味着更好的机器人策略?LLM 的 scaling laws 类比在 VLA 模型上何处成立,又在哪三个关节上失效。
一份欧洲物理 AI 的实地地图,不按硬件、而按每个玩家从何处获取训练数据来绘制:从 NEURA 到工厂试点,再到塑造一切的监管背景。
第一人称机器人示范数据记录的是真实的人,因此 GDPR 完整适用:同意、数据最小化与删除权,都成了采集当时的工程问题。
一份 2026 年人形机器人公司的实地指南,不按硬件而按数据战略绘制版图:远程操作、仿真、人类视频与共享语料,以及数据层为何日益成为竞争与合规的关键。
2026 年,人形机器人已走上工厂车间,但只是狭窄、有人监督的试点。它们究竟在哪里工作、做什么,以及为何每一个试点同时也是一个数据采集项目。
一台机器人、一套采集装备、一个传感器阵列,都在生成机器生成数据。EU Data Act 如何重塑谁能访问、分享和许可机器人训练数据,以及它与 GDPR、EU AI Act 有何不同。
硬件正在趋同,人形机器人的护城河已转向专有机器人数据。第一人称示范数据,为何是真正能够复利累积的资产。
C2PA 原本用来标注 AI 生成的媒体。同一份经签名、防篡改的清单也能套在机器人训练数据上,而 EU AI Act 之下的买方会开始索要它。
算力和模型架构都已就位,真正卡住具身智能的是真实世界的数据。深入这道数据瓶颈,以及它背后的数据金字塔。
硬件在出货,算力可租用。2026 年,卡住人形机器人的约束是训练数据。为什么那道墙移到了数据层,本文讲清楚其中的逻辑。
合成轨迹的数量已远超真实机器人数据,但真正能泛化的系统仍然两者兼用。本文讲清如何设定这一混合比例,也就是 sim data ratio。
从规模、传感器与溯源三个维度对比 Open X-Embodiment、DROID 与 RH20T,并解释为什么单看原始轨迹数量往往会误导判断。
第一人称示范数据会录下真实的人脸、住所与声音,天然就是个人数据。把隐私当作采集规格,而非事后的政策补丁:知情同意、源头匿名化、数据最小化与逐次溯源。
开源机器人模型之争的实战指南:LeRobot 生态与 Gemini Robotics 等专有技术栈如何较量,以及谁真正获益。
遥操作给出与机器人完全对齐的示范,代价高昂;人类视频提供廉价的规模,却需要你去重定向。一份关于两种数据供给取舍的对比。
只采集成功的示范会美化机器人策略,掩盖它真正会出错的地方。数据飞轮只有在你采集失败与险些失败并加以挖掘时,才会复利累积。
NVIDIA GR00T、Physical Intelligence pi0 与 Hugging Face LeRobot 用三种方式应对机器人数据短缺。一份关于架构与数据策略的对比,不评高下。
脚本轨迹干净又便宜,但在基础模型规模上真正带来泛化的是覆盖度。为什么人类演示数据是训练机器人策略更具扩展性的基座。
大多数机器人数据都假设机械臂被螺栓固定在桌上。而会走到物体面前再抓取它的机器人,需要把导航与操作耦合起来的数据。
机器人抓取物体的那一刻,RGB 视频就失明了。本文讲清触觉与力数据为操作带来了什么,以及为什么这类数据始终稀缺。
远程操作是当下大多数机器人操作数据的来源。走进采集流程:装置、延迟、标注,以及把录像变成训练信号的质检。
力、接触音频与深度,承载着富接触操作真正依赖、而 RGB 从不记录的信号。该采集什么,以及为何时间对齐才是最难的一环。
两指夹爪是一个已解决的数据问题,五指灵巧手做手内操作却不是,而教它所需的数据几乎不存在。为什么灵巧把数据的门槛抬得这么高。
Hugging Face 的 LeRobot 如何降低机器人学习的门槛:统一的数据格式、200 美元以内的机械臂,以及 ACT、π0 等可微调策略,还有它尚未解决的部分。
为什么机器人平台以 240 Hz 采集,策略却只在 30 Hz 上动作?拆解采集率与控制频率的区别,以及多速率感知的代价。
从主从采集装置到带标注轨迹,完整走一遍遥操作数据流水线:多路时钟同步、演示数据 QA 与轨迹 schema 的取舍,究竟在哪里决定成败。
一个机器人策略能在基准上拿到 90%,却依然在现场失败。策略评估的那些陷阱,以及如何诚实地测一个策略。
从模仿学习到预训练策略,再到第一人称人类视频,诚实地拆解一个人形机器人技能到底需要多少条演示数据,以及是什么在推动这个区间上下移动。
EU AI Act 对具身训练数据究竟有何要求:Article 10 的质量与数据治理规则、GPAI 的来源透明义务,以及机器人在 2026 至 2027 年的合规时间表。
真实机器人示范稀缺,于是团队用数据增强去拉伸它。讲清裁剪、扩散与回放能廉价补上什么,又无法伪造什么。
遥操作、仿真与第一人称视频,各自的每演示小时成本都不同。本文解释为什么真正主导机器人数据策略的,是这个数字而非模型规模。
预训练、后训练、sim2real 与评估不是一张清单,而是由数据和诚实评估闭合的同一个循环。一份写给工程师的机器人训练流水线实战指南。
为什么覆盖度胜过原始时长:拆解 TRI 关于 Large Behavior Models 的多样性发现,以及如何按数据质量而非规模去读一个机器人数据集。
每一条机器人示范都要真人来做,所以聪明的做法不是采得更多,而是采策略最该学的那些。本文讲主动学习:不确定性采样、分歧采样,以及把部署失败接回下一批采集。
EU AI Act 把训练数据的溯源变成了一个工程问题,而不只是法律问题。机器人学习数据集如何随每一帧携带司法管辖与同意,以及这为何要紧。
力和触觉信号,而非像素,决定着接触密集型操作。为什么 RGB 永远给不了这些信号,以及为什么触觉数据才是机器人基础模型真正的瓶颈。
第一人称人类视频把机器人移出采集环路,于是小时数很便宜。本文讲它为何能这样扩展,以及那道让它保持诚实的本体差距代价。
人手有二十多个自由度,机器人夹爪只有两个。重定向把一段示范改写进机器人的身体,而渗漏恰恰发生在这里。
语言标签、标定与时间同步,才是机器人数据标注的真实成本:为什么轨迹数量这类头条数字,掩盖了一个数据集是否值得用来训练。
头戴与腕部相机的第一人称采集,为什么比墙上的第三人称相机更适合教机器人操作,以及它真正的代价在哪里。
控制策略必须比世界变化得更快地输出动作(几十 Hz),可一个大的 VLA 单次前向就要 100 ms 上下。看看动作分块、异步推理、蒸馏与量化如何弥合这道鸿沟。
GR00T、pi0 和 Gemini Robotics 都是机器人基础模型,而非聊天机器人。VLA 是什么,它与 LLM 有何不同,以及为何数据才是真正的难点。
不谈数学,讲清楚一个 VLA 如何把相机像素和一句指令变成机器人的动作:骨干、动作生成、数据集与真实的局限。
仿真训练机器人成本低,却在接触、可变形物和人类情境上悄悄拟合不足。一份指南,讲清真实数据在哪些地方不容妥协。
微调把一个通用机器人策略变成能真正部署的策略。本文具体拆解 VLA 的 post-training:方法、数据、失效模式,以及诚实的评估。
人形机器人得用两条腿保持平衡,同时完成操作,每一次伸手都会挪动自身重心。为什么全身控制既难,又缺数据。
为什么多数机器人操作技术栈先用模仿学习、再考虑强化学习,各自何时取胜,以及两者如何结合。
DeepMind 把 Gemini Robotics 拆成负责推理的大脑与负责动作的身体。具身推理如何让一个 VLA 从记忆者变成规划者。
电容阵列、气压式 MEMS,以及 GelSight 式凝胶,各以不同方式赋予机器人手触觉。一份关于触觉传感器硬件及其取舍的实地指南。
为什么生成式模型(扩散与 flow matching)成了机器人基础模型产生多模态动作的默认方式,以及这对训练数据意味着什么。
一个策略如何驱动许多不同的机器人、异构的身体为什么让它变难,以及 Open X-Embodiment 到底证明了什么。
解析 vision-language-action 模型如何把连续的机器人动作变成 transformer 能预测的离散 token,以及这一选择为何决定了策略的分辨率上限。