最后更新:
Axis Robotics 是一家专注于物理人工智能(Physical AI)和机器人学习的模拟基础设施机器人公司。该公司成立于 2025 年,致力于开发用于在模拟和真实环境中收集、增强及训练机器人数据的系统。 [1]
Axis Robotics 是一个物理 AI 基础设施项目,专注于通过基于浏览器的模拟收集和处理机器人训练数据。用户通过远程操作模拟机器人手臂来执行操纵任务,从而生成包含机器人状态、物体位置、控制动作和任务元数据的轨迹。系统处理这些轨迹,并使用基于 IsaacSim 的后端创建额外的、具有照片级真实感且经过领域随机化处理的训练样本。每条被采纳的轨迹都会获得一个记录在 Base 上的唯一数据 ID(Data ID),以提供可验证的出处记录。
AXIS 技术栈由四个阶段组成:世界生成、行为收集、数据精炼以及模型训练与部署。自然语言指令通过 3D 资产库和自动化场景生成工具被转化为结构化任务和模拟环境。收集到的轨迹在模拟中回放以生成扩展数据集之前会经过清洗和筛选,这些数据集随后被用于训练模仿学习策略和视觉-语言-动作(VLA)模型。生成的策略在模拟中进行评估,并在物理机器人上进行测试,目前该系统使用 Franka Research 3 进行模拟到现实(sim-to-real)的验证。[3]
RoboVerse 是一个模拟框架,它提供了一个跨多个机器人模拟器的通用接口,允许在数据采集、增强、原型设计和评估的不同阶段使用不同的后端。AXIS 使用编译为 WebAssembly 的 MuJoCo 进行基于浏览器的数据采集,在 GPU 基础设施上使用 IsaacSim 进行轨迹回放和写实增强,并使用原生 MuJoCo 进行快速开发和评估。该系统建立在 MetaSim 之上,MetaSim 提供独立于模拟器的场景描述、标准化资产、自动转换为原生模拟器格式以及程序化场景生成,允许任务定义、轨迹和资产在支持的模拟环境之间移动。
RoboVerse v2 将此框架扩展为更广泛的数据生成和模型开发流水线,重点关注任务、环境、行为和视觉条件的变体。它增加了对人形、四足和灵巧机器人平台的支持;为强化学习、模仿学习和视觉-语言-动作(VLA)模型提供了标准化接口;实现了自动化场景和资产生成;以及连接任务创建、遥操作或基于策略的数据采集、领域随机化、模型训练和现实世界部署的流水线。其评估方法强调跨模拟器、布局、物体、视觉条件和物理机器人的泛化能力,而非在单一固定基准上的表现。[4]
AXIS 使用基于浏览器的遥操作系统,该系统围绕编译为 WebAssembly 的 MuJoCo 构建,允许完整的物理模拟在本地运行,无需专门的硬件或软件安装。Three.js 和 WebGL 提供实时 3D 渲染,而嵌入式逆运动学求解器将末端执行器输入(如位置、旋转和夹持器状态)转换为关节级指令。物理、渲染和用户界面独立运行以减少延迟,而轨迹数据在操作期间进行缓冲,并在嵌入式检查器验证任务完成后,与任务元数据一起打包成标准化的 JSON 文件。
该系统还为不同的机器人形态(包括平行爪夹持器和灵巧手)提供了一种通用的控制方法。预定义的抓取模板代表不同的操作配置,操作员只需调整单个参数即可在开放休息位置和选定的抓取动作之间进行插值,从而将复杂的多关节手部控制简化为一个输入轴。通过定义休息位置和相关的抓取模板,可以在不改变底层遥操作系统的情况下整合新的机器人形态。[4]
AXIS 使用 IsaacSim 在 Linux GPU 服务器上处理浏览器采集的机器人轨迹。在回放期间,系统会对光照、纹理、材质、背景、相机设置以及物理参数(如质量、摩擦力、阻尼和关节顺性)应用写实渲染和领域随机化。这些变体旨在让模型接触不同的视觉和物理条件,而不是针对单一固定的模拟环境进行训练。增强系统还从多个虚拟相机视角生成观测结果,为每条轨迹生成 RGB、深度和分割数据。因此,单个原始演示可以扩展为数千个在外观、视角和物理条件下各不相同的样本,同时保留原始行为。这种方法在保持与演示任务一致性的同时,增加了训练数据集的规模和变异性。[4]
RoboVerse 领域随机化 (DR) 系统旨在通过改变模拟环境中的视觉和物理条件,减少机器人强化学习和模仿学习中的过拟合。它将场景生命周期管理与属性编辑分离:SceneRandomizer 负责创建、移除和替换物体,而专门的随机化器则修改材质、光照和摄像机参数。ObjectRegistry 为访问模拟物体提供通用接口,而三层场景层级结构则将宏观环境、操作工作空间和视觉干扰物分开。该系统同时支持启用物理的静态物体和运行时管理的视觉物体。
随机化是逐步应用的,以支持受控实验,从基准线开始,在后续级别中依次添加场景几何形状和材质、光照以及摄像机变化。独立的随机数生成器和固定种子允许实验(包括在分布式训练期间)可复现,同时该系统可跨 IsaacLab(用于物理)和 IsaacSim(用于渲染)工作。它还整合了自动化资产处理,包括基于云的资产数据集和 URDF 到 USD 的转换,并具有旨在用于重复环境重置的高内存效率场景操作。 [4]
AXIS 数据流水线在人类数据采集前自动化任务创建,并在采集后进行轨迹处理。其任务生成引擎将自然语言指令转换为结构化的操作任务,从拥有 2,000 多个物体的数据库中选择或生成 3D 资产,创建空间布局,验证生成的场景,并生成特定任务的成功检查。然后,它对物体位置、杂物和摄像机视角进行变体采样,以生成同一任务的不同实例。该平台涵盖了 90 多个任务类别,包括取放、推、排序、倾倒、开关、堆叠和多步操作。
在远程操作之后,轨迹会经过过滤以剔除损坏数据、不合理的状体变化和失败的任务条件,同时移除静态帧,并将剩余动作平滑处理并从 6–8 Hz 上采样至 20 Hz。在 16 个 LIBERO 基准任务的测试中,该过程使平均加速度降低了 54%,平均加加速度(jerk)降低了 47%。清理后的轨迹随后在 IsaacSim 中回放,通过改变光照、材质、纹理、物理参数、背景和摄像机视角来生成多视图 RGB、深度、分割和其他标注,同时保留原始任务行为。生成的数据集被结构化,用于视觉-语言-动作 (VLA) 和模仿学习训练。 [5]
AXIS 使用策划和增强的模拟数据训练两种主要类型的机器人策略:特定任务的行为克隆和扩散策略模型,以及通用视觉-语言-动作 (VLA) 模型。训练过程通过比较原始远程操作数据、清理后的轨迹以及通过 IsaacSim 增强的清理轨迹,使用一致的任务定义和训练预算来衡量数据处理和增强的效果。策略在模拟环境中针对不同的物体配置、纹理、光照、物理参数和场景布局进行评估,然后在 Franka Research 3 机器人手臂上进行模拟到现实 (sim-to-real) 的迁移测试,涵盖取放、抽屉操作、倾倒和按按钮等任务。
该训练系统旨在评估主要基于模拟和合成数据训练的策略是否能在物理世界条件下运行。该项目的研究报告包括 GraspVLA(研究了基于模拟的机器人抓取训练)和 SkillBlender(解决了跨不同具身组合机器人技能的问题)。该系统存在若干已说明的局限性,包括在轨迹回放期间 MuJoCo 和 IsaacSim 之间的差异、远程操作数据中有限的密集标签和任务成功信号,以及在具有显著不同运动学和控制特性的机器人之间转移策略时需要进行特定具身的适配。 [6]
AXIS 架构分为四个技术层:世界生成(World Generation)、行为采集(Behavior Collection)、数据精炼(Data Refinement)以及模型训练与部署(Model Training & Deployment)。L1 层利用自然语言任务规范和资产库,通过 MetaSim 场景描述系统创建与模拟器兼容的环境。L2 层允许用户通过基于浏览器的界面控制模拟机器人,将来自键盘、手机、游戏手柄和 VR 等设备的输入转换为标准化的机器人轨迹,并将采纳的数据在 Base 上分配链上溯源记录。L3 层对这些轨迹进行清洗,并利用基于 IsaacSim 的 GPU 处理和领域随机化技术,将演示扩展为包含几何形状、材料、光照、相机设置和物理特性变化的更大规模数据集。
L4 层利用生成的数据集来训练行为克隆(behavior-cloning)、扩散策略(diffusion-policy)以及视觉-语言-动作(Vision-Language-Action)模型。在进行物理硬件的模拟到现实(sim-to-real)测试之前,这些模型会接受针对不同模拟器、环境和机器人形态的泛化能力评估。该架构分离了各层之间的职责,并使用标准化的数据接口,因此可以在不要求更改整个系统的情况下修改单个组件。溯源性贯穿整个流水线,通过数据 ID(Data IDs)将轨迹、增强数据集和训练好的模型链接回其原始数据源。[3]
2026 年 7 月,AXIS 宣布完成 1200 万美元的种子轮融资,由 Hack VC 领投,Nomad Capital、Pi Core Team Ventures、10K Ventures 以及天使投资人参投。该公司表示,这笔资金将用于支持物理人工智能(Physical AI)数据基础设施平台的开发,该平台结合了大尺度模拟、现实世界的第一人称视角数据采集以及人类在环(human-in-the-loop)的后训练,旨在生成结构化的机器人数据集。AXIS 将该系统描述为一个闭环数据流水线,旨在支持物理人工智能模型的持续开发和优化。[2]
2026年7月31日。16:39 UTC
编辑摘要:
Updated events (2 -> 2 items)