返回职位列表
社会招聘

机器人后训练工程师(VLA/WAM & Real-world RL)

北京
全职
真实机器人部署经验
相关专业背景

岗位介绍

  • 作为后训练与真机部署的核心驱动者,你将推动具身基础模型从“数字大脑”走向“物理实体”,直接参与模型在真实机器人上的训练、部署与闭环优化。

岗位职责

  • VLA 与 WAM 后训练:负责 Vision-Language-Action(VLA)及 World/Action Model(WAM)的 SFT、RLHF 与 DPO 流程;面向高维连续动作空间设计高效微调范式,降低多模态输入下的动作幻觉与时序不一致。
  • Real-world RL:在真实人形机器人或复杂硬件系统上设计并部署高样本效率的在线强化学习算法,重点解决安全探索、环境动态适配与真实物理反馈下的奖励建模问题。
  • 真机部署与闭环优化:主导策略模型在 NVIDIA Jetson 等边缘计算节点上的高性能部署与 TensorRT / ONNX 优化,打通高层视觉语言规划与底层 WBC / MPC 控制链路,系统解决时延、频域不匹配与高频抖动问题。
  • 数据驱动的行为对齐:利用 Human-in-the-loop 接管数据与边缘案例构建在线修正飞轮,从失败模式出发持续提升模型在开放场景中的泛化能力与物理常识。

任职要求

  • 计算机科学、机器人学或相关专业背景,对 PPO、SAC、TD3 等深度强化学习算法,以及 Diffusion Policy、Transformer-based Control 等生成式动作架构具有扎实理解。
  • 熟悉 StarVLA、π0.5、GR00T、Cosmos 或相关 World Model 架构;具备 VLM / LLM 微调与对齐经验者优先。
  • 必须具备在双足人形机器人、四足机器人、高自由度灵巧手等真实复杂硬件上成功部署端到端策略的实战经验,能够处理电机特性、传感器噪声、摩擦与接触等真实物理问题。
  • 精通 Python / C++,熟悉 Linux / Tmux 开发环境,能够开发高性能算子或自定义 C++ 部署环境。
  • 具备较强的自动化意识,善于使用 Agentic AI 开发工具提升研发效率与实验迭代速度。

加分项

  • 在真实世界中跑通闭环 Real-world RL,并取得明确的科研或业务成果。
  • 深入理解 Sim-to-Real-to-Sim 飞轮,具备利用真机残差数据优化 Isaac Sim、MuJoCo 等仿真参数的系统辨识经验。
  • 在高动态运动控制或精细灵巧操作方向有深厚积累。

对这个职位感兴趣?

点击下方按钮提交申请,我们会尽快审阅您的简历