返回职位列表
社会招聘

资深 AI Infra 工程师(大模型训练与推理性能优化)

北京
全职
资深
相关专业背景

岗位介绍

  • 你将负责大模型(LLM、VLM、多模态及具身智能 VLA 模型)从训练到推理的全链路性能、扩展性与稳定性。在数百至数千卡集群上设计和优化分布式训练策略,持续提升模型算力利用率(MFU);同时研发高性能推理引擎,降低延迟、提升吞吐,将算法创新稳定地工程化落地。

岗位职责

  • *训练方向
  • 负责千亿级参数大模型的分布式训练架构设计与性能调优,提升大规模 GPU 集群上的训练吞吐与扩展效率。
  • 设计并落地数据并行、张量并行、流水线并行、序列并行、专家并行等混合并行策略,解决多机多卡训练中的通信瓶颈。
  • 围绕计算、通信、存储、I/O、显存与调度进行全栈性能优化,持续提升训练效率与 MFU。
  • 基于 Megatron-LM、DeepSpeed、PyTorch FSDP 等框架优化预训练、SFT 与 RLHF 流程,并支持多模态、复杂结构和超大参数模型演进。
  • 建设快速或异步 Checkpoint、容错、异常检测与自动恢复机制,保障长周期大规模训练稳定运行。
  • 将长序列、FP8 / FP4、计算通信重叠、高效流水调度、算子融合等前沿技术转化为工业级工程能力。
  • *推理方向
  • 研发并优化高性能模型推理引擎,降低服务延迟、提升吞吐与资源利用率。
  • 深度应用 vLLM、TensorRT-LLM、SGLang、Triton 等推理框架,并针对 FlashAttention、PagedAttention 等关键路径开展内核级优化。
  • 优化计算图编译、Continuous Batching、KV Cache 管理等核心推理链路。
  • 探索并落地 PTQ、QAT、FP8、INT8、剪枝与知识蒸馏等模型压缩和部署技术。
  • *技术演进与协作
  • 持续跟进高效通信、低精度计算、FlashAttention、RL 训练框架等 Infra 技术,推动预研成果转化为生产力。
  • 与算法、模型及研究团队协作开展原型验证、性能评估与生产落地,兼顾模型效果与训练、推理效率。

任职要求

  • 具备大规模分布式系统、GPU 训练或推理基础设施、高性能计算、ML System 等方向的研发经验;负责过千卡级大模型训练或部署者优先。
  • 精通 Python 与 C++,具备扎实的数据结构、算法和并发编程基础,熟练掌握 PyTorch;熟悉 TensorFlow 或 JAX 者优先。
  • 熟悉 Transformer 底层机制及 Qwen、Llama、GPT、DeepSeek 等主流大模型架构。
  • 精通 Megatron-LM、DeepSpeed、FSDP 中至少一种分布式训练框架,深入理解 DP、TP、PP、EP、SP 等并行策略,以及 PyTorch、CUDA、NCCL 训练栈。
  • 熟悉 GPU 架构、显存层次与分布式计算原理;熟悉 CUDA / Triton 编程并具备自定义高性能算子开发经验者优先。
  • 具备训练或推理性能优化实战经验,能够围绕显存、通信、吞吐与延迟开展系统分析和优化。
  • 熟练使用 Nsight Systems、Nsight Compute、PyTorch Profiler、pdb、gdb 等性能分析与调试工具。

加分项

  • 熟悉 XLA / OpenXLA、torch.compile、MLIR、TensorRT-LLM 等编译器或运行时技术。
  • 熟悉强化学习算法及其大规模并行训练框架。
  • 在 Hugging Face、vLLM、DeepSpeed、SGLang 等开源项目中有贡献。
  • 在 OSDI、SOSP、NSDI、MLSys、NeurIPS、ICML、ICLR、ACL 等会议发表过相关论文。

对这个职位感兴趣?

点击下方按钮提交申请,我们会尽快审阅您的简历