GPU基建算力infra 工程师

社会招聘· infra部· 上海· 本科及以上· 截止 2026-08-31

工作职责

多云GPU集群管理

  • 统一管理来自多个供应商的GPU资源,抹平环境差异

  • 设计并实现供应商抽象层,让上层用户无需关心任务跑在哪个平台

  • 制定供应商选择策略:根据任务类型、稳定性需求分配到最合适的平台

环境标准化与容器化

  • 用Docker/容器化封装训练环境,确保任何供应商的机器上行为一致

  • 构建自动化节点初始化流程:新机器到手后快速变成可训练的标准节点

  • 维护GPU驱动、CUDA 13、NGC等软件栈的版本管理和镜像构建流水线

任务调度与资源编排

  • 搭建和维护GPU任务调度系统(Slurm / Kubernetes )

  • 实现多租户资源隔离、优先级管理、公平调度等策略

  • 优化集群利用率,减少GPU空闲浪费

分布式训练支持

  • 保障多节点分布式训练的稳定运行,调优NCCL通信性能

  • 设计健壮的Checkpoint管理和训练自动恢复机制

  • 配合研究员调试分布式训练问题(hang、通信超时等)

存储与数据基础设施

  • 规划训练数据和Checkpoint的存储架构(如云存储,高I/O,高带宽,自建高性能文件系统)

  • 确保跨供应商的数据一致性和可访问性

可观测性与故障处理

  • 搭建全方位GPU监控体系,覆盖利用率、显存、温度、网络吾吐等

  • 设计自动化健康检查和故障恢复流程,特别是针对不稳定供应商的节点丢失场景

  • 训练任务异常告警,确保问题及时发现而不是几小时后才知道

成本管理

  • 持续监控和优化算力成本,对比不同供应商的性价比(考虑稳定性、网络质量、运维成本)

  • 制定算力采购策略:长约保底 + 短期弹性的组合方案

必备技能

多云编排:有管理多个GPU供应商的实战经验;熟悉多云编排工具优先

容器化:Docker深度使用者;能用容器将训练环境封装,减少不同供应商的差异调度系统精通Slurm!!

网络与通信:深入理解NCCL通信机制;能在不同网络条件下调优多节点通信性能

分布式训练:理解主流分布式训练框架(Megatron-LM、DeepSpeed、FSDP)和并行策略(TP/PP/DP/EP)

容错设计:能设计健壮的容错机制:自动checkpoint、训练自恢复、节点丢失自动替换——尤其是在不稳定供应商环境下

存储:熟悉高性能文件系统和对象存储,能规划存储分层策略监控能搭建GPU的精细监控和告警体系

加分项

  1. 有算力成本优化经验,做过供应商性价比分析和采购策略制定

  2. 参与过基础模型的完整训练流程(从集群搭建到模型训练完成)

  3. 对GPU硬件架构有深入理解(NVLink、NVSwitch、Blackwell、GraceBlackwell架构等)

  4. 有安全意识:理解在第三方硬件上训练的数据安全风险,能设计相应的防护措施

  5. 有开源项目贡献或技术博客输出

  6. 熟悉vLLM等推理框架的部署,NGC 训练框架