GPU基建算力infra 工程师
工作职责
多云GPU集群管理
统一管理来自多个供应商的GPU资源,抹平环境差异
设计并实现供应商抽象层,让上层用户无需关心任务跑在哪个平台
制定供应商选择策略:根据任务类型、稳定性需求分配到最合适的平台
环境标准化与容器化
用Docker/容器化封装训练环境,确保任何供应商的机器上行为一致
构建自动化节点初始化流程:新机器到手后快速变成可训练的标准节点
维护GPU驱动、CUDA 13、NGC等软件栈的版本管理和镜像构建流水线
任务调度与资源编排
搭建和维护GPU任务调度系统(Slurm / Kubernetes )
实现多租户资源隔离、优先级管理、公平调度等策略
优化集群利用率,减少GPU空闲浪费
分布式训练支持
保障多节点分布式训练的稳定运行,调优NCCL通信性能
设计健壮的Checkpoint管理和训练自动恢复机制
配合研究员调试分布式训练问题(hang、通信超时等)
存储与数据基础设施
规划训练数据和Checkpoint的存储架构(如云存储,高I/O,高带宽,自建高性能文件系统)
确保跨供应商的数据一致性和可访问性
可观测性与故障处理
搭建全方位GPU监控体系,覆盖利用率、显存、温度、网络吾吐等
设计自动化健康检查和故障恢复流程,特别是针对不稳定供应商的节点丢失场景
训练任务异常告警,确保问题及时发现而不是几小时后才知道
成本管理
持续监控和优化算力成本,对比不同供应商的性价比(考虑稳定性、网络质量、运维成本)
制定算力采购策略:长约保底 + 短期弹性的组合方案
必备技能
多云编排:有管理多个GPU供应商的实战经验;熟悉多云编排工具优先
容器化:Docker深度使用者;能用容器将训练环境封装,减少不同供应商的差异调度系统精通Slurm!!
网络与通信:深入理解NCCL通信机制;能在不同网络条件下调优多节点通信性能
分布式训练:理解主流分布式训练框架(Megatron-LM、DeepSpeed、FSDP)和并行策略(TP/PP/DP/EP)
容错设计:能设计健壮的容错机制:自动checkpoint、训练自恢复、节点丢失自动替换——尤其是在不稳定供应商环境下
存储:熟悉高性能文件系统和对象存储,能规划存储分层策略监控能搭建GPU的精细监控和告警体系
加分项
有算力成本优化经验,做过供应商性价比分析和采购策略制定
参与过基础模型的完整训练流程(从集群搭建到模型训练完成)
对GPU硬件架构有深入理解(NVLink、NVSwitch、Blackwell、GraceBlackwell架构等)
有安全意识:理解在第三方硬件上训练的数据安全风险,能设计相应的防护措施
有开源项目贡献或技术博客输出
熟悉vLLM等推理框架的部署,NGC 训练框架