岗位职责:
1. 构建下一代绿色智能计算基础设施,通过创新技术推动AI集群的性能与能效持续突破。
2. 参与前沿可持续计算技术研究,并将研究成果应用于大规模AI基础设施场景。
3. 开展可持续计算(Sustainable Computing)与绿色AI领域前沿技术研究,探索面向大规模AI训练与推理场景的能效优化方案;
4. 设计并构建细粒度能耗分析体系,实现从集群、节点、设备到任务级别的精准能耗监测、分解与建模;
5. 研发面向CPU/GPU/NPU等xPU资源的动态调频调压(DVFS)、资源管理与智能调度优化算法,提升系统整体能效比;
6. 结合AI训练与推理框架(如vLLM、SGLang、ONNX等),开展系统级性能与能耗协同优化;
7. 构建面向AI基础设施的能耗预测模型与智能优化策略,实现资源利用率、性能与功耗的动态平衡;
8. 与系统架构、硬件平台、云计算及AI算法团队深度协作,推动研究成果在实际产品和超大规模集群中的落地应用;
9. 跟踪计算机系统、AI Infra及绿色计算领域的最新技术趋势,推动核心技术创新与专利、论文成果产出。
岗位要求:
1. 计算机科学、电子工程、自动化或相关专业硕士及以上学历;
2. 至少7年以上计算机系统、软件平台或硬件架构研发经验;
3. 在以下至少一个方向具备扎实的技术积累和实际项目经验:
- 计算机体系结构、操作系统内核、资源管理与调度机制;
- CPU/GPU/NPU等xPU硬件架构、性能分析与优化;
- Kubernetes、云原生调度编排框架及资源管理系统;
- DVFS、CPU/GPU频率调度、功耗管理、能耗测量与建模技术;
- AI推理框架(vLLM、SGLang、ONNX Runtime等)及性能优化;
- CUDA、并行计算及高性能计算(HPC)相关技术;
- 基于机器学习的能耗预测、资源调优或能效优化算法设计。
4. 具备优秀的问题分析能力和系统级优化思维,能够从硬件、系统软件到AI框架层面进行端到端性能与能耗优化;
5. 良好的创新意识和技术影响力,能够推动复杂技术方案落地。
加分项:
1. 在计算机系统、体系结构、操作系统、AI基础设施或绿色计算领域拥有顶级会议/期刊成果,例如:
ISCA
ASPLOS
HPCA
MICRO
OSDI
SOSP
SC
USENIX ATC
2. 具有知名开源项目贡献经历,包括但不限于:
Kubernetes
vLLM
SGLang
ONNX Runtime
PyTorch
TensorRT
LLVM
3. 具有超大规模AI训练集群、云计算平台或高性能计算(HPC)系统研发经验;
4. 具备专利、开源社区Maintainer或技术Leader经历者优先