Agentic Infra
北京社招全职技术 - 基础架构职位 ID:A209988 职位描述
我们在构建一套“自我优化”的大模型训练系统,你将参与以下核心方向:
1. 参与模型训练,构造在高性能/infra侧专用的模型
2. 构建统一的训练 Harness 范式,标准化训练、benchmark 与评测流程
3. 探索 Agentic Infra,将训练系统从人工驱动升级为 Agent 驱动
4. 推动训练系统从工具集合向具备自我优化能力的系统演进
职位要求
1. 具有较强工程能力,能独立完成复杂系统模块的设计与实现
2. 熟练使用 Python,具备扎实的代码能力(C++ / CUDA 为加分项)
3. 熟悉 PyTorch,有实际训练 / 调试经验
4. 理解分布式系统或分布式训练的基本概念
5. 对系统问题有良好的拆解能力,能从复杂现象中定位本质问题
6. 对 AI Native / Agent 系统有兴趣,认可“用模型解决工程问题”的方向
7. 对数据敏感:能判断指标是否可信、实验是否有效,而不是盲目跑实验
加分项(重要但不硬性)
1. 有算子开发经验(CUDA / Triton / Kernel 优化)
2. 有大模型训练经验(Megatron / DeepSpeed / FSDP 等)
3. 有性能分析经验(Nsight Systems / Nsight Compute / profiler 等)
4. 熟悉训练优化手段(FlashAttention / ZeRO / 混合精度 / checkpointing 等)
5. 对 Agent 有深入理解或实践(tool use / planning / multi-agent 等)
6. 阅读或改过大型训练框架源码
7. 做过 benchmark / profiling / 自动化实验平台相关工作
投递