AI基础设施运营专家
北京社招全职运营 - 产品运营职位 ID:A65249 职位描述
负责公司 AI 基础设施平台的运营与治理。短期重点支持自研模型路由/网关平台的运营,保障多模型接入、调用体验、资源供给、成本计量与服务稳定性;长期逐步覆盖数据平台、训练平台、推理平台、算力平台等内部基础设施平台,推动平台能力标准化、运营体系化和资源使用效率提升。
1. 模型路由与网关平台运营:负责自研模型路由/网关平台的日常运营,包括模型接入、供应商/内部模型资源协同、调用额度、限流策略、异常处理、服务质量跟踪和用户反馈闭环。
2. AI 基础设施平台治理:面向数据、训练、推理、算力等内部平台,建立资源申请、配额管理、容量评估、SLA/SLO、告警响应、问题复盘等运营机制,提升平台稳定性和使用体验。
3. 计量计费与成本分析:负责模型调用、算力资源、训练任务、推理服务等场景的用量统计、计量口径、成本归因和异常分析,推动资源成本透明化和使用效率优化。
4. 平台用户与需求运营:对接算法、研发、产品及业务团队,理解不同团队在模型调用、数据生产、训练推理、算力使用等方面的需求,推动平台能力改进和跨团队问题闭环。
5. 流程标准化与运营工具建设:沉淀平台运营规范、资源治理流程、数据看板、自动化巡检和问题追踪机制,提升基础设施平台的运营效率和可持续管理能力。
职位要求
1. 本科及以上学历,计算机、软件工程、数据科学、信息管理、数学、统计等相关专业优先。
2. 有 AI 平台、云计算平台、模型服务平台、数据平台、MLOps 平台、GPU/算力资源运营或技术产品运营经验者优先。
3. 理解大模型 API、模型路由、模型网关、训练/推理资源、GPU/云资源、限流、配额、SLA、计量计费等基础概念。
4. 具备较强的数据分析能力,能够通过用量、成本、性能、稳定性、用户反馈等数据发现问题,并推动改进。
5. 具备强 Owner 意识、跨团队协作能力和复杂问题推进能力,能在研发、算法、业务、采购、财务及外部厂商之间推动问题闭环。
6. 熟悉 SQL、BI、脚本、自动化工具或 AI Native 效率工具者优先;有平台型产品运营、FinOps、DevOps、MLOps 或 SRE 协作经验者优先。
投递