Enter a job title or keyword

Head of Machine Learning Infrastructure

AXQ Capital


Job Location:

Shanghai - China

Monthly Salary: Not provided by the employer
Posted: 7 July 2026 (30+ days ago)
Application Deadline: 19 November 2026
Vacancies: 1 Vacancy

Job Summary

关于我们

安贤投资AXQ Capital致力于以严谨的量化研究与先进的信息技术驱动投资我们打造科学高效的量化研究框架构建多市场多策略投资体系策略布局覆盖全球股票统计套利A股指数增强CTA股票日内期货高频等领域在全球市场部署运行覆盖多个地区资产类别及交易周期自2018年成立以来安贤持续为海内外投资者创造长期稳健的投资回报资产管理规模稳步增长公司在北京上海香港纽约设有办公室为国内员工提供海外交流与培训机会

岗位使命

作为 Head of Machine Learning Infrastructure你将向 CTO 汇报负责公司面向机器学习和量化研究的核心计算与平台基础设施包括 GPU/CPU 集群分布式训练研究计算平台机器学习平台及开发者工具
核心目标是打造一套能够支撑大规模特征工程与机器学习训练的基础设施体系支持 PB 级数据处理能力并能够高效利用数十 TB 级别训练数据进行模型训练与实验迭代系统需具备高性能可扩展可复现易使用且成本高效的特性持续提升研究与工程效率

主要职责

  • 负责机器学习基础设施团队建设技术规划和项目推进制定中长期平台路线
  • 建设和优化 GPU/CPU 集群任务调度和分布式计算平台支持大规模模型训练特征计算和量化研究
  • 构建支持 PB 级数据规模的特征工程与数据处理平台提升海量数据的计算存储与访问效率
  • 支持基于数十 TB 级训练数据的分布式训练与实验体系优化数据加载并行训练与资源调度效率
  • 建设统一的机器学习平台包括开发环境实验管理模型版本依赖管理和模型部署流程
  • 优化训练与研究场景下的存储网络数据管道和计算性能提高 GPU/CPU 资源利用率并控制基础设施成本
  • 建设模型训练批量/在线推理及相关生产基础设施提升模型从研究到生产的效率和可靠性
  • 持续优化开发者工具和研究工作流提升大规模数据与模型实验的迭代效率
  • 建设平台监控容量规划权限安全和自动化体系保障大规模系统的稳定性与可维护性
岗位要求
  • 8 年以上机器学习基础设施分布式系统平台工程高性能计算或云基础设施相关经验
  • 有基础设施或平台团队管理经验以及复杂系统架构和落地能力
  • 扎实的 Linux网络存储分布式系统和容器技术基础
  • 熟悉 GPU 计算分布式训练和大规模机器学习工作负载对任务调度数据 I/O特征工程和系统性能优化有实践经验
  • 熟悉 PythonGoCRustJava 等至少一门编程语言
  • 熟悉 KubernetesDockerCI/CDInfrastructure as Code监控和云计算基础设施
  • 具备较强的平台产品意识能够深入理解量化研究员机器学习研究员和工程师在大规模数据与模型训练场景下的需求
加分项
  • 有量化投资对冲基金机器学习平台或大规模研究计算平台经验
  • 有 GPU 集群分布式训练或 HPC 平台建设经验
  • 熟悉 PyTorch DistributedRaySlurmNCCLCUDARDMA 等技术
  • 有大规模特征工程平台数据管道系统或 PB 级数据处理经验
  • 有 AWSGCP阿里云腾讯云等云平台的 GPU 资源和成本优化经验
  • 熟悉 Claude CodeCodexCursor 等 AI coding tools并有推动其团队化应用的经验


Required Experience:

Director