Skip to content
主要職責
- AI存儲系統構建與研發,負責核心模塊的代碼編寫、測試及維護(如:分佈式文件系統、對象存儲網關、高性能並行文件系統等);
- AI訓練數據鏈路優化:針對大模型訓練和海量數據處理的場景特點,優化數據讀取鏈路。解決高並發讀取、海量小文件I/O瓶頸、大文件高吞吐及Checkpoint點的高速寫入問題;
- 性能調優與壓測:負責存儲系統的性能基準測試、瓶頸分析及深度調優,包括但不限於Linux I/O棧優化、內存管理、文件系統內核參數調整等,提升整體系統的IOPS與吞吐量;
- 系統穩定性保障:負責存儲集群的日常監控、故障排查與容災設計,解決複雜分佈式環境下的數據一致性、容錯及高可用問題;
- 跨團隊協同:與AI算法團隊、計算平台團隊緊密配合,深入理解業務需求(如PyTorch DataLoader機制、GPU直讀存儲等),提供定制化的存儲解決方案並推動落地;
- 前沿技術調研:追蹤業界最新的AI存儲技術動態(如RDMA網絡存儲、GPUDirect Storage等),評估並引入新技術以持續提升系統競爭力。
任職要求
- 持有效澳門居民身份證;
- 計算機、軟件工程或相關專業本科及以上學歷;精通C/C++或Go語言(兩者皆佳者優先),具備紮實的編碼功底和良好的代碼規範;熟悉Python能用於編寫測試腳本及數據處理;
- 系統底層基礎:深入理解Linux操作系統原理,熟悉文件系統原理、VFS、內存管理、I/O模型(epoll等)及多線程/協程編程;
- 存儲技術棧:熟悉至少一種主流分佈式存儲系統的架構與原理(如Ceph、HDFS、Lustre、MinIO、GlusterFS等),有相關源碼閱讀或二次開發經驗者優先;
- 大數據/AI生態:熟悉大數據處理生態(Hadoop/Spark等),了解AI訓練框架(PyTorch/TensorFlow)的數據加載與讀寫機制;
- 具備較強的系統問題排查能力,能夠處理複雜的性能瓶頸問題;
- 有良好的團隊協作精神和技術熱情,能承受一定的工作壓力。熟悉高性能網絡通信(如TCP/IP、RDMA、RoCE)及GPU直讀存儲(如GPUDirect Storage, GDS)技術者優先
- 熟悉雲原生技術棧,有Kubernetes CSI開發經驗者優先。