Skip to main content

One post tagged with "hami"

View All Tags

OpenYurt + HAMi:边缘 GPU 资源管理实践

· 11 min read

随着 AI 应用对算力需求的不断提升,越来越多的 AI 推理任务运行在边缘节点上,这些节点既可能是靠近业务现场的边缘设备,也可能是分散在各地的 IDC 机房。平台既要统一管理这些 GPU 节点,也要解决边缘侧整卡分配粒度较粗、轻量任务资源利用率不高,以及远程运维不便等问题。

OpenYurt 将分散的 GPU 节点纳入统一的 Kubernetes 集群,通过 NodePool、边缘自治和云边运维等能力,把 Kubernetes 的资源与应用管理方式延伸到边缘。在 OpenYurt 管理的边缘节点上部署 HAMi,则可以进一步将 GPU 的管理粒度从“节点上有几张卡”细化到“任务使用哪张卡、多少显存与算力”。

本文介绍如何在 OpenYurt 集群中使用 HAMi 实现边缘节点上细粒度的 GPU 资源管理方案,再通过实践 Demo,验证边缘 GPU 算力与显存的申请、分配与隔离效果。