跳转到文档内容

3 篇文章 文档包含 "调度"

查看全部标签

HAMi 可组合调度策略:mutex、binpack、spread、numa 如何协同工作

· 阅读需要 10 分钟

HAMi 一直通过 hami.io/gpu-scheduler-policy 注解提供按 Pod 生效的 GPU 调度策略:binpack 尽量把负载堆叠到少数卡上,spread 尽量打散,v2.10.0 新增的 mutex 则要求独占一张卡。但在 v2.10.0 之前,这个注解只能填一个值。

真实集群很少只需要一种行为。一份典型的生产诉求是这样的:推理副本要紧凑装箱,留出整卡空闲;同时每个 Pod 的多卡要落在同一 NUMA 节点上以保证带宽;而时延敏感的那批负载,干脆要独占几张卡。一句话里出现了三种策略。在 v2.10.0 之前,你只能选一个,放弃其余。

v2.10.0 补上了这块拼图:hami.io/gpu-scheduler-policy 现在接受有序的、逗号分隔的列表,过滤型与排序型策略可以组合(#2621@mesutoezdil,关闭 #2010)。本文解释组合是如何求值的,以及如何上手与验证。如果你喜欢动手学习,配套的实验 14:在 GKE 上验证可组合调度策略会在真实集群上逐一复现下文的每个场景。

从 Device Plugin 到 DRA:GPU 调度范式升级与 HAMi-DRA 实践回顾

· 阅读需要 5 分钟
HAMi 社区

刚刚过去的 KCD Beijing 2026,是近年来规模最大的一次 Kubernetes 社区大会之一。

超过 1000 人报名参与,刷新历届 KCD 北京记录。

HAMi 社区不仅受邀进行了技术分享,也在现场设立了展台,与来自云原生与 AI 基础设施领域的开发者、企业用户进行了深入交流。

本次分享主题为:

从 Device Plugin 到 DRA:GPU 调度范式升级与 HAMi-DRA 实践

本文结合现场分享内容与 PPT,做一次更完整的技术回顾。附幻灯片下载:GitHub - HAMi-DRA KCD Beijing 2026

HAMi 项目 GPU Pod 调度流程源码走读

· 阅读需要 33 分钟
Maintainer

使用 HAMi 的过程中经常会出现 Pod 被创建出来 Pending 的问题,犹以如下两个问题为著:

  • Pod UnexpectedAdmissionError
  • Pod Pending

介于此,展开这部分代码的粗略走读,旨在说明调度过程中各组件的交互,以及资源的计算方式,其他细节会有所遗漏。

CNCFHAMi 是 CNCF 孵化项目