topology-aware scheduling

从空闲GPU到有效算力:大规模AI集群调度的演进

结合Alibaba超大规模AI集群研究和快手TIDAL实践,讨论GPU调度如何从分配空闲资源,演进为同时治理空间碎片、潮汐变化、网络拓扑和业务执行粒度的有效算力调度。
2026-07-31
14 min read

Grove:LLM推理系统的Kubernetes表达层

Grove通过更高层的workload对象,把复杂LLM推理系统描述为一个整体,并以声明方式表达组件关系、扩缩容、启动顺序,以及成组调度和拓扑约束相关的调度协议。
2026-06-07
13 min read