指多个任务或用户共同使用同一块GPU计算资源的技术或机制,用于提升GPU利用率、降低使用成本。常见方式包括(时间片轮转)、(显存隔离)、(算力切分)、(多实例GPU/MIG)、(容器化GPU调度)等,适用于深度学习训练、推理及高密度计算场景。