原理预计 35 分钟
训练与推理平台:Trainer、Ray 与 vLLM
平台交付给算法团队的不是节点,是「提交一个作业」和「上线一个模型」这两个动作。
学完这节你能做到
- 说清训练作业与推理服务对集群的不同要求
- 选择合适的编排方式跑起一个多机多卡训练作业
- 部署一个 LLM 推理服务,并说明扩缩容的难点在哪
正文待编写以下是本节已定稿的小节大纲
- 1Trainer / MPI Operator:多机多卡作业编排
- 2KubeRay:RayCluster、RayJob 与 RayService
- 3推理侧:vLLM、SGLang 与 LWS 多机部署
- 4llm-d 与推理网关
- 5存储与网络对训练性能的影响
- 6基准测试:NCCL tests 与 nvbandwidth
延伸资料
- ·k8s-in-action
ai/README.md - ·k8s-in-action
ai/kuberay/README.md - ·k8s-in-action
ai/nccl-tests/README.md