KKubepath
原理预计 35 分钟

训练与推理平台:Trainer、Ray 与 vLLM

平台交付给算法团队的不是节点,是「提交一个作业」和「上线一个模型」这两个动作。

学完这节你能做到

  • 说清训练作业与推理服务对集群的不同要求
  • 选择合适的编排方式跑起一个多机多卡训练作业
  • 部署一个 LLM 推理服务,并说明扩缩容的难点在哪
正文待编写以下是本节已定稿的小节大纲
  1. 1Trainer / MPI Operator:多机多卡作业编排
  2. 2KubeRay:RayCluster、RayJob 与 RayService
  3. 3推理侧:vLLM、SGLang 与 LWS 多机部署
  4. 4llm-d 与推理网关
  5. 5存储与网络对训练性能的影响
  6. 6基准测试:NCCL tests 与 nvbandwidth

延伸资料

  • ·k8s-in-actionai/README.md
  • ·k8s-in-actionai/kuberay/README.md
  • ·k8s-in-actionai/nccl-tests/README.md