Reproducible LLM inference on four NVIDIA DGX Spark (GB10) nodes wired as a direct switchless ConnectX ring — serving profiles, ring launchers, pinned ARM64 runtime images and measured results, newest tested model first.
arm64 llm-serving vllm sglang distributed-inference gb10 dgx-spark tensor-parallel switchless-ring nccl-mesh
-
Updated
Sep 12, 2026 - Python