2 分钟阅读

Qwen3.8 DGX Spark 实验室

一台 DGX Spark 上的 Qwen3.8

一套在 NVIDIA DGX Spark GB10 单机上运行 Qwen3.8-27B 的独立、可复现服务工程。

参考栈使用 mixed-NVFP4 target、DFlash2 probabilistic K7 drafter,以及一个 8.3 MiB 的原生 rank-1 PEFT LoRA。同一 vLLM 进程同时暴露 clean base 与按请求 adapter 两个模型 ID:不选择 adapter 的请求留在干净 CUDA graph path,native LoRA identity 同时负责 prefix-cache 隔离。

仓库包括:

  • 固定 digest 的 ARM64 vLLM/DFlash2 Docker build;
  • mixed FP8/NVFP4 output projection 到 PEFT LoRA 的转换器;
  • 单服务 clean base 与 adapter 双 alias;
  • C1/C8 benchmark harness 与脱敏 JSON 结果;
  • OpenAI Chat、Responses、Anthropic Messages 验证;
  • forced tool 与 prefix-cache isolation 门禁;
  • 架构、内存、方法与许可文档。

实测 clean-base C1 吞吐从旧 always-on hook 的 30.32 tok/s 恢复到 native-LoRA 调度下的 45.41 tok/s。完整口径、限制和解释见技术长文