Qwen3.8-27B 本地部署实测:vLLM、SGLang、单卡 Q4 与 DSH
Qwen3.8-27B 这个尺寸我等了挺久:27B 稠密模型还保留了足够的能力,量化后又能塞进单张 24GB 显卡,正好落在本地 Agent 比较实用的一档。 这次我在 4×RTX 3090 24GB 上部署了原始 BF16 权重,对比 vLLM 和 SGLang,又用单卡跑了一遍 Q4 GGUF。接口跑通后,还把同一个模型接进 WorkBuddy 和 DeepSeek Harness(DSH),测试看图、工具调用和真实文件任务。 ...