本地 GPU 部署与评测大模型的实战记录:推理服务、多卡硬件方案与量化模型测试。

  • 第一篇 使用 Docker 部署 SGLang 并跑通本地模型。
  • 第二篇 两张 4090 + PCIe 的 27B 模型部署全记录。
  • 第三篇 Ternary-Bonsai-2-27B-PTQ1_0 性能测试报告。
  1. 使用docker部署 SGLang并在本地部署 Qwen3.5-35B-A3B2026-03-15
  2. 两张 4090、一条 PCIe:本地部署 27B 大模型的全记录2026-09-20
  3. Ternary-Bonsai-2-27B-PTQ1_0 性能测试报告2026-09-21