云服务器CPU推理模型并封装成 API 的折腾记录 作者利用即将过期的服务器,通过Llama.cpp部署Qwen3.5轻量级模型(0.8B/2B),配置CPU推理环境并测试API性能。实... 技术性踩雷 · 2026-05-23