前言
之前我认为 4060 8G 显存运行 9B 模型已是极限。想不到真的可以运行 35B 模型,技术进展如此之快。
运行日志
启动命令:
llama-server.exe -m C:\work\llama\Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 9880 -fa on --threads 6 --threads-batch 8 --jinja -np 1 --mlock --n-gpu-layers 18 --ctx-size 32768 --cache-type-k q4_1 --cache-type-v q4_1 --api-key sk-123456 --alias myqwen.3.5日志输出显示:
0.14.580.213 I srv llama_server: model loaded
0.14.580.227 I srv llama_server: server is listening on http://0.0.0.0:9880使用体验
- Token 速度:约 20 token/s,算勉强能用
- 内存要求:电脑最好有 32GB 内存,毕竟显卡装不下就只能放内存
- 能力保持:35B 的能力还是在的,如果云端不好用,还是可以做做事情
优化参数
推荐使用以下参数:
-m C:\work\llama\Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 9980 -fa on --threads 6 --threads-batch 6 --jinja -np 1 --mlock --n-gpu-layers 15 --ctx-size 32768 --cache-type-k q4_1 --cache-type-v q4_1 --api-key sk-123456 --alias myqwen.3.5参数解析
| 参数 | 说明 |
|---|---|
-m | 选择模型文件 |
--host | 设置监听地址 |
--port | 设置监听端口 |
-fa on | 开启加速 |
--threads | 设置使用线程,开了超线程的数字减半 |
--threads-batch | 跟上一致最好 |
--jinja | 开启模型内置模板,开启思考需要打开此选项 |
-np | 限制并发,如果就一个 agent 用设置为 1 即可 |
--n-gpu-layers | 设置加载模型在显卡的层数,8G 显存建议 15 层 |
--mlock | 全部加载到内存,推荐添加此参数 |
--cache-type-k/v | 量化参数,根据模型设置 |
--api-key | 设置 API 密钥 |
--alias | 设置别名 |
相关文件下载
- llama-b9553-bin-win-cuda-12.4-x64.zip(访问密码: 9280)
- Qwen3.6-35B-A3B-Q4_K_M.gguf(访问密码: 9280)
💡 提示:这个配置需要机缘巧合才能实现,纯属技术探索。