极限体验!笔记本电脑8G显存运行 Qwen3.6-35B-A3B 量化模型

默认分类,教程文档 · · · 💬 暂无评论

极限体验!笔记本电脑8G显存运行 Qwen3.6-35B-A3B 量化模型

前言

之前我认为 4060 8G 显存运行 9B 模型已是极限。想不到真的可以运行 35B 模型,技术进展如此之快。

运行日志

启动命令:

llama-server.exe -m C:\work\llama\Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 9880 -fa on --threads 6 --threads-batch 8 --jinja -np 1 --mlock --n-gpu-layers 18 --ctx-size 32768 --cache-type-k q4_1 --cache-type-v q4_1 --api-key sk-123456 --alias myqwen.3.5

日志输出显示:

0.14.580.213 I srv llama_server: model loaded
0.14.580.227 I srv llama_server: server is listening on http://0.0.0.0:9880

使用体验

  1. Token 速度:约 20 token/s,算勉强能用
  2. 内存要求:电脑最好有 32GB 内存,毕竟显卡装不下就只能放内存
  3. 能力保持:35B 的能力还是在的,如果云端不好用,还是可以做做事情

优化参数

推荐使用以下参数:

-m C:\work\llama\Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 9980 -fa on --threads 6 --threads-batch 6 --jinja -np 1 --mlock --n-gpu-layers 15 --ctx-size 32768 --cache-type-k q4_1 --cache-type-v q4_1 --api-key sk-123456 --alias myqwen.3.5

参数解析

参数说明
-m选择模型文件
--host设置监听地址
--port设置监听端口
-fa on开启加速
--threads设置使用线程,开了超线程的数字减半
--threads-batch跟上一致最好
--jinja开启模型内置模板,开启思考需要打开此选项
-np限制并发,如果就一个 agent 用设置为 1 即可
--n-gpu-layers设置加载模型在显卡的层数,8G 显存建议 15 层
--mlock全部加载到内存,推荐添加此参数
--cache-type-k/v量化参数,根据模型设置
--api-key设置 API 密钥
--alias设置别名

相关文件下载


💡 提示:这个配置需要机缘巧合才能实现,纯属技术探索。
标签:无

添加新评论