一、模型下载
pip install modelscope
#全部下载
modelscope download --model unsloth/Qwen3.8-27B-GGUF
#博主下载命令:
~/.local/bin/modelscope download --model unsloth/Qwen3.8-27B-GGUF Qwen3.8-27B-UD-Q4_K_M.gguf --local_dir /opt/docker-deploy/volumes/llama/models/
二、Docker部署
llama:
image: ghcr.io/ggml-org/llama.cpp:server-cuda13
container_name: llama
restart: unless-stopped
ports:
- "8080:8080"
volumes:
- ./volumes/llama/models:/models:ro
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]
environment:
- CUDA_VISIBLE_DEVICES=0
- NVIDIA_VISIBLE_DEVICES=all
- NVIDIA_DRIVER_CAPABILITIES=compute,utility
command: >-
-m /models/Qwen3.8-27B-Q4_1.gguf -c 65536 -ngl 99 -np 1 -n -1 -fa on
-ctk q4_0 -ctv q4_0 -kvo --load-mode none --jinja --reasoning off -t 0.7
--top-p 0.80 --top-k 20 --min-p 0.0 --presence-penalty 1.5
--repeat-penalty 1.02 --mmproj /models/mmproj-F16.gguf
--image-min-tokens 1024 --spec-type draft-mtp --spec-draft-n-max 4
--port 8080 --host 0.0.0.0
logging:
options:
max-size: "10m"
max-file: "3"
networks:
extnetwork:
ipv4_address: 172.20.0.249
运行起来的资源信息:

删除--mmproj /models/mmproj-F16.gguf --image-min-tokens 1024 参数,可以禁止视觉模型,加快推理。但博主测试后,发现显存未减少,推理速度未见明显提升。
三、运行测试





四、Deepseek harness测试

开发的效果:
