阅山

  • WIN
    • CSharp
    • JAVA
    • OAM
    • DirectX
    • Emgucv
  • UNIX
    • FFmpeg
    • QT
    • Python
    • Opencv
    • Openwrt
    • Twisted
    • Design Patterns
    • Mysql
    • Mycat
    • MariaDB
    • Make
    • OAM
    • Supervisor
    • Nginx
    • KVM
    • Docker
    • OpenStack
  • WEB
    • ASP
    • Node.js
    • PHP
    • Directadmin
    • Openssl
    • Regex
  • APP
    • Android
  • AI
    • Algorithm
    • Deep Learning
    • Machine Learning
  • IOT
    • Device
    • MSP430
  • DIY
    • Algorithm
    • Design Patterns
    • MATH
    • X98 AIR 3G
    • Tucao
    • fun
  • LIFE
    • 美食
    • 关于我
  • LINKS
  • ME
Claves
阅山笑看风云起,意气扬帆向日辉
  1. 首页
  2. AI
  3. LLM
  4. 正文

2080ti 22G使用llama.cpp部署Qwen3.8-27B-Q4_1.gguf 并用Deepseek Harness 智能体测试

2026-08-21

一、模型下载

pip install modelscope

#全部下载
modelscope download --model unsloth/Qwen3.8-27B-GGUF

#博主下载命令:
~/.local/bin/modelscope  download --model unsloth/Qwen3.8-27B-GGUF Qwen3.8-27B-UD-Q4_K_M.gguf  --local_dir /opt/docker-deploy/volumes/llama/models/

二、Docker部署


  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-cuda13
    container_name: llama
    restart: unless-stopped

    ports:
      - "8080:8080"
    volumes:
      - ./volumes/llama/models:/models:ro
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
    environment:
      - CUDA_VISIBLE_DEVICES=0
      - NVIDIA_VISIBLE_DEVICES=all
      - NVIDIA_DRIVER_CAPABILITIES=compute,utility
    command: >-
      -m /models/Qwen3.8-27B-Q4_1.gguf -c 65536 -ngl 99 -np 1 -n -1 -fa on
      -ctk q4_0 -ctv q4_0 -kvo --load-mode none --jinja --reasoning off -t 0.7
      --top-p 0.80 --top-k 20 --min-p 0.0 --presence-penalty 1.5
      --repeat-penalty 1.02 --mmproj /models/mmproj-F16.gguf
      --image-min-tokens 1024 --spec-type draft-mtp --spec-draft-n-max 4
      --port 8080 --host 0.0.0.0
    logging:
      options:
        max-size: "10m"
        max-file: "3"
    networks:
         extnetwork:
            ipv4_address: 172.20.0.249

运行起来的资源信息:

删除--mmproj /models/mmproj-F16.gguf --image-min-tokens 1024 参数,可以禁止视觉模型,加快推理。但博主测试后,发现显存未减少,推理速度未见明显提升。

三、运行测试

四、Deepseek harness测试

开发的效果:

标签: 暂无
最后更新:2026-08-21

阅山

知之为知之 不知为不知

点赞
< 上一篇

COPYRIGHT © 2099 登峰造极境. ALL RIGHTS RESERVED.

Theme Kratos Made By Seaton Jiang

蜀ICP备14031139号-5

川公网安备51012202000587号