比肩 Opus5.5、GPT-6 Astra!Qwen3.8-27B-Coder390 多模态 AI 模型本地部署+实测|接入 DeepSeek Harness

大家好,我是超哥。今天给大家分享 Qwen3.8-27B-Coder390 多模态 AI 模型的本地部署教程。这个模型最大的特点就是编程能力强、推理效率大幅提升,通过蒸馏顶级模型,强化代码生成和解决复杂问题的能力。它还支持图片理解和 MTP 加速技术,模型部署到自己的电脑上之后,不需要 API Token,也不需要联网,就可以直接本地运行。我还会带大家将它接入 DeepSeek Harness,实现工具调用等 Agent 功能。我们直接开始教程。

博主电脑环境

显卡:NVIDIA RTX 4080 SUPER(16GB)

CPU:AMD R9 7900X 12-Core Processor(12核)

内存:64GB DDR5(3600 MHz)

一、Qwen3.8-27B-Coder390 模型下载

Hugging Face模型下载地址:https://huggingface.co/nerkyor/Qwen3.8-27B-Coder390-EfficientThink-Opus5.5-GPT6Astra-Grok4.7-DSV4Pro-K3-SFT-RLOO-GGUF-NInfer/tree/main/GGUF

夸克网盘模型下载地址:https://pan.quark.cn/s/2a045069dcd9?pwd=HZ4R

电脑配置模型选择推荐(建议最低 12GB 显存,内存大的可以往下再提一格):

模型版本 文件大小 适用显存 推荐说明
Qwen3.8-27B-Coder390-EfficientThink-Q2LynnStyle-MTP 13.3 GB 12GB 及以上 极限量化
Qwen3.8-27B-Coder390-EfficientThink-Q2LynnStyle-Q8MTP 13.5 GB 12GB 及以上 Q2 低显存
Qwen3.8-27B-Coder390-EfficientThink-Q3LynnStyle-MTP 17.3 GB 16GB 及以上 3-bit 均衡
Qwen3.8-27B-Coder390-EfficientThink-Q3LynnStyle-Q8MTP 17.5 GB 16GB 及以上 3-bit 变体
Qwen3.8-27B-Coder390-EfficientThink-Q4LynnStyle-MTP 19.6 GB 20GB 及以上 4-bit 推荐
Qwen3.8-27B-Coder390-EfficientThink-Q4LynnStyle-Q8MTP 19.8 GB 20GB 及以上 4-bit 变体
Qwen3.8-27B-Coder390-EfficientThink-Q6_K-MTP 23.2 GB 24GB 及以上 6-bit 高质量
Qwen3.8-27B-Coder390-EfficientThink-Q8_0-MTP 29.1 GB 32GB 及以上 8-bit 高精度
mmproj-Qwen3.8-27B-Q8_0.gguf 629 MB 额外预留资源 视觉模块

注:显存为参考建议,实际需求取决于上下文长度。

二、下载并配置 llama.cpp

1、下载并安装 llama.cpp

Github项目下载地址:https://github.com/ggml-org/llama.cpp/releases

夸克网盘项目下载地址:https://pan.quark.cn/s/2a045069dcd9?pwd=HZ4R

版本 适用硬件 说明
Windows x64 (CPU) Intel / AMD CPU 仅使用处理器运行
Windows arm64 (CPU) ARM 架构 Windows 设备 适用于骁龙 X Elite 等 ARM 平台
Windows x64 (CUDA 12) NVIDIA 显卡 推荐大多数 RTX/GTX 用户使用
Windows x64 (CUDA 13) NVIDIA 显卡 适用于较新的 NVIDIA 驱动
Windows x64 (Vulkan) AMD / Intel / NVIDIA 显卡 通用显卡加速版本
Windows x64 (SYCL) Intel Arc 显卡 Intel Arc 用户专用版本
Windows x64 (HIP) AMD Radeon 显卡 AMD 用户首选版本

注意:显卡用户别忘了下载下图主程序后面的DLLs文件,下载后把里面的内容解压到llama.ccp主程序的根目录里,不然无法使用显卡运行模型。

2、Qwen3.8-27B-Coder390 接入 llama.cpp

把下载到的大模型放到 llama.ccp 程序的根目录下的 models 目录里(需自行创建目录)

3、配置启动脚本

llama.ccp 程序的根目录创建启动脚本,命名成:启动.bat

@echo off
title Qwen3.8-27B-Coder390-EfficientThink-MTP - llama.cpp

cd /d "%~dp0"

echo.
echo ========================================
echo       XChaoGe.Com
echo       llama.cpp Local AI Server
echo ========================================
echo.
echo       Qwen3.8-27B-Coder390-EfficientThink
echo.

llama-server.exe ^
  -m "models\模型名" ^
  --mmproj "models\mmproj-Qwen3.8-27B-Q8_0.gguf" ^
  --host 127.0.0.1 ^
  --port 8085 ^
  -c 8192 ^
  --fit on ^
  -fa auto ^
  --jinja ^
  --parallel 1 ^
  --alias Qwen3.8-27B-Coder390 ^
  --temp 0.6 ^
  --top-p 0.95 ^
  --top-k 20 ^
  --repeat-penalty 1.05 ^
  --cache-type-k q8_0 ^
  --cache-type-v q8_0 ^
  --spec-type draft-mtp ^
  --spec-draft-n-max 4 ^
  -n 24576

pause

访问控制面板 URL:

http://127.0.0.1:8085

参数说明:

参数 设置 说明
-m 模型名 指定 Qwen3.8-27B-Coder390-EfficientThink-MTP GGUF 主模型文件路径,需替换为实际文件名
--mmproj mmproj-Qwen3.8-27B-Q8_0.gguf 加载视觉投影模块,为支持视觉的模型启用图片理解能力
--host 127.0.0.1 仅允许本机访问 API 服务
--port 8085 设置 llama.cpp API 服务端口
-c 24576 上下文长度,设置越大速度越慢(8192、16384、24576、32768、65536)
--fit on 自动调整模型加载参数,以适配可用显存等设备资源
-fa auto 自动选择 Flash Attention 设置
--jinja 开启 启用 Jinja 聊天模板处理
--parallel 1 设置并行处理槽数量为 1
--alias Qwen3.8-27B-Coder390 设置 API 中使用的模型别名
--temp 0.6 控制生成内容的随机性,数值越高通常越发散
--top-p 0.95 通过累计概率限制采样候选范围
--top-k 20 每一步采样时限制候选 Token 数量
--repeat-penalty 1.05 对重复内容施加惩罚,降低重复生成的概率
--cache-type-k q8_0 K Cache 使用 Q8_0 量化,通常可降低 KV Cache 的内存占用
--cache-type-v q8_0 V Cache 使用 Q8_0 量化,通常可降低 KV Cache 的内存占用
--spec-type draft-mtp 启用 MTP 推测解码模式,尝试提高生成速度
--spec-draft-n-max 4 设置 MTP 推测解码单轮最多提出的候选 Token 数量为 4
-n 24576 跟上下文长度-c保持一致

三、接入 DeepSeek Harness

DeepSeek Harness 下载地址:https://www.deepseek.com/harness/

接入参数:

Provider ID: llamacpp

显示名称: llamacpp

API 地址:http://127.0.0.1:8085/v1

API 协议: OpenAI Chat Completions

API Key: 随便填一个

添加模型:点击"获取可用模型"

感谢您的支持
支付宝
微信支付
感谢您的支持
支付宝收款二维码

打开支付宝扫描二维码(崔*杰)

感谢您的支持
微信支付收款二维码

打开微信扫描二维码(崔*杰)

上一篇Qwen3.8-27B 压缩7倍!Saluki 27B 多模态 AI 模型本地部署+实测|7.9GB模型、262K上下文 下一篇没有了
请我喝杯咖啡
如果喜欢本站的内容,欢迎请我喝杯咖啡
支付宝
微信支付
感谢你的支持
支付宝二维码
打开支付宝扫描二维码(崔*杰)
感谢你的支持
微信支付二维码
打开微信扫描二维码(崔*杰)