大家好,我是超哥。今天给大家分享 Qwen3.8-27B-Coder390 多模态 AI 模型的本地部署教程。这个模型最大的特点就是编程能力强、推理效率大幅提升,通过蒸馏顶级模型,强化代码生成和解决复杂问题的能力。它还支持图片理解和 MTP 加速技术,模型部署到自己的电脑上之后,不需要 API Token,也不需要联网,就可以直接本地运行。我还会带大家将它接入 DeepSeek Harness,实现工具调用等 Agent 功能。我们直接开始教程。

博主电脑环境
显卡:NVIDIA RTX 4080 SUPER(16GB)
CPU:AMD R9 7900X 12-Core Processor(12核)
内存:64GB DDR5(3600 MHz)
一、Qwen3.8-27B-Coder390 模型下载
Hugging Face模型下载地址:https://huggingface.co/nerkyor/Qwen3.8-27B-Coder390-EfficientThink-Opus5.5-GPT6Astra-Grok4.7-DSV4Pro-K3-SFT-RLOO-GGUF-NInfer/tree/main/GGUF
夸克网盘模型下载地址:https://pan.quark.cn/s/2a045069dcd9?pwd=HZ4R
电脑配置模型选择推荐(建议最低 12GB 显存,内存大的可以往下再提一格):
| 模型版本 | 文件大小 | 适用显存 | 推荐说明 |
|---|---|---|---|
| Qwen3.8-27B-Coder390-EfficientThink-Q2LynnStyle-MTP | 13.3 GB | 12GB 及以上 | 极限量化 |
| Qwen3.8-27B-Coder390-EfficientThink-Q2LynnStyle-Q8MTP | 13.5 GB | 12GB 及以上 | Q2 低显存 |
| Qwen3.8-27B-Coder390-EfficientThink-Q3LynnStyle-MTP | 17.3 GB | 16GB 及以上 | 3-bit 均衡 |
| Qwen3.8-27B-Coder390-EfficientThink-Q3LynnStyle-Q8MTP | 17.5 GB | 16GB 及以上 | 3-bit 变体 |
| Qwen3.8-27B-Coder390-EfficientThink-Q4LynnStyle-MTP | 19.6 GB | 20GB 及以上 | 4-bit 推荐 |
| Qwen3.8-27B-Coder390-EfficientThink-Q4LynnStyle-Q8MTP | 19.8 GB | 20GB 及以上 | 4-bit 变体 |
| Qwen3.8-27B-Coder390-EfficientThink-Q6_K-MTP | 23.2 GB | 24GB 及以上 | 6-bit 高质量 |
| Qwen3.8-27B-Coder390-EfficientThink-Q8_0-MTP | 29.1 GB | 32GB 及以上 | 8-bit 高精度 |
| mmproj-Qwen3.8-27B-Q8_0.gguf | 629 MB | 额外预留资源 | 视觉模块 |
注:显存为参考建议,实际需求取决于上下文长度。
二、下载并配置 llama.cpp
1、下载并安装 llama.cpp
Github项目下载地址:https://github.com/ggml-org/llama.cpp/releases
夸克网盘项目下载地址:https://pan.quark.cn/s/2a045069dcd9?pwd=HZ4R

| 版本 | 适用硬件 | 说明 |
|---|---|---|
| Windows x64 (CPU) | Intel / AMD CPU | 仅使用处理器运行 |
| Windows arm64 (CPU) | ARM 架构 Windows 设备 | 适用于骁龙 X Elite 等 ARM 平台 |
| Windows x64 (CUDA 12) | NVIDIA 显卡 | 推荐大多数 RTX/GTX 用户使用 |
| Windows x64 (CUDA 13) | NVIDIA 显卡 | 适用于较新的 NVIDIA 驱动 |
| Windows x64 (Vulkan) | AMD / Intel / NVIDIA 显卡 | 通用显卡加速版本 |
| Windows x64 (SYCL) | Intel Arc 显卡 | Intel Arc 用户专用版本 |
| Windows x64 (HIP) | AMD Radeon 显卡 | AMD 用户首选版本 |
注意:显卡用户别忘了下载下图主程序后面的DLLs文件,下载后把里面的内容解压到llama.ccp主程序的根目录里,不然无法使用显卡运行模型。

2、Qwen3.8-27B-Coder390 接入 llama.cpp
把下载到的大模型放到 llama.ccp 程序的根目录下的 models 目录里(需自行创建目录)
3、配置启动脚本
llama.ccp 程序的根目录创建启动脚本,命名成:启动.bat
@echo off title Qwen3.8-27B-Coder390-EfficientThink-MTP - llama.cpp cd /d "%~dp0" echo. echo ======================================== echo XChaoGe.Com echo llama.cpp Local AI Server echo ======================================== echo. echo Qwen3.8-27B-Coder390-EfficientThink echo. llama-server.exe ^ -m "models\模型名" ^ --mmproj "models\mmproj-Qwen3.8-27B-Q8_0.gguf" ^ --host 127.0.0.1 ^ --port 8085 ^ -c 8192 ^ --fit on ^ -fa auto ^ --jinja ^ --parallel 1 ^ --alias Qwen3.8-27B-Coder390 ^ --temp 0.6 ^ --top-p 0.95 ^ --top-k 20 ^ --repeat-penalty 1.05 ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --spec-type draft-mtp ^ --spec-draft-n-max 4 ^ -n 24576 pause
访问控制面板 URL:
参数说明:
| 参数 | 设置 | 说明 |
|---|---|---|
| -m | 模型名 | 指定 Qwen3.8-27B-Coder390-EfficientThink-MTP GGUF 主模型文件路径,需替换为实际文件名 |
| --mmproj | mmproj-Qwen3.8-27B-Q8_0.gguf | 加载视觉投影模块,为支持视觉的模型启用图片理解能力 |
| --host | 127.0.0.1 | 仅允许本机访问 API 服务 |
| --port | 8085 | 设置 llama.cpp API 服务端口 |
| -c | 24576 | 上下文长度,设置越大速度越慢(8192、16384、24576、32768、65536) |
| --fit | on | 自动调整模型加载参数,以适配可用显存等设备资源 |
| -fa | auto | 自动选择 Flash Attention 设置 |
| --jinja | 开启 | 启用 Jinja 聊天模板处理 |
| --parallel | 1 | 设置并行处理槽数量为 1 |
| --alias | Qwen3.8-27B-Coder390 | 设置 API 中使用的模型别名 |
| --temp | 0.6 | 控制生成内容的随机性,数值越高通常越发散 |
| --top-p | 0.95 | 通过累计概率限制采样候选范围 |
| --top-k | 20 | 每一步采样时限制候选 Token 数量 |
| --repeat-penalty | 1.05 | 对重复内容施加惩罚,降低重复生成的概率 |
| --cache-type-k | q8_0 | K Cache 使用 Q8_0 量化,通常可降低 KV Cache 的内存占用 |
| --cache-type-v | q8_0 | V Cache 使用 Q8_0 量化,通常可降低 KV Cache 的内存占用 |
| --spec-type | draft-mtp | 启用 MTP 推测解码模式,尝试提高生成速度 |
| --spec-draft-n-max | 4 | 设置 MTP 推测解码单轮最多提出的候选 Token 数量为 4 |
| -n | 24576 | 跟上下文长度-c保持一致 |
三、接入 DeepSeek Harness
DeepSeek Harness 下载地址:https://www.deepseek.com/harness/

接入参数:
Provider ID: llamacpp
显示名称: llamacpp
API 地址:http://127.0.0.1:8085/v1
API 协议: OpenAI Chat Completions
API Key: 随便填一个
添加模型:点击"获取可用模型"