大家好,我是超哥。今天给大家分享 DeepSeek Harness 桌面版,教大家如何接入任意 AI API 和本地模型。从软件安装、API 配置,到 OpenAI、Ollama、llama.cpp 接入,完整走一遍。一个客户端,多个 AI 模型随意切换,我们直接开始。

一、下载安装 DeepSeek Harness
Windows 版下载地址:https://download.deepseek.com/dsh-desk/bin/win-x64/deepseek-harness-0.1.7-rc.2-win-x64.exe
MacOS 版下载地址:https://download.deepseek.com/dsh-desk/bin/mac-arm64/deepseek-harness-0.1.7-rc.2-mac-arm64.dmg

二、接入 第三方 AI 模型
1. 接入 OpenAI
API 获取:https://platform.openai.com/api-keys
API 密钥:填入你自己的密钥
API 地址:https://api.openai.com/v1
2. 接入 DeepSeek
API 获取:https://platform.deepseek.com/
API 密钥:填入你自己的密钥
API 地址:https://api.deepseek.com
三、接入 ollama 本地 AI 模型
1. 安装ollama
下载 ollama 地址:https://ollama.com/download/windows

2. 下载本地 AI 模型
ollama 模型列表:https://ollama.com/search
cmd 下载 ollama 模型到本地命令:
ollama pull 模型名称
接入参数:
Provider ID: ollama
显示名称: ollama
API 地址:http://127.0.0.1:11434/v1
API 协议: OpenAI Chat Completions
API Key: 随便填一个
添加模型:点击"获取可用模型"
四、接入 llama.cpp 本地 AI 模型
1、下载并安装 llama.cpp
下载地址:https://github.com/ggml-org/llama.cpp/releases

| 版本 | 适用硬件 | 说明 |
|---|---|---|
| Windows x64 (CPU) | Intel / AMD CPU | 仅使用处理器运行 |
| Windows arm64 (CPU) | ARM 架构 Windows 设备 | 适用于骁龙 X Elite 等 ARM 平台 |
| Windows x64 (CUDA 12) | NVIDIA 显卡 | 推荐大多数 RTX/GTX 用户使用 |
| Windows x64 (CUDA 13) | NVIDIA 显卡 | 适用于较新的 NVIDIA 驱动 |
| Windows x64 (Vulkan) | AMD / Intel / NVIDIA 显卡 | 通用显卡加速版本 |
| Windows x64 (SYCL) | Intel Arc 显卡 | Intel Arc 用户专用版本 |
| Windows x64 (HIP) | AMD Radeon 显卡 | AMD 用户首选版本 |
注意:显卡用户别忘了下载下图主程序后面的DLLs文件,下载后把里面的内容解压到llama.ccp主程序的根目录里,不然无法使用显卡运行模型。

2、Hugging Face 下载本地 AI 大模型
Hugging Face 网址:https://huggingface.co
Qwen3.8 27B(MTP加速)本地大模型下载地址:https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/tree/main
夸克网盘下载地址:https://pan.quark.cn/s/93e55b48590e?pwd=a6MC
迅雷网盘下载地址:https://pan.xunlei.com/s/VP1UY-n3jiIwyOo_vBk3icSwA1?pwd=h79f
电脑配置选择推荐:
| 模型版本 | 文件大小 | 适用电脑 | 推荐说明 |
|---|---|---|---|
| Qwen3.8-27B-GSQ-RCO-IQ2_XS | 约 8.42 GB | 8GB 显存及以上 | 体积最小 |
| Qwen3.8-27B-GSQ-RCO-IQ2_XS-mtp | 约 8.77 GB | 8GB 显存及以上 | 支持 MTP 加速 |
| Qwen3.8-27B-GSQ-RCO-IQ2_S | 约 9.26 GB | 8GB 显存及以上 | 效果与占用均衡 |
| Qwen3.8-27B-GSQ-RCO-IQ2_S-mtp | 约 9.61 GB | 8GB 显存及以上 | 均衡且支持 MTP |
| Qwen3.8-27B-GSQ-RCO-IQ3_XXS | 约 10.1 GB | 12GB 显存及以上 | 精度进一步提升 |
| Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp | 约 10.4 GB | 12GB 显存及以上 | 精度与速度兼顾 |
| Qwen3.8-27B-GSQ-RCO-IQ3_S | 约 11.8 GB | 16GB 显存及以上 | 综合效果更好 |
| Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp | 约 12.1 GB | 16GB 显存及以上 | 高精度且支持 MTP |
| mmproj-Qwen3.8-27B-BF16 | 约 931 MB | -- | 多模态 |
下载到的大模型放到 llama.ccp 程序的根目录下的 models 目录里(需自行创建目录)
3、配置启动脚本
创建启动脚本,命名成:启动.bat
@echo off title Qwen3.8-27B GSQ+RCO - llama.cpp cd /d "%~dp0" echo. echo ======================================== echo XChaoGe.Com echo llama.cpp Local AI Server echo ======================================== echo. llama-server.exe ^ -m "models\模型名" ^ --mmproj "models\mmproj-Qwen3.8-27B-BF16.gguf" ^ --no-mmproj-offload ^ --host 127.0.0.1 ^ --port 8085 ^ -c 65536 ^ -ngl 99 ^ -fa auto ^ --jinja ^ --parallel 1 ^ --alias Qwen3.8-27B-GSQ-RCO ^ --temp 1.0 ^ --top-p 0.95 ^ --top-k 20 ^ --min-p 0 ^ --repeat-penalty 1.0 ^ --spec-type draft-mtp ^ --spec-draft-n-max 3 pause
访问控制面板 URL:
代码说明:
-m "models\模型名" ^
--port 端口号 ^
接入参数:
Provider ID: llamacpp
显示名称: llamacpp
API 地址:http://127.0.0.1:8085/v1
API 协议: OpenAI Chat Completions
API Key: 随便填一个
添加模型:点击"获取可用模型"