解锁无限 Token!DeepSeek Harness 桌面版接入任意 AI 和本地模型|OpenAI、Ollama、llama.cpp

大家好,我是超哥。今天给大家分享 DeepSeek Harness 桌面版,教大家如何接入任意 AI API 和本地模型。从软件安装、API 配置,到 OpenAI、Ollama、llama.cpp 接入,完整走一遍。一个客户端,多个 AI 模型随意切换,我们直接开始。

一、下载安装 DeepSeek Harness

Windows 版下载地址:https://download.deepseek.com/dsh-desk/bin/win-x64/deepseek-harness-0.1.7-rc.2-win-x64.exe

MacOS 版下载地址:https://download.deepseek.com/dsh-desk/bin/mac-arm64/deepseek-harness-0.1.7-rc.2-mac-arm64.dmg

二、接入 第三方 AI 模型

1. 接入 OpenAI

API 获取:https://platform.openai.com/api-keys

API 密钥:填入你自己的密钥

API 地址:https://api.openai.com/v1

2. 接入 DeepSeek

API 获取:https://platform.deepseek.com/

API 密钥:填入你自己的密钥

API 地址:https://api.deepseek.com

三、接入 ollama 本地 AI 模型

1. 安装ollama

下载 ollama 地址:https://ollama.com/download/windows

2. 下载本地 AI 模型

ollama 模型列表:https://ollama.com/search

cmd 下载 ollama 模型到本地命令:

ollama pull 模型名称

接入参数:

Provider ID: ollama

显示名称: ollama

API 地址:http://127.0.0.1:11434/v1

API 协议: OpenAI Chat Completions

API Key: 随便填一个

添加模型:点击"获取可用模型"

四、接入 llama.cpp 本地 AI 模型

1、下载并安装 llama.cpp

下载地址:https://github.com/ggml-org/llama.cpp/releases

版本 适用硬件 说明
Windows x64 (CPU) Intel / AMD CPU 仅使用处理器运行
Windows arm64 (CPU) ARM 架构 Windows 设备 适用于骁龙 X Elite 等 ARM 平台
Windows x64 (CUDA 12) NVIDIA 显卡 推荐大多数 RTX/GTX 用户使用
Windows x64 (CUDA 13) NVIDIA 显卡 适用于较新的 NVIDIA 驱动
Windows x64 (Vulkan) AMD / Intel / NVIDIA 显卡 通用显卡加速版本
Windows x64 (SYCL) Intel Arc 显卡 Intel Arc 用户专用版本
Windows x64 (HIP) AMD Radeon 显卡 AMD 用户首选版本

注意:显卡用户别忘了下载下图主程序后面的DLLs文件,下载后把里面的内容解压到llama.ccp主程序的根目录里,不然无法使用显卡运行模型。

2、Hugging Face 下载本地 AI 大模型

Hugging Face 网址:https://huggingface.co

Qwen3.8 27B(MTP加速)本地大模型下载地址:https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/tree/main

夸克网盘下载地址:https://pan.quark.cn/s/93e55b48590e?pwd=a6MC

迅雷网盘下载地址:https://pan.xunlei.com/s/VP1UY-n3jiIwyOo_vBk3icSwA1?pwd=h79f

电脑配置选择推荐:

模型版本 文件大小 适用电脑 推荐说明
Qwen3.8-27B-GSQ-RCO-IQ2_XS 约 8.42 GB 8GB 显存及以上 体积最小
Qwen3.8-27B-GSQ-RCO-IQ2_XS-mtp 约 8.77 GB 8GB 显存及以上 支持 MTP 加速
Qwen3.8-27B-GSQ-RCO-IQ2_S 约 9.26 GB 8GB 显存及以上 效果与占用均衡
Qwen3.8-27B-GSQ-RCO-IQ2_S-mtp 约 9.61 GB 8GB 显存及以上 均衡且支持 MTP
Qwen3.8-27B-GSQ-RCO-IQ3_XXS 约 10.1 GB 12GB 显存及以上 精度进一步提升
Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp 约 10.4 GB 12GB 显存及以上 精度与速度兼顾
Qwen3.8-27B-GSQ-RCO-IQ3_S 约 11.8 GB 16GB 显存及以上 综合效果更好
Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp 约 12.1 GB 16GB 显存及以上 高精度且支持 MTP
mmproj-Qwen3.8-27B-BF16 约 931 MB -- 多模态

下载到的大模型放到 llama.ccp 程序的根目录下的 models 目录里(需自行创建目录)

3、配置启动脚本

创建启动脚本,命名成:启动.bat

@echo off
title Qwen3.8-27B GSQ+RCO - llama.cpp

cd /d "%~dp0"

echo.
echo ========================================
echo       XChaoGe.Com
echo       llama.cpp Local AI Server
echo ========================================
echo.

llama-server.exe ^
  -m "models\模型名" ^
  --mmproj "models\mmproj-Qwen3.8-27B-BF16.gguf" ^
  --no-mmproj-offload ^
  --host 127.0.0.1 ^
  --port 8085 ^
  -c 65536 ^
  -ngl 99 ^
  -fa auto ^
  --jinja ^
  --parallel 1 ^
  --alias Qwen3.8-27B-GSQ-RCO ^
  --temp 1.0 ^
  --top-p 0.95 ^
  --top-k 20 ^
  --min-p 0 ^
  --repeat-penalty 1.0 ^
  --spec-type draft-mtp ^
  --spec-draft-n-max 3

pause

访问控制面板 URL:

http://127.0.0.1:8085

代码说明:

-m "models\模型名" ^

--port 端口号 ^

接入参数:

Provider ID: llamacpp

显示名称: llamacpp

API 地址:http://127.0.0.1:8085/v1

API 协议: OpenAI Chat Completions

API Key: 随便填一个

添加模型:点击"获取可用模型"

上一篇6GB 显卡就能跑!Qwen-Image-2.1 无审查版图片 AI 模型|ComfyUI 本地部署教程 下一篇没有了