Qwen3.8-27B 压缩9倍!Bonsai 2 27B 多模态 AI 模型本地部署教程|接入 Hermes Agent

大家好,我是超哥。今天给大家分享 Bonsai 2 27B 多模态 AI 模型本地部署教程。它将 Qwen3.8-27B 压缩了约9倍,模型体积仅 5.9GB,让低配电脑可以运行,同时支持最高 262K上下文多模态图片识别。接下来我会带大家一步步完成模型的本地部署,并将它接入 Hermes Agent,实现工具调用网页操作等 Agent功能。下面我们开始教程。

博主电脑环境

显卡:NVIDIA RTX 4080 SUPER(16GB)

CPU:AMD R9 7900X 12-Core Processor(12核)

内存:64GB(3600 MHz)

一、Bonsai 2 27B 大模型下载

Hugging Face下载地址:https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf/tree/main

夸克网盘下载地址:https://pan.quark.cn/s/b922df5cf0d2?pwd=dp3u

注意:网盘下载地址里的内容一定要保存到你自己的网盘,我后面会删掉

电脑配置模型选择推荐(内存大的可以往下再提一格):

模型版本 文件大小 适用显存 推荐说明
Ternary-Bonsai-2-27B-PTQ1_0 约 5.95 GB 8GB 显存及以上 极致压缩
Ternary-Bonsai-2-27B-PQ2_0 约 7.21 GB 8GB 显存及以上 更高精度
Ternary-Bonsai-2-27B-F16 约 53.8 GB 64GB 显存及以上 完整精度
Ternary-Bonsai-2-27B-mmproj-Q8_0 约 629 MB -- 多模态
Ternary-Bonsai-2-27B-mmproj-BF16 约 931 MB -- 高精度多模态

X超哥推特(X):https://x.com/xchaoge

二、下载并配置 专属 llama.cpp

1、下载并安装 专属 llama.cpp

Github 下载地址:https://github.com/PrismML-Eng/llama.cpp/releases

夸克网盘下载地址:https://pan.quark.cn/s/78479f8614e9?pwd=hpka

版本 适用硬件 说明
Windows x64 (CPU) Intel / AMD x64 CPU 仅使用 CPU 运行,适用于没有独立显卡的 Windows 电脑
Windows arm64 (CPU) ARM 架构 Windows 设备 适用于 Snapdragon X Elite 等 ARM 平台
Windows x64 (CUDA 12.4) NVIDIA GeForce / RTX 显卡 NVIDIA 用户使用,支持 CUDA GPU 加速;需要匹配的 CUDA 12.4 DLL
Windows x64 (Vulkan) NVIDIA / AMD / Intel GPU 通过 Vulkan 使用 GPU 加速,适用于不同品牌的显卡
Windows x64 (HIP/ROCm) AMD Radeon 显卡 AMD 用户使用,通过 HIP/ROCm 进行 GPU 加速

注意:显卡用户别忘了下载下图主程序后面的DLLs文件,下载后把里面的内容解压到llama.ccp主程序的根目录里,不然无法使用显卡运行模型。

2、Bonsai 2 27B 接入 llama.cpp

把下载到的大模型放到 llama.ccp 程序的根目录下的 models 目录里(需自行创建目录)

3、配置启动脚本

llama.ccp 程序的根目录创建启动脚本,命名成:启动.bat

@echo off
title Ternary-Bonsai-2-27B - llama.cpp

cd /d "%~dp0"

echo.
echo ========================================
echo       XChaoGe.Com
echo       llama.cpp Local AI Server
echo ========================================
echo.

llama-server.exe ^
  -m "models\模型名" ^
  --mmproj "models\Ternary-Bonsai-2-27B-mmproj-BF16.gguf" ^
  --host 127.0.0.1 ^
  --port 8085 ^
  -c 65536 ^
  -ngl 99 ^
  -fa on ^
  --jinja ^
  --parallel 1 ^
  --alias Ternary-Bonsai-2-27B ^
  --temp 1.0 ^
  --top-p 0.95 ^
  --top-k 20 ^
  --min-p 0 ^
  --repeat-penalty 1.0 ^
  --cache-type-k q8_0 ^
  --cache-type-v q8_0 ^
  --reasoning on ^
  -n 32768

pause

访问控制面板 URL:

http://127.0.0.1:8085

参数说明:

参数 设置 说明
-m Ternary-Bonsai-2-27B-PTQ1_0.gguf 指定主模型文件
--mmproj BF16 启用多模态图片输入
--host 127.0.0.1 仅允许本机访问
--port 8085 设置服务端口
-c 65536 设置 64K 上下文长度
-ngl 99 尽可能将模型层加载到 GPU
-fa on 启用 Flash Attention
--jinja 开启 启用 Jinja Chat Template
--parallel 1 同时处理 1 个请求
--alias Ternary-Bonsai-2-27B 设置模型名称
--temp 1.0 控制生成随机性
--top-p 0.95 控制 Token 采样范围
--top-k 20 限制候选 Token 数量
--min-p 0 不设置额外的 Min-P 过滤
--repeat-penalty 1.0 不额外惩罚重复 Token
--cache-type-k q8_0 K Cache 使用 Q8_0 精度
--cache-type-v q8_0 V Cache 使用 Q8_0 精度
--reasoning on 开启推理模式
-n 32768 单次最多生成 32768 Token

三、接入 Hermes Agent

Hermes Agent 下载地址:https://hermes-agent.nousresearch.com/

夸克网盘下载地址:https://pan.quark.cn/s/fd2e158b2d8b?pwd=RtRG

OpenAI api 参数:

API 秘钥: 随便填一个

Base URL:http://127.0.0.1:8085/v1

上一篇低显存也能跑!Qwen3.8-35B-A3B 多模态 AI 模型本地部署教程|接入Hermes Agent 下一篇没有了