大家好,我是超哥。今天给大家分享 Qwen3.8-Flash-Next 无审查版本地部署教程。这次使用 Strata 推理引擎和 MTP 加速,可以有效提升模型的推理速度,同时支持 262K 超长上下文和图片输入。不需要 API Token,直接在电脑上本地运行。我们开始教程。

博主电脑环境
显卡:NVIDIA RTX 4080 SUPER(16GB)
CPU:AMD R9 7900X 12-Core Processor(12核)
内存:64GB(3600 MHz)
一、Strata 项目下载
Github 项目地址:https://github.com/Niko1221/Strata
夸克网盘 项目下载地址:https://pan.quark.cn/s/125028a5a3fa?pwd=XaUN
迅雷网盘 项目下载地址:https://pan.xunlei.com/s/VP31ajix0yCevYHQyFrzkt7WA1?pwd=dke7
二、无审查模型下载
Hugging Face 下载地址:https://huggingface.co/SC117/Qwen3.8-Flash-Next-GSQ-RCO-abliterated-GGUF/tree/main
夸克网盘 项目下载地址:https://pan.quark.cn/s/addda4b492b0?pwd=w8pu
迅雷网盘 项目下载地址:https://pan.xunlei.com/s/VP31Sn7z__paCDs8k7XuXo85A1?pwd=5jkg
电脑配置模型选择推荐(内存大的可以往下再提一格):
| 模型版本 | 文件大小 | 适用显存 | 推荐说明 |
|---|---|---|---|
| Q2_0 | 约 66.4 GB | 8GB 显存及以上 | 最低量化,速度优先 |
| IQ2_XS | 约 68.0 GB | 8GB 显存及以上 | 低显存推荐,质量略高于 Q2_0 |
| IQ3_XXS | 约 75.8 GB | 12GB 显存及以上 | 3-bit 量化,质量更高 |
| IQ3_S | 约 83.6 GB | 16GB 显存及以上 | 高质量推荐 |
| mtp-q2_0.gguf | 约 0.89 GB | -- | MTP 加速模块,提升推理速度 |
| strata/rt | 约 824 MB | -- | MTP 运行时文件,供 Strata 加载 MTP 加速模块 |
| mmproj-Qwen3.8-Flash-Next-BF16.gguf | 约 0.91 GB | -- | 视觉模块,支持图片输入 |
strata/rt 里面的文件放到这个目录:\Strata-data\mtp\rt
三、模型、数据路径修改
1. 创建文件夹
保存模型到D盘,在D盘创建文件夹:Strata-Models、Strata-data
2. 修改启动文件路径
修改项目根目录下的 START-HERE.bat,把里面的
".venv\Scripts\python.exe" setup.py %*
改成
".venv\Scripts\python.exe" setup.py --gguf-dir "D:\Strata-Models" --data-dir "D:\Strata-data" %*
其中 D:\Strata-Models 就是保存下载模型的路径,其中 D:\Strata-data 是 Strata 转换过程产生数据的路径,这两个都需要大空间,这个可以根据自己的情况修改