无审查版来了!Qwen3.8-Flash-Next Strata版 AI 大模型本地部署教程|MTP 加速 8GB 显卡就能跑

大家好,我是超哥。今天给大家分享 Qwen3.8-Flash-Next 无审查版本地部署教程。这次使用 Strata 推理引擎和 MTP 加速,可以有效提升模型的推理速度,同时支持 262K 超长上下文和图片输入。不需要 API Token,直接在电脑上本地运行。我们开始教程。

博主电脑环境

显卡:NVIDIA RTX 4080 SUPER(16GB)

CPU:AMD R9 7900X 12-Core Processor(12核)

内存:64GB(3600 MHz)

一、Strata 项目下载

Github 项目地址:https://github.com/Niko1221/Strata

夸克网盘 项目下载地址:https://pan.quark.cn/s/125028a5a3fa?pwd=XaUN

迅雷网盘 项目下载地址:https://pan.xunlei.com/s/VP31ajix0yCevYHQyFrzkt7WA1?pwd=dke7

二、无审查模型下载

Hugging Face 下载地址:https://huggingface.co/SC117/Qwen3.8-Flash-Next-GSQ-RCO-abliterated-GGUF/tree/main

夸克网盘 项目下载地址:https://pan.quark.cn/s/addda4b492b0?pwd=w8pu

迅雷网盘 项目下载地址:https://pan.xunlei.com/s/VP31Sn7z__paCDs8k7XuXo85A1?pwd=5jkg

电脑配置模型选择推荐(内存大的可以往下再提一格):

模型版本 文件大小 适用显存 推荐说明
Q2_0 约 66.4 GB 8GB 显存及以上 最低量化,速度优先
IQ2_XS 约 68.0 GB 8GB 显存及以上 低显存推荐,质量略高于 Q2_0
IQ3_XXS 约 75.8 GB 12GB 显存及以上 3-bit 量化,质量更高
IQ3_S 约 83.6 GB 16GB 显存及以上 高质量推荐
mtp-q2_0.gguf 约 0.89 GB -- MTP 加速模块,提升推理速度
strata/rt 约 824 MB -- MTP 运行时文件,供 Strata 加载 MTP 加速模块
mmproj-Qwen3.8-Flash-Next-BF16.gguf 约 0.91 GB -- 视觉模块,支持图片输入

strata/rt 里面的文件放到这个目录:\Strata-data\mtp\rt

三、模型、数据路径修改

1. 创建文件夹

保存模型到D盘,在D盘创建文件夹:Strata-Models、Strata-data

2. 修改启动文件路径

 修改项目根目录下的 START-HERE.bat,把里面的 

".venv\Scripts\python.exe" setup.py %*

改成

".venv\Scripts\python.exe" setup.py --gguf-dir "D:\Strata-Models" --data-dir "D:\Strata-data" %*

其中 D:\Strata-Models 就是保存下载模型的路径,其中 D:\Strata-data 是 Strata 转换过程产生数据的路径,这两个都需要大空间,这个可以根据自己的情况修改

上一篇6GB显卡就能跑!Tiel-Coder-35B-A3B 多模态 AI 编程模型本地部署教程|代码能力实测|MTP加速|性能实测|接入 Hermes Agent 下一篇没有了