4GB 显卡就能跑!微软 FrogNano 4B 多模态 AI 模型本地部署教程|图片识别 + 131K 上下文|接入 Hermes Agent

大家好,我是超哥。今天给大家分享 微软 FrogNano 4B 多模态 AI 模型的本地部署教程。这个模型最大的特点就是体积非常小,最小量化版本只有 1.65GB,4GB 显卡就可以运行,同时支持图片识别和 131K 上下文长度。模型部署到自己的电脑上之后,不需要 API Token,也不需要联网,就可以直接本地运行。我还会带大家将它接入 Hermes Agent,实现工具调用等 Agent 功能。我们直接开始教程。

博主电脑环境

显卡:NVIDIA RTX 4080 SUPER(16GB)

CPU:AMD R9 7900X 12-Core Processor(12核)

内存:64GB DDR5(3600 MHz)

一、FrogNano 4B 大模型下载

Hugging Face模型下载地址:https://huggingface.co/bartowski/FrogNano-4B-2609-GGUF

夸克网盘模型下载地址:https://pan.quark.cn/s/81c483c396c5?pwd=62ax

迅雷网盘模型下载地址:https://pan.xunlei.com/s/VP3AfyEJuQjNbyD58A0eEcheA1?pwd=4gvi

电脑配置模型选择推荐(内存大的可以往下再提一格):

模型版本 文件大小 适用显存 推荐说明
FrogNano-4B-2609-IQ2_M 约 1.65 GB 4GB 显存及以上 极限低显存
FrogNano-4B-2609-Q2_K 约 1.80 GB 4GB 显存及以上 最低量化
FrogNano-4B-2609-IQ3_XXS 约 1.98 GB 4GB 显存及以上 低显存推荐
FrogNano-4B-2609-IQ3_XS 约 2.05 GB 4GB 显存及以上 低显存推荐
FrogNano-4B-2609-Q3_K_S 约 2.04 GB 4GB 显存及以上 3-bit 低显存
FrogNano-4B-2609-Q3_K_M 约 2.14 GB 4GB 显存及以上 3-bit 均衡
FrogNano-4B-2609-Q3_K_L 约 2.24 GB 4GB 显存及以上 3-bit 高质量
FrogNano-4B-2609-IQ3_M 约 2.35 GB 4GB 显存及以上 3-bit 高质量
FrogNano-4B-2609-Q4_K_S 约 2.62 GB 6GB 显存及以上 4-bit 低显存
FrogNano-4B-2609-Q4_0 约 2.72 GB 6GB 显存及以上 4-bit 基础
FrogNano-4B-2609-IQ4_NL 约 2.79 GB 6GB 显存及以上 4-bit 高质量
FrogNano-4B-2609-Q4_K_M 约 2.80 GB 6GB 显存及以上 4-bit 推荐
FrogNano-4B-2609-Q4_1 约 2.92 GB 6GB 显存及以上 4-bit 高质量
FrogNano-4B-2609-Q4_K_L 约 2.97 GB 6GB 显存及以上 4-bit 高质量
FrogNano-4B-2609-Q5_K_S 约 3.15 GB 6GB 显存及以上 5-bit 高质量
FrogNano-4B-2609-Q5_K_M 约 3.36 GB 8GB 显存及以上 5-bit 推荐
FrogNano-4B-2609-Q6_K_S 约 3.61 GB 8GB 显存及以上 6-bit 高质量
FrogNano-4B-2609-Q6_K 约 3.76 GB 8GB 显存及以上 6-bit 高精度
FrogNano-4B-2609-Q6_K_L 约 3.92 GB 8GB 显存及以上 6-bit 高精度
FrogNano-4B-2609-Q8_0 约 4.62 GB 10GB 显存及以上 高精度量化
FrogNano-4B-2609-bf16 约 8.67 GB 12GB 显存及以上 原始精度
mmproj-FrogNano-4B-2609-f16 约 672 MB -- 多模态视觉模块
mmproj-FrogNano-4B-2609-bf16 约 676 MB -- 多模态视觉模块

二、下载并配置 llama.cpp

1、下载并安装 llama.cpp

Github项目下载地址:https://github.com/ggml-org/llama.cpp/releases

夸克网盘项目下载地址:https://pan.quark.cn/s/783acfb7a4c0?pwd=Uywu

迅雷网盘项目下载地址:https://pan.xunlei.com/s/VP3AQD5UlRKP3JmuClmz_7HiA1?pwd=yufk

版本 适用硬件 说明
Windows x64 (CPU) Intel / AMD CPU 仅使用处理器运行
Windows arm64 (CPU) ARM 架构 Windows 设备 适用于骁龙 X Elite 等 ARM 平台
Windows x64 (CUDA 12) NVIDIA 显卡 推荐大多数 RTX/GTX 用户使用
Windows x64 (CUDA 13) NVIDIA 显卡 适用于较新的 NVIDIA 驱动
Windows x64 (Vulkan) AMD / Intel / NVIDIA 显卡 通用显卡加速版本
Windows x64 (SYCL) Intel Arc 显卡 Intel Arc 用户专用版本
Windows x64 (HIP) AMD Radeon 显卡 AMD 用户首选版本

注意:显卡用户别忘了下载下图主程序后面的DLLs文件,下载后把里面的内容解压到llama.ccp主程序的根目录里,不然无法使用显卡运行模型。

2、FrogNano 4B 接入 llama.cpp

把下载到的大模型放到 llama.ccp 程序的根目录下的 models 目录里(需自行创建目录)

3、配置启动脚本

llama.ccp 程序的根目录创建启动脚本,命名成:启动.bat

@echo off
title FrogNano-4B-2609-BF16 - llama.cpp

cd /d "%~dp0"

echo.
echo ========================================
echo       XChaoGe.Com
echo       llama.cpp Local AI Server
echo ========================================
echo.
echo       FrogNano-4B-2609
echo.

llama-server.exe ^
  -m "models\模型名" ^
  --mmproj "models\多模态名" ^
  --host 127.0.0.1 ^
  --port 8085 ^
  -c 65536 ^
  --fit on ^
  -fa auto ^
  --jinja ^
  --parallel 1 ^
  --alias FrogNano-4B-2609^
  --temp 0.6 ^
  --top-p 0.95 ^
  --top-k 20 ^
  --repeat-penalty 1.05 ^
  --cache-type-k q8_0 ^
  --cache-type-v q8_0 ^
  -n 32768

pause

访问控制面板 URL:

http://127.0.0.1:8085

参数说明:

参数 设置 说明
-m 量化模型名称 指定 FrogNano 4B BF16 主模型
--mmproj 多模态模型名称 加载视觉投影模块,启用图片输入能力
--host 127.0.0.1 仅允许本机访问
--port 8085 设置 llama.cpp API 服务端口
-c 65536 设置 64K 上下文长度
--fit on 根据设备显存情况自动调整模型加载参数
-fa auto 自动使用 Flash Attention
--jinja 开启 启用模型聊天模板
--parallel 1 同时处理 1 个请求
--alias FrogNano-4B-2609-BF16 设置 API 中显示的模型名称
--temp 0.6 控制生成内容的随机性
--top-p 0.95 控制候选 Token 的采样范围
--top-k 20 限制候选 Token 数量
--repeat-penalty 1.05 降低生成内容重复
--cache-type-k q8_0 K Cache 使用 Q8_0 量化,降低 KV Cache 显存占用
--cache-type-v q8_0 V Cache 使用 Q8_0 量化,降低 KV Cache 显存占用
-n 32768 最多生成 32768 Token

三、接入 Hermes Agent

Hermes Agent 下载地址:https://hermes-agent.nousresearch.com/

夸克网盘下载地址:https://pan.quark.cn/s/fd2e158b2d8b?pwd=RtRG

OpenAI api 参数:

API 秘钥: 随便填一个

Base URL:http://127.0.0.1:8085/v1

感谢您的支持

支付宝
微信支付

感谢您的支持

支付宝收款二维码

打开支付宝扫描二维码(崔*杰)

感谢您的支持

微信支付收款二维码

打开微信扫描二维码(崔*杰)

上一篇无审查版来了!Qwen3.8-Flash-Next Strata版 AI 大模型本地部署教程|MTP 加速 8GB 显卡就能跑 下一篇没有了