【超级重磅·全网独一】离线版局域网AI聊天工具
2026/9/13 8:35:03 网站建设 项目流程

离线版AI工具,基于llama.cpp的升级版本,只要一个电脑开了,整个局域网都能用!!

适合在受限的局域网(如机房)使用

支持更换换gguf AI离线模型(自带DeepSeek-R1-Distill-Qwen-1.5B-Q3_K_M.gguf)!!

支持MTP模型!

MTP(Multi-Token Prediction,多 Token 预测)是一种先进的投机解码技术,它让模型在生成文本时一次性预测多个后续 Token,而不是逐字生成,从而显著提升推理速度。本工具内置的 llama.cpp 推理引擎(b10644 版本)原生支持 MTP 投机解码,配合带 MTP 头的 GGUF 模型,可以在纯 CPU 环境下获得更快的响应体验。

更绝的是,它还支持查看上下文占用空间、导出对话等

运行效果

服务器:

网页:


局域网 AI 聊天服务器 使用说明

资源已和此文档绑定,直接下载启用即可

过几天将发送源代码,现在不行,请谅解(你可以下载我的资源)

【配置文件 config.ini】(必看)
Port = 9090 HTTP 端口。默认 9090;被占用时自动每次 +5
(9095、9100...)直到找到空闲端口
CtxSize = 4096 上下文窗口(tokens)。改大会占更多内存
MaxTokens = 2048 单次回答最大长度(tokens)
Model = ... 模型文件名(放在 models 文件夹内)
Mtp = 0 MTP(多 token 预测)投机解码开关
MtpDraft = 3 每次草稿预测 token 数(Mtp=1 时生效)
修改后重启服务器生效。

【这是什么】
一个完全离线运行的局域网 AI 聊天工具:
- 在本机(Windows)运行,其他电脑用浏览器即可访问,无需安装任何软件
- AI 模型为 DeepSeek-R1-Distill-Qwen-1.5B(Q3_K_M 量化),由本机 CPU 提供算力
- 同一时间只处理一个用户的对话,其他用户自动排队
- 聊天记录保存在各自的浏览器缓存中(不清浏览器缓存就一直都在)

【如何启动】
方法一:双击 start.bat
方法二:双击 server.exe
启动后控制台会显示访问网址,例如:
本机访问: http://127.0.0.1:9090
局域网访问: http://192.168.x.x:9090
把"局域网访问"的网址发给同事/朋友,用浏览器打开即可聊天。

【文件夹说明】
server.exe 主程序(静态编译,无需任何运行库)
start.bat 一键启动脚本
config.ini 配置文件(端口、上下文大小等,可改)
web\index.html 网页界面(独立文件,可自行美化)
llama\ 内置 llama.cpp 推理引擎及运行库
models\ 模型文件(GGUF)
server.log 运行日志(自动追加)

【常用功能】
- 连续对话:直接接着问,AI 记得前面的内容
- 上下文剩余:左侧面板实时显示本轮对话的上下文占用
- 排队状态:左侧面板显示你的排队位置和当前生成速度
- 停止生成:生成过程中点"■ 停止"即可中断
- 新对话:清空当前浏览器中的聊天记录
- 导出:把聊天记录保存为文本文件
- 写代码:直接说需求,模型擅长 Python;代码块可一键复制
- 思考过程:AI 的"深度思考"内容可点击展开/收起

【关于 MTP 模型】
- 内置引擎 llama.cpp b10644 支持 MTP(多 token 预测)投机解码,
可显著提高生成速度
- 使用条件:模型 GGUF 文件必须自带 MTP 头(mtp.* 张量)。
当前默认的 DeepSeek-R1-Distill-Qwen-1.5B 不支持 MTP
- 使用步骤:
1. 下载带 MTP 头的 GGUF 模型(如 DeepSeek-V3/R1-MTP 或社区
MTP 微调模型),放入 models 文件夹
2. config.ini 中把 Model 改成新模型文件名,并把 Mtp 改为 1
3. 重启服务器;若模型没有 MTP 头,启动日志会给出明确报错

【控制台命令】
quit 或 q 退出服务器
status 查看当前队列状态
help 查看帮助

【常见问题】
1. 其他电脑打不开网页?
- 检查两台电脑是否在同一局域网(能互相 ping 通)
- 检查本机 Windows 防火墙是否放行了 server.exe
(首次运行弹出防火墙提示时请点"允许访问";
若没弹,请到 控制面板→Windows Defender 防火墙→允许应用通过防火墙 手动放行)
- 确认访问的网址是控制台显示的"局域网访问"地址

2. 启动失败?
- 看控制台日志:模型文件缺失、llama 文件夹不完整都会给出明确提示
- 内存不足:请保证至少 3GB 空闲内存

3. 回复很慢?
- 纯 CPU 推理,速度取决于电脑 CPU 性能
- 首次提问会稍慢(模型加载),之后正常
- 可减小"输出"长度或换更小的模型

4. 换电脑使用?
直接把整个 AI-Chat-Server 文件夹拷到任意 Windows 电脑
(Win7 及以上,64 位),双击 start.bat 即可,不需要安装任何运行库。

【技术说明】
- 主程序 server.exe 由 MinGW-w64 静态编译,仅依赖 Windows 系统自带
DLL(kernel32/msvcrt/ws2_32/iphlpapi),无需安装 VC++ 运行库
- llama 引擎所需运行库(vcruntime140 等)已随附在 llama 文件夹内
- 模型:DeepSeek-R1-Distill-Qwen-1.5B-Q3_K_M.gguf(约 882MB)
- 网页与程序完全分离,可自行修改 web\index.html 定制界面

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询