☰
国企转大模型:模型进不了公网,能力要求反而更清楚
2026/9/26 19:32:47 网站建设 项目流程

版权与内容来源声明
本文为原创整理。文中涉及官方文档、开源仓库、论文与公开报道的内容,均在附表 A 中标注来源;引用官方原文保持原样,不作改写。文中命令、版本号与界面截图以本文成文时的实测/核验结果为准,标注「待验证」的部分请以你本地环境实际输出为判断依据。本文不推荐任何不合规的软件获取方式,也不对任何收益结果作承诺。转载请注明出处。

第1章 内网环境的三个硬约束

很多人一听到"国企、事业单位、内网"做 AI,第一反应是:配置肯定高,活儿肯定少。真实情况是反过来的——这些地方对大模型的热情一点不低,但落地时被三道墙卡得死死的。这三道墙不是"麻烦一点",而是直接改变了你做这个项目的方式。

本文想说的一个核心判断是:断网不是"减配",它把「先上线再慢慢调」这条路直接掐断了。没有外网就没有"先试一下",所以评测必须前置、验收指标必须提前写死。约束越硬,需求反而被迫写得越清楚。这一章先把约束讲清楚。

1.1 没有外网,意味着没有"调一下 API 试试"

在公网环境里,你做 AI 应用最常见的起点是:注册一个云厂商账号,拿个 API Key,写几行代码调一下,看效果。这个"看效果"的成本几乎为零,于是很多需求都是先跑起来、再边看边改。

内网环境里这一步直接消失。模型权重、基础依赖、甚至 Python 包都可能要离线获取。你没法临时去拉一个开源组件,也没法用公共的向量服务或者公共大模型兜底。换句话说,从你决定做的那一刻起,所有东西都得自己备齐、自己验证。

1.2 数据不出域,语料和模型都不能随便进出

"数据不出域"是内网项目最常听到的一句话。落到操作上就是:业务数据不能传到外部,模型也不能把内部数据带出去。这一点在法规上是有锚点的——"数据不出域"的实践,对应的是《数据安全法》建立的数据分类分级保护框架(第二十一条明确国家建立数据分类分级保护制度,并加强对重要数据的保护),以及《个人信息保护法》第三十八条对个人信息向境外提供的严格条件。

对内网项目而言,这带来两个直接后果:一是你几乎不能依赖任何"把数据发到云端再处理"的现成方案;二是你连"用公开语料顺手训一下"都要先问清楚合规边界。

1.3 变更要审批,上线不是你说上就上

内网系统的每一次变更,往往要走过审批、测试、留痕这一整套流程。这和外网"改完发版、灰度一下"的节奏完全不同。它的影响是:你不能指望"先上一个版本,出问题再回滚",因为回滚本身也是一次变更、也要走流程。

把 1.1、1.2、1.3 合起来看,最关键的不是"慢",而是:你失去了"先上线再慢慢调"的退路。这恰好是本文与"部署形态"类文章的区别——别人讲怎么把模型装起来,本文讲装起来之前,你到底要先想清楚什么。

第2章 约束倒逼出来的好处:模糊需求被迫写成可验收指标

听到这里,你可能觉得内网做 AI 全是坏事。但换一个角度,这些约束其实帮你解决了一个在外网环境里长期被忽视的问题:需求模糊。

2.1 "先试一下"为什么在外网成立

外网项目的典型路径是:老板说"做个智能问答",你拉个 API、接个数据库,三天出个 demo,大家围着看。哪里不对现场改,改到差不多就上线。这套打法能成立,前提是"试"的成本足够低——算力是租的,数据是现成的,回滚是自由的。

所以它纵容了一种习惯:需求可以先用 demo 去"碰",碰出感觉再定型。

2.2 内网下,模糊需求的代价被放大

内网里"碰"的成本极高:每一次试错都要消耗离线准备的资源,每一次调整都可能触发审批,更重要的是——你没法拿一个半成品去"碰"业务方,因为半成品在断网环境下连跑通都费劲。

于是模糊需求在这里会变得特别刺眼。一个"做个智能客服"的需求,如果在动手前不写清楚"回答准确率要到多少、响应要在几秒内、哪些问题必须拒答",那么这个项目要么卡在内网跑不通,要么上线即返工。约束越硬,把需求写清楚这件事就越不是"软要求",而是"能不能交付"的硬前提。

2.3 把需求翻译成可验收指标:一个模板

建议你在动手前,先逼业务方和你一起填一张表。示例如下:

需求项模糊说法(不做)可验收指标(要做)
回答准确性“回答要准”“在 200 条内部测试集上,关键事实类问题准确率不低于 90%”
响应速度“别太慢”“单次问答端到端延迟不超过 3 秒”
拒答边界“敏感的不答”“涉及内部人事、未公开财务的问题必须返回标准拒答话术”
覆盖程度“能回答问题”“覆盖已整理知识库条目的 80% 以上”

这张表的价值不在于数字多精确,而在于它把"好"定义成了可以测量、可以签字的东西。本文后面第 5 章会讲,这种"先把标准立起来"的思路,正好和业界评测集(evals)的设计哲学一致。

第3章 选型要看什么:显存、许可证、中文能力、离线更新

模型选型是内网项目最容易"凭感觉"的环节,也是最容易埋雷的环节。本章讲四个维度,但刻意不给你"哪个模型最好"的结论——因为脱离你的显存、合规和语料现状,任何"最好"都是空话。

3.1 显存是第一道门槛

内网里你大概率拿不到集群级算力,所以显存(GPU 显存)直接决定了你能跑多大参数的模型。下面是一组常见规模下的经验区间,具体显存占用以你本地环境实际输出为准(标注待验证):

参数规模(约)常见量化方式大致显存占用(经验区间,待验证)
7B 级别4-bit 量化约 4–6 GB
13B 级别4-bit 量化约 8–10 GB
34B 级别4-bit 量化约 18–22 GB
70B 级别4-bit 量化约 35–40 GB

注意这是"推理"的粗略参考,不含微调所需额外显存。先量好自己的卡,再去反推能选什么,而不是反过来。

⚠️代码待验证

# 查看本机 GPU 与显存占用(内网机器需确认已装驱动与监控工具)nvidia-smi --query-gpu=name,memory.total,memory.used--format=csv

3.2 许可证决定你能不能商用:Apache-2.0 / MIT / 自定义许可

这是内网、尤其是国企项目最容易被忽略、却最要命的一点。模型能不能用、能不能改、能不能在公司内部署给业务用,不取决于它"效果多好",而取决于它的许可证。

先看清两类主流开源许可证的官方表述(原文照抄,不作改写):

Apache License 2.0 在"Grant of Copyright License"中明确授予:“each Contributor hereby grants to You a perpetual, worldwide, non-exclusive, no-charge, royalty-free, irrevocable copyright license to reproduce, prepare Derivative Works of, publicly display, publicly perform, sublicense, and distribute the Work”。它的"Grant of Patent License"同样授予"make, have made, use, offer to sell, sell, import, and otherwise transfer the Work"的专利许可。简单说:可以商用、可以修改、可以再分发,但要保留声明、改过的文件要标注。

MIT License 的授权句更短:“Permission is hereby granted, free of charge, to any person obtaining a copy of this software … to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software”。同样允许商用与再分发,条件只是保留版权与许可声明。

许可证能否商用能否修改再分发专利授权要注意的点
Apache-2.0可以可以明确包含改文件要标注、保留 NOTICE
MIT可以可以不含专门专利条款保留版权与许可声明即可
自定义社区许可视条款而定常带限制视条款而定务必逐字读约束,部分对商业使用设门槛

关键提醒:很多模型的权重附带"自定义补充条款",可能对商业使用、月活或营收设限制。本文无法为你核实某一个具体模型的许可细节(待验证),正确做法是:选定候选模型后,逐字读它的 LICENSE 文件和附带的社区许可,确认允许你的使用场景再动手。

3.3 中文能力与离线更新

内网场景以中文业务为主,所以要重点看模型在中文任务上的表现,而不是只看英文榜单。离线更新则是指:公网模型会持续迭代,但内网模型一旦落地,版本就"冻结"了。你要确认自己能定期从可信源离线获取更新包,而不是指望实时联网升级。

第4章 语料必须自备:内网没有公开语料可依赖

外网做 RAG 或微调,很多人默认"网上语料多的是"。内网里这个默认不成立。

4.1 为什么公开语料在内网用不了

公开语料要么涉及版权与合规,要么和你的业务毫无关系。更重要的是,内网项目要答的是"本公司制度、本系统操作、本行业规定"这类问题,公开语料里根本没有。所以内网大模型的质量,本质上取决于你自己的语料库,而不是模型本身多大。

4.2 内网语料从哪来

语料来源可用性注意事项
历史工单与客服记录高去敏、脱敏后再入库
内部制度文档与操作手册高注意密级,非公开文档须确认可入库
已有 FAQ 与知识库中高常与业务系统绑定,需导出权限
业务人员口述整理中需多人核对,避免个人偏见

这一章和法规是直接挂钩的。根据《生成式人工智能服务管理暂行办法》第七条,提供者开展训练数据处理活动应当"使用具有合法来源的数据和基础模型"。虽然该办法第二条明确:行业组织、企业、教育和科研机构等"未向境内公众提供生成式人工智能服务的",不适用本办法——也就是说纯内网、不对公众服务的内部系统,监管口径不同。但"合法来源"这一条,无论是否适用本办法,都是底线。

4.3 语料合规:合法来源是底线

把语料入库前,至少要回答三个问题:这份材料是否允许用于模型训练?是否含个人信息、是否需要单独同意?是否含密级、能否进这个域?答不清的,宁可先不放。内网项目里,语料合规出问题,比模型效果差严重得多。

第5章 评测前置:断网后没法"试试看",只能先把测试集做出来

这是全文最关键的一章,也是"断网不是减配"这个判断的落点。

5.1 为什么评测必须前置

外网里你可以"上线看反馈",因为反馈回路短、试错便宜。内网里反馈回路被拉长、试错被审批卡住,所以你必须在模型进内网之前,就把"它行不行"这件事用一组固定的题目测出来。这就是"评测前置"。

OpenAI 官方对评测(evals)的定义很清晰:“Evaluations (often called evals) test model outputs to ensure they meet style and content criteria that you specify.” 它进一步指出一个 eval 需要两个关键要素:data_source_config(测试数据的结构)和testing_criteria(判定对错的评分器)。官方还把这个过程类比行为驱动开发(BDD):“you begin by specifying how the system should behave before implementing and testing the system”——先写清楚系统该是什么样,再实现和测试。

5.2 一个可操作的测试集做法

不需要云端工具,你完全可以在内网用一份 JSONL 文件把测试集固化下来。每条数据包含"输入"和"标准答案(ground truth)":

{"item": {"question": "差旅报销的审批流程是什么?", "expected": "需部门负责人审批后提交财务,单笔超5000元须分管领导复核"}} {"item": {"question": "如何重置内网邮箱密码?", "expected": "通过统一身份门户的'安全中心'发起,不支持电话重置"}} {"item": {"question": "未公开财务数据能对外提供吗?", "expected": "必须返回标准拒答话术,不得泄露"}}

然后写一个最简单的离线评分脚本,把模型输出和标准答案做比对。下面这段是示意,未实际运行:

⚠️代码待验证

# 离线评测示意:逐条比对模型输出与标准答案(示意,未实际运行)defgrade(output:str,expected:str)->bool:# 真实场景可用包含关系、关键词命中或调用另一个模型打分returnexpected[:10]inoutputdefrun_eval(testset:list[dict],ask_model)->float:hits=0forcaseintestset:out=ask_model(case["item"]["question"])ifgrade(out,case["item"]["expected"]):hits+=1returnhits/len(testset)iftestsetelse0.0

评分标准本身就来自第 2 章那张验收指标表:准确率到多少算过、拒答边界怎么判。把这套东西固化成文件,每次换模型、换语料都跑同一份,结果才有可比性。

5.3 验收指标怎么写死

"写死"不是僵化,而是把第 2 章的表变成评测脚本里的硬阈值。例如:准确率低于 90% 不许进内网;任意一条涉敏问题没拒答,整批打回。这样,断网环境里你没法"试试看"的短板,就被"事先测过"补上了。

这份资料是什么:这一章讲的"先把测试集做出来"是内网部署能不能落地的分水岭,资料包里有一份可直接照抄的评测集模板与用例清单,和本章的验收指标写法配套。放在资料包里,扫码即可获取:

第6章 要补的能力 + 简历与面试角度 + 练习

讲完方法和纪律,落到你这个人身上:从传统技术岗转过来,到底要补什么、怎么证明自己。

6.1 传统经验哪些能复用

你的旧岗位能直接复用的部分需要新补的部分
后端 / Java服务化、接口、权限与日志思维向量检索、提示词工程、模型评测
运维环境、部署、监控、离线分发GPU 显存与推理服务调优
测试用例设计、验收标准把测试用例改写成评测集
数据分析数据清洗、质量判断语料合规、去敏处理
前端交互与界面调用本地推理接口、流式渲染

核心结论是:你过去的工程能力没有作废,只是换了个对象。最值钱的是"把模糊需求变成可验收标准"的能力——这恰恰是内网项目最稀缺的。

6.2 要补的三块能力

第一,模型评测能力:会做测试集、会定义评分器、会用数字说话,而不是"感觉还行"。

第二,私有化部署与离线运维:能在无外网环境把模型跑通、把依赖备齐、把更新包管起来。

第三,语料与合规意识:知道什么数据能用、什么必须脱敏、什么碰都不能碰。

6.3 简历与面试怎么讲这个项目

别写"用大模型做了个系统"这种空话。建议这样讲:我在一个无外网、数据不出域的环境里,主导把某业务问答模型落地;我先和业务方把验收指标写死成一张表,再自建测试集做评测前置,最终在固定硬件上把准确率做到 X、把涉敏拒答做到全覆盖。这段表述同时展示了工程能力、方法论和合规意识,比单纯堆技术名词更打动人。

下面给一个离线准备依赖的示意(未实际运行,依赖包名与版本以你本地环境实际输出为准):

⚠️代码待验证

# 内网离线安装:先在有网机器下载 wheel,再拷到内网用本地路径安装(示意)pip download-d./offline_pkgs-rrequirements.txt# 在内网机器执行:pipinstall--no-index --find-links ./offline_pkgs-rrequirements.txt

第7章 小结

回到开头那句话:断网不是"减配",它把「先上线再慢慢调」这条路直接掐断了。

对一个想从传统技术岗转 AI 大模型的你来说,内网环境反而把几件在外网被"试一下"掩盖的事逼到了台前:需求必须写清楚、选型必须看许可证、语料必须自备且合规、评测必须前置。这些不是负担,而是让"能力要求"变清楚的过程。

所以国企、事业单位、内网 IT 岗转大模型,难的不是技术本身,而是把过去"先跑起来"的习惯,改成"先想清楚、先测清楚"。谁先把这套方法练出来,谁就在这一类项目里最稀缺。

这份资料是什么:这一章把"内网转大模型要补的三块能力"和"简历怎么讲"收了尾,资料包里有一份按岗位对照的能力清单与项目表述模板,和本章配套。放在资料包里,扫码即可获取:

附表 A:本文引用事实与出处对照表

事实出处本文位置
《生成式人工智能服务管理暂行办法》由国家互联网信息办公室等七部门令(第15号)公布,自 2023 年 8 月 15 日起施行中央网信办 cac.gov.cn,标题《生成式人工智能服务管理暂行办法》,公布日期 2023 年 7 月 10 日,施行日期 2023 年 8 月 15 日(https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm)第4章 4.2、4.3
该办法第七条:训练数据处理活动应"使用具有合法来源的数据和基础模型"同上,cac.gov.cn 原文第七条第4章 4.2
该办法第二条:未向境内公众提供生成式人工智能服务的研发应用,不适用本办法同上,cac.gov.cn 原文第二条第4章 4.2
《数据安全法》第二十一条:国家建立数据分类分级保护制度,加强对重要数据的保护全国人大常委会通过,2021 年 6 月 10 日(https://www.cac.gov.cn/2021-06/15/c_1625341228851523.htm 专家解读引用原文)第1章 1.2
《个人信息保护法》第三十八条:向境外提供个人信息应具备安全评估、认证、标准合同等条件之一全国人大常委会通过,2021 年 8 月 20 日(https://cpc.people.com.cn/BIG5/n1/2021/0823/c64387-32203184.html 原文)第1章 1.2
Apache License 2.0 授权语句:“perpetual, worldwide, non-exclusive, no-charge, royalty-free, irrevocable copyright license to reproduce, prepare Derivative Works …”Apache 软件基金会官方文本(https://www.apache.org/licenses/LICENSE-2.0.txt)第3章 3.2
MIT License 授权语句:“Permission is hereby granted, free of charge, to any person obtaining a copy of this software … to deal in the Software without restriction …”Open Source Initiative 官方文本(https://opensource.org/license/mit)第3章 3.2
OpenAI 官方定义:evals 测试模型输出是否满足指定标准;eval 需 data_source_config 与 testing_criteria 两要素;类比 BDDOpenAI 开发者文档 Evals 指南(https://developers.openai.com/api/docs/guides/evals)第5章 5.1、5.2

附表 B:术语速查表

术语一句话人话解释
私有化部署把模型和配套服务装在你自己的机器或内网里,不依赖外部云服务
数据不出域业务数据留在受控的内网范围内,不传到外部或境外
量化(4-bit 等)用更少的比特表示模型参数,牺牲一点精度换显存和速度
显存GPU 上专门给计算用的高速内存,直接决定能跑多大的模型
RAG检索增强生成,先查资料再让模型基于资料回答,减少胡说
评测集 / evals一组固定题目加标准答案,用来客观地测模型"行不行"
验收指标动手前和业务方约定好的"做到什么程度算合格"的硬标准
许可证(License)规定你能不能商用、修改、再分发模型的法律文件

写在最后:这篇用到的资料

写这篇文章时,把国企内网部署和模型选型的官方文档又翻了一遍,顺手也整理了几份配套的东西:

  • 大模型学习路线图:从零基础到能自己动手做 Agent,按阶段说明每一步该学什么、哪些可以先跳过
  • 《LangChain + LangGraph + MCP 智能体开发实战》视频课:7 个模块,从私有化部署、Embedding+RAG 到 MCP+Agent 全流程
  • AI 大模型知识库(在线可查):Agent Skills 从入门到落地、Claude Skills 完全指南等专题,按目录浏览即可
  • 640 套 AI 大模型行业报告 + 经典 PDF 书籍:看行业落地案例和别人怎么做的时候用得上
  • 大模型零基础到精通教学视频:跟着敲一遍,比只读文档快得多

资料是我自己整理的,放在下面这个码上,扫码即可获取:






添加时备注「AI」,优先通过。

资料按「先路线、再动手、最后查漏」的顺序整理好了,建议先看学习路线那一份,照着它挑一条适合自己当前基础的路径再往下看。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询