数据不出厂:是真需求,还是习惯
国家标准把数据分成三级,条例只对其中一级附加了四条额外义务。把全部数据都当成那一级来管,等于自愿把这四条义务背到自己身上

文章目录
共 5 节"我们的数据不能出厂。"
这句话在会议室里说出来,通常没有人反驳。它听起来既专业又负责,而且免费——不需要花一分钱,也不需要举证。
但如果追问一句"哪些数据",答案往往是三个字:都不能。
这篇文章想说的就是这三个字的代价。国家标准已经把数据分成了三级,而与之配套的行政法规,只对其中一级附加了额外的合规义务。把全部数据当成那一级来管,你不是更安全了,你是自愿把一整套本来不该由你承担的义务背到了自己身上,同时给每一条流程都加上了成本。
一、先看两件已经发生的事:不出厂,不等于不出事
第一件。 据央视新闻 2026 年 1 月 8 日的报道,国家安全部披露了两类真实案例:一类是某单位直接使用开源框架建立联网大模型,导致攻击者未经授权即可自由访问内部网络;另一类是某单位工作人员违规使用开源 AI 工具,由于电脑系统默认开启公网访问且未设密码,敏感资料被境外 IP 非法访问和下载。
请注意这两个案子的位置:它们都发生在"厂里"。 数据一步没有出去,机器就摆在自己的地方,泄露照样发生了——是外面的人走进来拿的。
这说明一件事:"不出厂"是一条关于位置的规则,它管不了访问权限。 把数据搬回自己的机房,只解决了"它在谁的硬盘上",没有解决"谁能读它"。而后者才是这两个案子的失效点。
第二件。 据福布斯 2023 年 5 月 2 日的报道,三星在发现一名工程师把内部敏感源代码上传到 ChatGPT 之后,发出内部备忘录,在公司范围内禁止使用生成式 AI 工具。
这一件的方向和第一件相反,结论却相通:出问题的是一个特定类型的内容(半导体相关的源代码),处理方式却是对全部内容、全部人、全部场景的一刀切。一刀切是当时最快的止血方式,但它同时意味着:那些和源代码毫无关系的东西——产品说明书、公开规格参数、对外发布的新闻稿——也被一起关在了门内。
两件事放在一起,指向同一个判断:"出不出厂"这条线,多数公司画错了地方。 它被画在了"数据"和"外面"之间,而它本来应该被画在"这一类数据"和"那一类数据"之间。
二、国家已经给了一把尺子,而且只有三级
这把尺子不需要你自己发明,它是现成的,而且是公开的。
第一份是国家标准。 全国标准信息公共服务平台上可以查到:GB/T 43697-2024《数据安全技术 数据分类分级规则》,发布日期 2024 年 3 月 15 日,实施日期 2024 年 10 月 1 日,标准状态"现行",归口部门为全国网络安全标准化技术委员会。
这份标准把数据从高到低分成三级:核心数据、重要数据、一般数据。判定的方式是一张二维表——影响范围(影响到国家安全、公共利益,还是只影响到组织自身和个人权益)叉乘影响程度(特别严重危害、严重危害、一般危害)。落在最高那一格的是核心数据,其次是重要数据,剩下的全部是一般数据。
请把最后半句读第二遍:剩下的全部是一般数据。 标准的逻辑不是"先证明它不敏感才能算一般",而是"没有被识别为核心或重要的,就是一般"。这个默认方向,和多数公司会议室里的默认方向正好相反。
第二份是行政法规。 《网络数据安全管理条例》(中华人民共和国国务院令第 790 号)于 2024 年 9 月 24 日公布,2025 年 1 月 1 日起施行,共 9 章 64 条。它第五条确立了分类分级保护制度;第六十二条给出"重要数据"的定义原文:"重要数据,是指特定领域、特定群体、特定区域或者达到一定精度和规模,一旦遭到篡改、破坏、泄露或者非法获取、非法利用,可能直接危害国家安全、经济运行、社会稳定、公共健康和安全的数据。"
真正要看的是它对"重要数据的处理者"单独提出的那几条义务:
- →第二十九条:由国家数据安全工作协调机制统筹协调制定重要数据目录,各地区各部门确定本地区、本部门以及相关行业领域的重要数据具体目录;
- →第三十条:重要数据的处理者应当明确网络数据安全负责人和网络数据安全管理机构;
- →第三十一条:提供、委托处理、共同处理重要数据前,应当进行风险评估;
- →第三十三条:应当每年度对其网络数据处理活动开展风险评估,并向省级以上有关主管部门报送风险评估报告;
- →第三十七条:境内运营中收集和产生的重要数据确需向境外提供的,应当通过国家网信部门组织的数据出境安全评估。
我们把这 64 条从头到尾读了一遍,专门去找一件事:有没有哪一条,把上面这套义务同样附加给"一般数据"。我们没有找到。
这就是本文开头那句话的全部含义。"我们的数据都不能出厂",在制度上等价于"我们把全部数据都按重要数据来管",而这一档带着专职负责人、专职机构、每年一次风险评估,以及一份要报送到省级以上主管部门的报告。一家四十人的厂主动放进这一档,不会更安全,只会多出四件每年都要做、做不好还要担责的事。
判断的顺序应该反过来:先去找那份写着"这类数据属于重要数据"或者"这类数据不得出域"的文件——行业主管部门发布的重要数据目录、客户合同里的保密条款、客户的验厂标准、行业监管要求。找得到文件的那一小部分,按最严的管;找不到的那一大部分,不该被顺带一起管。
三、四个档位,和每一档的可选方案
上面那三级是给行业主管部门定目录用的框架,一家几十人的厂拿来直接套会卡住,因为你手上的东西大多落不进"核心"和"重要"的定义里,而"一般"这一格又太大。
所以下面这四档是本文给出的可操作分法,不是国家标准的分级,请不要混用。它的做法是把国标的三级横过来,再叠上"个人信息"这条正交的线。
第一档:有文件写死不得出域的。
判据只有一个——能拿出一份写着这句话的东西:落进了主管部门发布的重要数据目录、客户合同里的保密条款、客户验厂标准、或者行业监管要求。
可选方案:本地部署。这一档的成本是有量级参照的——据头豹研究院 2025 年 5 月的一份研究,大模型一体机的整体价格带是 50 万~500 万元,基础型号 10 万~50 万元,其中某个 RTX 4090 配置型号的成交价是 17.38 万元。这个量级就是"第一档"的单价,所以第一档里装的东西越少,这笔钱越划算。
第二档:商业上敏感,但拿不出文件的。
报价单、成本结构、客户名单、未公开的图纸、供应商价格。这些东西泄了会让你亏钱,但没有任何一份法规或合同写着它们不能离开你的网络。
可选方案:走企业通道 + 三条必须落进书面协议的条款——第一,你的数据不用于模型训练;第二,留存期限明确且可以要求删除;第三,调用记录可审计。三条缺一条,就把这一档往第一档并。注意这三条要的是白纸黑字,不是销售在微信里的一句话。
第三档:含个人信息的。
员工的身份证号与手机号、客户的联系方式与住址、带姓名的考勤与工资表。这一档特殊在它的风险对象不是公司,是具体的人。
可选方案:先替换,再进模型。 替换清单固定四类——姓名换成"客户A/客户B"、手机号与身份证号整段删除、具体地址只保留到区、金额按你自己定的规则做区间化。替换这件事要写成一个固定动作交给一个具名的人,不能靠每个人自己记得。
第四档:本来就是公开的。
产品册、官网文案、公开报价、说明书、国家标准原文、行业公开资料。
可选方案:直接用,不加任何成本。 这一档不需要脱敏、不需要专线、不需要审批。之所以要把它单列出来,是因为在"都不能出厂"的口径下,它和第一档被关在了同一道门里——而它通常是四档里条数最多的一档。
这四档的分布,才是"要不要私有化"这个决定的真正依据。 如果第一档只有几十条,为它买一台设备是可以的,但那台设备只该服务这几十条,不该把另外三档一起搬进去;如果第一档是空的,那么这个决定本身就还没到该做的时候。
四、一个月的清单:四列,一张纸
这一步不需要工具,需要一个月和一张纸。
第 1 步。只记一件事:这一个月里,真的被贴进过任何 AI 工具的东西。 不是"可能会用到的数据",是"已经进去过的内容"。记录范围包括公司统一采购的那个通道,也包括员工自己用个人账号打开的那些。
第 2 步。四列:内容类型 / 这个月大概多少条 / 走的是哪个通道 / 档位。 前三列照实填,第四列先空着。
第 3 步。按顺序打标,顺序不能换。
- →先问:有没有一份文件写着这类不得出域? 有 → 第一档,打完就停,不用再问后面。
- →再问:它泄出去,受损的是公司还是某个具体的人? 是具体的人(有姓名、手机号、身份证号、住址)→ 第三档。
- →再问:是公司受损吗?(亏钱、丢单、被同行知道底价)→ 第二档。
- →三问都不是 → 第四档。
第 4 步。月底统计四档各自的条数与占比。 这一步是整张表的产出。多数公司第一次统计出来会发现第四档占了绝大多数,第一档只有个位数。
第 5 步。只为第一档改流程,其余三档按上一节的方案走。 这一步最容易被推翻,因为"稳妥起见都按最严的来"永远是会上最不会挨骂的提议。挨不挨骂和对不对是两件事。
五、什么时候不该这么做
先把这套方法自己的代价说清楚。
第一,分级本身有成本,而且是持续的。 这张表不是填一次就结束的。新增一类单据、新接一个客户、换一个通道,都要重新打一次标。没有具名负责人和固定复核日期的分级表,六个月后就会失真,而失真的分级表比没有分级更危险——因为你会照着它做决定。
第二,打标打错的方向不对称。 把第一档误判成第四档,代价可能是一次合同违约;把第四档误判成第一档,代价只是多花一点钱。所以拿不准的时候往严的那一档放是对的,但"拿不准"必须是真的拿不准,不能是"懒得判断所以全放第一档"——那就回到了本文开头那三个字。
第三,替换不等于安全。 第三档那套替换清单能挡住"直接看到姓名和手机号",挡不住"把几条信息拼在一起认出是谁"。一份只剩部门、入职年份和薪资区间的表,在一个二十人的部门里可能只对应一个人。替换是降低风险,不是消除风险,涉及大量个人信息的场景,替换之后仍要按第三档走,不能升格成第四档。
第四,最严的规则会催生最松的执行。 据 InfoQ 研究中心与中欧国际工商学院《中国大模型落地应用研究报告 2025》(有效样本 1166 份),把大模型做到大范围推广的企业只有 14%;而在使用方式上,个人免费使用占 48%,公司统一采购只占 5%。(说明:这份报告的核心数据标注的调研时间为 2024 年 7 月,此处只用它描述结构,不用它描述当期水位。)这组数的现实含义是:当公司这条通道被"都不能出厂"堵死之后,人不会停下来,他会换成自己的手机。 而那条路上没有任何一档分级、没有任何一条书面条款、也没有任何一份可审计的记录。一刀切最常见的结果不是零风险,是零可见度。
三种情况下,这一整套对你不成立:
第一种:你所在的行业已经有主管部门发布的重要数据目录,且你的主营数据在目录里。 那么第三节的四档对你没有意义,你的第一档是被定死的,你要做的是照着条例第三十条到第三十七条把那套义务落实,而不是自己重新分级。
第二种:你的客户已经把数据本地化写进了准入条款。 同上,这是合规决策不是成本决策,两者不该放进同一张表里比。你要做的是把成本算清然后接受它。
第三种:你连第 1 步都做不下去。 问了一圈,没有人愿意承认自己往里面贴过什么。那么先别做分级,先把这一步做成"登记不追责"——这张表的第一版能不能填满,取决于填表的人相不相信填了不会挨罚。 这一点做不到,后面四步都是纸上的。
那两个"数据没出厂也被下载走了"的案子该怎么在自己公司排查一遍,是另一件事,本站会另有一篇专门讲。
数据分级之后怎么把不同档位接进不同的通道,《DeepSeek企业实战》里有一课专门讲知识库接入。
本文事实来源
可自行复核- 1
GB/T 43697-2024《数据安全技术 数据分类分级规则》:发布日期 2024-03-15,实施日期 2024-10-01,标准状态"现行",归口部门全国网络安全标准化技术委员会;数据从高到低分为核心数据、重要数据、一般数据三级;影响程度分为特别严重危害、严重危害、一般危害;按「影响范围 + 影响程度」二维判定
- 2
《网络数据安全管理条例》(国务院令第 790 号):2024-09-24 公布、2025-01-01 施行、共 9 章 64 条;第五条分类分级保护;第二十九条重要数据目录;第三十条明确网络数据安全负责人和管理机构;第三十一条提供/委托/共同处理前的风险评估;第三十三条年度风险评估并向省级以上主管部门报送;第三十七条重要数据出境安全评估;第六十二条"重要数据"定义原文
- 3
国家安全部披露两类 AI 泄密案例:①某单位直接使用开源框架建立联网大模型,导致攻击者未经授权即可自由访问内部网络;②某单位工作人员违规使用开源 AI 工具,电脑系统默认开启公网访问且未设密码,敏感资料被境外 IP 非法访问和下载
- 4
三星在发现一名工程师将内部敏感源代码上传至 ChatGPT 后,发出内部备忘录,在公司范围内禁止使用生成式 AI 工具
- 5
大模型一体机整体价格带 50 万~500 万元、基础型号 10 万~50 万元,某 RTX 4090 配置型号成交价 17.38 万元
- 6
InfoQ 研究中心 × 中欧国际工商学院《中国大模型落地应用研究报告 2025》(有效样本 N=1166):大范围推广仅 14%,个人免费使用 48%,公司统一采购 5%。
该报告核心数据标注的调研时间为 2024 年 7 月,正文已写明只用它描述结构
