一张显卡就能把合同、报关单、发票全吃掉,还不出厂区
0.9B 到 1.7B 的开源解析模型已覆盖 109 种语言,单据处理这件事,可以在自己厂区里做完了

文章目录
共 4 节一份法文的报关单,一份阿拉伯文的形式发票,一份中英对照的合同附件。
这三样东西在多数外贸公司里的处理方式是同一种:一个人坐在屏幕前,逐字敲进系统。
要把这件事交给机器,常见的两个开局都是错的。先说这两个错,再说处方。
一、两个常见的开局,都错
错误一:一提到"处理单据",第一反应是上一套系统。
上系统真正的成本不在软件本身,在于它要求你先把流程标准化——统一模板、统一字段、统一录入口径。但单据的来源在客户那边、在海关那边、在货代那边,这三方你都标准化不了。最后的结果通常是人去迁就系统,录入工时不降反升,还多了一笔年费。这条路太重。
错误二:把客户合同直接贴进在线的大模型对话框。
这是把客户资料送出厂区。外贸合同里有什么?对方公司名、成交价格、付款条款、联系人、交货期。这几样凑在一起,就是你手上最值钱的那部分资产。它一旦离开你自己的机器,你就不再拥有"它去了哪儿"的控制权。这条路不是重不重的问题,是方向问题。
还有第三个错误,出在花钱的顺序上。
据长江商学院对全国 2016 家规模以上工业企业的调研(2026 年 5 月),中小企业的投入资金平均有 57.2% 流向 AI 硬件。我的看法是,钱先花在硬件上通常是错的:先买卡、再找用途,卡就一直闲着,折旧照走,第二年还得为它腾机位。
但单据处理是这条规律的例外,原因很具体:它的用途在买卡之前就已经存在了,而且可以量化——你每个月花在单据录入上的人工小时数,是一个现成的数,随时能测。有这个数,你才有资格谈买卡;没有这个数,谁劝你买都别买。
二、变了的是参数量和语言数
这一节只讲两组具体的数。
dots.ocr,小红书 hilab 开源的文档解析模型,参数量 1.7B,支持 100 种以上语言,在 OmniDocBench 上取得 SOTA。
PaddleOCR-VL,百度开源,参数量 0.9B,支持 109 种语言。
配套这一类工作的文档解析工具 MinerU,在 2026 年 6 月已经更新到 3.4.0 版本。
先说清楚一件事:这里不引用任何准确率和加速倍数。社区文章里流传的"准确率 98.6%""比某某快 40 倍"这类说法,在官方的发布说明里核不到。核不到的数字,一个都不写进来。你正在做的是一笔采购决策,拿一个来源不明的百分比去做决策,比不做决策更危险。
要看的不是那些,是参数量本身。
0.9B 和 1.7B 是什么概念?是它对硬件的胃口。这个量级的模型,一张常规显卡就能装下并跑起来,不需要单独的机房,不需要专线,不需要把任何一份文件传出去。这才是这两个数字对老板的全部含义:单据解析这件事,从"必须借别人的算力"变成了"可以在自己厂区里做完"。
它不是变得更聪明了,是变得更小了。小到能进你的机柜。
顺带把一个常见的换算错误纠正掉:参数量小,不等于这件事便宜。它省掉的是显卡的档次和机房这两项,不省电费、不省人、也不省你为它建立规矩的那段时间。我的建议是在算账的时候,只把"卡"这一项按小模型的标准往下调,其余三项照原样列进去。把省下的那一项当成全部,是这类项目最常见的预算失手。
对合同、报关单、发票这三类东西来说,"不出厂区"不是一个加分项,是一个准入条件。不少客户的保密条款里写着资料不得转交第三方——你把合同贴进在线对话框的那一刻,这一条就已经破了,而且没有痕迹、没有回收的办法。
三、109 种语言,对做外贸的意味着什么
中英文之外的单据,过去只有两条路:找翻译,或者找一个懂那门语言的人。两条路的共同点是按量收费、按人排期,量一大就堵。
语言覆盖到 109 种,意味着同一条处理流程可以吃下你所有出口市场的单据,不必为每个新市场单开一条线。新开一个南美市场、一个中东市场,单据处理这一环不需要重新招人,也不需要重新谈一份翻译外包合同。对一家出口市场分散的公司来说,这一条比任何性能指标都实在。
但要先把边界划清楚,否则你一定会失望。
语言覆盖解决的是"认得出这是什么字",不解决"认得出这张表里哪一格是什么"。版式理解是另一件事,而且是你自己要教的那部分。同一个国家的海关单据可能有好几个版本,同一个客户的发票模板换个财务就变了样。
所以判断标准应该这么定:语言换了,你的流程不用改;版式换了,你的流程要改。 前者由模型解决,后者由你自己的规矩解决。把这两件事分开,你的预期就不会错位,项目也不会在第三周变成互相埋怨。
还有一个顺序问题要提前定:先做哪个市场。我的建议是不要从出货量最大的那个市场开始,从单据格式最规整的那个市场开始。量最大的市场一旦出错,返工的代价也最大,而你在第一轮需要的是干净的数据,不是最大的收益。等流程在小市场上跑稳了,再把它挪到大市场,这个顺序反过来会很难收场。
再补一条容易被忽略的:小语种单据往往还伴随着成像质量差——传真件、复印件、用手机斜着拍的照片、盖章压住关键字段。语言支持救不了成像质量。这一类问题要在扫描这一环先解决,比如换一台带自动纠偏的扫描仪、规定一份统一的拍摄方式,别指望在后面补。先解决进料,再解决加工,顺序不能反。
四、处方:先做一类,只跑两周,格式不许超过三种
先给上限,再给顺序。
上限:第一版不许接超过 3 种单据格式。 这是硬约束,不是建议。超过 3 种,你就无法判断某一次识别变差到底是模型的问题还是格式的问题,两周之后你会拿到一堆无法归因的数据,然后凭感觉做决定。
顺序:
- 1先选一类单据。 选量最大、版式最固定的那一类。我的建议是别拿合同开局——合同的版式最散,条款位置全靠人写。形式发票、装箱单这类结构固定的,才是合适的第一类。
- 2先测基线,再开工。 开工之前用人工方式测一批,样本别少于二十份,记下每一份单据的人工录入分钟数,取中位数。这个数是你后面唯一的对照物。没有基线的项目,两周之后一定会变成一句"感觉是快了一些"。
- 3只统计一个指标。 就是每份单据的人工录入分钟数。别同时统计准确率,别统计节省了几个人,别统计员工满意度。指标一多,结论就没了。
- 4跑满两周。 这两周里不许加第二类单据、不许换模型、不许扩语言、不许改流程。任何中途的改动都会让这两周的数据作废,从头再来。
- 5跑满两周再看结果,对着第 2 步的基线比。降幅达不到你事先写下的门槛,就停在这里——别加卡、别加人、别加类别。达标了,才上第二类,而且总格式数仍然不许超过 3 种。
- 6人工复核环节永远保留。 第一版复核比例 100%。指标稳定之后可以往下调,但不许调到零。报关单错一位编码要付出的代价,比你省下的那点录入工时贵得多,而且它不会在你的成本表上,它会在一次退运里。
接下来是代价,三条,都得先接受再开工。
第一,跑在自己厂区里,运维就归你自己。 卡坏了、盘满了、版本要升级、断电之后服务没起来——这些都没有客服电话可以打。我的建议是,开工之前先确认厂里有一个人能负责这台机器的开关机和重启,哪怕他只会做这两件事。找不到这个人,先别开始。
第二,版式不稳定的单据,识别结果会掉。 手写批注、盖章压住字段、扫描歪斜、折痕、褪色的传真件。这些在真实单据里不是少数情况,是常态。所以第 1 步才要求你从"版式最固定"的那一类开局——不是为了好看,是为了让两周的数据可用。
第三,什么时候不该做这件事。 如果你一个月全部单据的人工录入时间加起来撑不满一个人半天,这套不划算。这套只有在录入工时已经占掉一个专职人力的时候才成立;低于这个量,继续用人工更便宜,而且不用承担运维和复核这两份新增的负担。
如果你打算把这台机器放进厂区,先看《花十分钟,扫一遍公司有没有裸奔的模型端口》那一篇,把端口这一关过了再开工。顺序还是那句话:先把门关上,再往里搬东西。
本文事实来源
可自行复核- 1
dots.ocr(小红书 hilab 开源,1.7B 参数,支持 100+ 语言,在 OmniDocBench 上取得 SOTA)。开源仓库
- 2
PaddleOCR-VL(百度开源,0.9B 参数,支持 109 种语言)。论文(arXiv 编号前缀 2601 对应 2026 年 1 月)
- 3
MinerU 文档解析工具,2026 年 6 月已更新至 3.4.0 版本。版本发布页
- 4
中小企业投入资金平均 57.2% 流向 AI 硬件。长江商学院对全国 2016 家规模以上工业企业的调研,2026 年 5 月 19 日
- 5
社区文章中流传的"准确率 98.6%""比某某快 40 倍"等说法,在上述项目的官方发布说明中核对不到,本文不引用。
