零信脱敏产品文档
敏感文档与 AI 之间的隐私防线,全程在本地完成脱敏与代号还原。产品定位与适用场景
零信脱敏面向对识别准确率、数据本地性和完整处理流程有明确要求的专业用户与组织。在本机完成文件读取、敏感信息识别、集中审阅、内容级脱敏、批量导出和代号还原,原始文件、识别结果、处理记录和代号对应关系均不上传云端。
零信脱敏面向法律、金融、风控、审计、医疗、外贸、招投标、采购、政务及企业办公等高敏感业务,持续针对不同领域的专业材料优化识别能力。法律场景已深度适配合同、诉讼文书、卷宗、函件及证据材料,并支持处理文档、表格、图片和扫描件。
在需要使用外部 AI 分析文档时,用户可自行将脱敏副本交给所选 AI 服务处理,再将返回内容导入软件,在本地完成代号还原。零信脱敏不提供 AI 服务。
目前,零信脱敏已服务于央企和行业龙头企业的法务部门,以及律师事务所、银行、税务师事务所、三甲医院等机构,并应用于公共安全等专业场景。除中国外,产品还在美国、德国、波兰、罗马尼亚和列支敦士登等国家投入使用。
快速开始
- 01
选择文件,支持批量选择。
- 02
选择脱敏项和脱敏模式。
- 03
开始脱敏。
- 04
审阅并调整识别结果。
- 05
导出脱敏后的文件。
- 06
如使用代号替换,可通过「代号还原」将 AI 或外部系统返回文本或文件中的代号还原为原始信息。
核心能力
文件读取、识别、审阅、脱敏和导出均在本机完成,适合断网、内网或受控办公环境。
对可处理的文本层和图像像素进行处理,导出副本不保留被处理的原文内容。
命中项、类别、原文位置和导出状态可在工作台中集中审阅。发现漏标时可直接选中文本或框选区域补充标注,并批量标注当前文档中的相同文本或同一图形。
支持固定文本、通配符、正则表达式和图形匹配,可通过黑白名单补充或排除特定内容,扩展内置模型的识别范围。
处理结果和审阅状态自动加密保存在本机,可从首页重新打开并继续审阅、调整和导出。
支持批量选择文件,也可拖入整个文件夹;从文件夹导入时会递归处理其中的受支持材料。
可用稳定代号保留上下文,并在本机还原 AI 或外部系统返回的内容。
从文件夹导入的文件,批量导出或自动导出时会保留原有文件夹层级。自动导出默认关闭,可在首页右侧配置栏底部开启,并选择导出目录和文件名后缀。
识别准确率与评测口径
零信脱敏持续对核心中文实体识别模型进行独立评测,并根据真实材料中的识别表现持续优化模型。以下为当前生产模型最近一次正式评测结果,评测数据与训练数据严格隔离。
严格实体级 F1 综合衡量精确率与召回率,只有实体类别和起止边界全部正确才计为正确。
敏感信息覆盖率 衡量应脱敏字符被识别覆盖的比例,与实体级召回率不是同一指标。
我们会持续补充真实场景评测与优化模型,并在生产模型更新后同步更新公开指标。
支持材料
以下为常见材料示例,并非完整清单
卷宗、报告、档案、证明材料、招标文件、投标文件、标书、图片页 PDF、扫描 PDF。
合同、函件、招标文件、投标文件、采购文件、说明书、申报材料、会议纪要。
工资表、客户清单、供应商清单、报价表、采购台账、财务表格、业务台账、统计数据。
证照图片、截图、聊天记录截图、扫描图片。
纯文本资料、整理稿、提示词、笔记。
敏感信息范围
零信脱敏覆盖多类常见敏感信息,并支持按业务材料配置自定义规则。
姓名、身份证号、地址、出入境证件号、电话号码、邮箱、网址、社交账号、民族、性别、年龄、邮编、车牌号、车架号 VIN、IP 地址。
单位名称、统一社会信用代码、组织机构代码、邓白氏编码、专利代理机构代码、司法案号、发文字号。
专利编号、申请公布号、发明专利授权公告号、实用新型授权公告号、外观设计授权公告号、作品登记号、软著登记号、软著证书号。
合同编号、病例号、就诊号、住院号等其他业务编号。
金融账户及卡号、股票代码、发票号码、不动产权证书号、金额、日期。
手写签名、印章、指印、人脸、二维码。
可对导出文件名、保留文件夹层级中的目录名和 Excel 工作表名脱敏,并按需移除 Word 页眉页脚、PDF 常见水印以及 PDF / Word 批注和注释。
支持固定文本、通配符、正则表达式和图形匹配。
脱敏范围设置
单位名称和发文字号支持单独设置脱敏范围。
可选择脱敏全部公共机关名称、不脱敏所引用公共机关文件中的机关名称,或不脱敏所有公共机关名称。企业、商业银行、学校、医院等其他单位名称不受此设置影响。
可选择脱敏全部发文字号,或不脱敏所引用公共机关文件的发文字号。
脱敏模式
零信脱敏支持四种常用脱敏输出方式,并支持日期、金额按公式变换。脱敏区域颜色可使用常用预设,也可通过颜色选择器或十六进制色号自定义。
可使用人物A或人物1等字母或数字代号替换敏感内容,保留人物、机构、地址等上下文关系。代号替换可自动关联识别到的同一机构不同名称,如简称、曾用名等,避免脱敏后被误认为不同主体。批量处理时,同一敏感信息跨文档保持代号一致;如需跨批次保持代号一致,可从历史记录沿用已有代号,或导入此前导出的代号对照表。
用掩码覆盖完整命中内容,适合外发时不需要保留任何原文可读信息的场景。
用空白替代命中内容,保留原位置和版面节奏,适合希望结果更接近人工留白的材料。
保留头尾少量字符,中间用掩码替换,适合手机号、证件号、账号等仍需人工核对归属的字段。
日期可按天、月、年整体前移或后移,保留时间先后关系,同时使导出内容不保留真实日期。
金额可按加、减、乘、除进行统一变换,保留规模和计算语义,降低真实金额暴露风险。
自定义规则引擎
自定义规则保存在本机。黑名单用于补充需要脱敏的内容,白名单用于排除无需处理的内容;两者重叠时以白名单为准。框选 Logo、图标等特定图案后,后续可自动查找并标注该图形。
按输入的固定内容精确匹配,适合客户名、项目代号、内部简称和公开名称。
使用 * 匹配不固定的内容。
适合配置复杂规则。
框选 Logo、图标等特定图案,后续自动查找并标注该图形。
场景示例:只脱敏自己公司,保留其他单位名称
例如,只希望脱敏自己公司的名称,同时保留文档中的其他单位名称时,可以这样配置:
- 01
处理文件前,关闭“单位名称”自动识别,避免其他单位名称被统一标注。
- 02
打开“自定义规则”中的“黑名单”,选择“固定文本”,标签选择“单位名称”。
- 03
每行输入一种需要脱敏的实际写法,例如公司全称、常用简称、英文名称或品牌名。
- 04
开始脱敏后,在审阅工作台确认本公司名称均已命中,其他单位名称未被误标。
复制下面的提示词交给 AI,并按它的提问提供几条虚构或已脱敏的样例。不要发送真实敏感信息。
我需要编写一个用于文本匹配的正则表达式。请先让我提供几条样例,再逐步询问:哪些部分固定不变、哪些部分会变化、变化部分的字符类型和长度,以及最终需要匹配样例中的哪一段。信息不足时继续提问,不要自行猜测。 信息确认后再生成表达式。表达式应能直接粘贴使用,不要使用 /.../ 包裹,不使用环视和反向引用,不能匹配空内容,默认不跨行。最后解释规则,并使用我提供的样例验证匹配结果和可能的误匹配。
审阅工作台
识别完成后进入工作台逐项复核。左侧查看文档页面,右侧按类别汇总命中内容,所有调整以工作台中的最终结果为准。
在顶部切换两种视图:原文标注用于核对识别位置和原始内容,脱敏预览用于确认代号、掩码或留白后的输出效果。
审阅中发现漏标时,可直接框选区域或选中文本补充标注;对于重复文本或同一图形,可批量标注当前文档中的全部匹配项。已有标注也可修改标签或代号,或直接移除。
在右侧搜索页签中查找文本或标注内容并定位到所在页面,适合复核长文档中的名称、编号和关键词。页数较多时,可点击顶部页码,输入页码后按 Enter,直接跳转到指定页面。
点击列标可设置整列脱敏、整列忽略或恢复默认识别,再逐项调整例外内容。
标注 Logo 等图形
- 01
框选需要处理的 Logo、图标或其他图形。
- 02
选择标签后,点击“标注”处理当前图形;后续仍需处理该图形时,可点击“加入黑名单”。
同一 Logo 在当前文档中出现多次时,可一次标注所有出现位置,无需逐处框选。
处理记录自动保存,随时继续
每次处理完成后,处理结果和审阅状态会自动保存为本机处理记录,记录内容以加密形式存储在本机。后续需要继续处理时,可直接从首页打开对应记录,继续审阅、调整和导出。
处理完成后自动生成本机处理记录,无需额外执行保存操作。
从首页打开对应记录,即可重新进入审阅工作台并继续处理。
处理记录及其中的识别结果、审阅调整和代号对应关系均加密存储在本机。
导出
审阅完成后,根据接收方和用途选择导出格式。
保留源文件的主要结构和版式,用于最终交付或继续编辑。
导出脱敏后的轻量 Markdown,适合交给 AI 分析或继续处理。
导出固定版式副本,适合跨设备查看、归档或对外发送。
将 PDF、扫描 PDF 或图片中的脱敏结果整理为更紧凑、可编辑的 Word 文档,并优化文字段落与表格结构,适合上传 AI、检索或继续编辑。
通过高亮和批注展示命中位置,仅供内部复核;其中仍含敏感原文,不能作为对外脱敏结果。
只导出处理后的文本,不保留原版式,适合发送给 AI 或进入文本处理流程。
代号替换模式下汇总类别、敏感原文、代号和出现次数;沿用但本次未命中的映射也会保留,出现次数为 0,便于继续导入沿用。
其他脱敏模式下汇总类别、敏感原文、脱敏结果和出现次数,用于内部复核与留痕。
代号替换与还原
零信脱敏可使用人物A、人物1等稳定代号替换敏感内容,使导出内容不保留原始身份信息,同时保留人物、机构和地址之间的上下文关系。代号替换可自动关联识别到的同一机构不同名称,如简称、曾用名等,避免脱敏后被误认为不同主体。批量处理时,同一敏感信息跨文档保持代号一致;如需跨批次保持代号一致,可从历史记录沿用已有代号,或导入此前导出的代号对照表。
AI 或其他外部服务返回包含这些代号的文本或文件后,可根据本机处理记录中的代号对应关系还原,也可导入此前导出的 XLSX 代号对照表进行还原。代号对应关系和还原过程均保留在本机。
- 01
从对应处理记录进入「代号还原」,或在首页选择「使用对照表还原」并导入 XLSX 代号对照表。
- 02
粘贴 AI 返回的文本,或选择需要还原的文件。
- 03
软件根据处理记录或导入的代号对照表还原内容。
- 04
检查结果并保存还原后的文本或文件。
自动导出
在首页配置栏底部开启后,设置导出目录和文件名后缀;从文件夹导入时会保留原目录层级。自动导出默认关闭。
性能设置
点击窗口底部状态栏中的 CPU 指示,可根据设备性能调整处理线程数。零信脱敏针对不同平台和设备配置进行了本地性能优化,部分设备还可启用硬件加速,进一步提升处理速度。
大型文档处理能力
零信脱敏支持处理千页乃至万页级大文档。处理耗时取决于文档内容和设备性能,可参考以下实测规模与影响因素。
支持处理千页乃至万页级大文档。内部测试中,在测试设备上处理一份 1000 页文档约需 3–4 分钟;已有用户实际处理约 8000 页的 Word 文档,耗时 40 余分钟。
实际耗时会受电脑配置、文件类型、页面复杂度、扫描质量、图片数量和命中项数量影响。
我们会持续优化大型文档的处理性能与审阅体验。
剪贴板脱敏
剪贴板脱敏用于处理从网页、聊天、邮件、文档及其他应用复制的敏感文本。识别过程在本机完成,可在粘贴到 AI、网页表单或外部系统前,将脱敏结果写回系统剪贴板。
- 01
打开剪贴板脱敏设置并启用该功能。
- 02
复制需要处理的文本,零信脱敏在本机识别其中的敏感信息。
- 03
按需审阅结果,再通过操作按钮或设置的快捷键复制脱敏内容。
- 04
将脱敏后的文本粘贴到目标 AI、网页表单、邮件或外部系统。
法律材料脱敏
法律材料是零信脱敏重点训练和持续优化的核心场景。核心中文实体识别模型针对合同、诉讼文书、卷宗、函件和证据材料进行了专项训练,重点识别复杂上下文中的姓名、机构和地址;证件号码、联系方式、司法案号等由相应识别能力覆盖。
零信脱敏面向对识别准确率、数据本地性和完整处理流程有明确要求的律师、律所和企业法务,在本机完成识别、集中审阅、内容级脱敏、批量导出和代号还原。对于法律材料中引用的政策法规、公文等公开文件,可按需调整公共机关名称和发文字号的脱敏范围,减少过度脱敏对引用内容完整性和可读性的影响。除法律材料外,产品也适用于金融、医疗、财税、人事、外贸、招投标和政务等高敏感场景,并持续针对不同专业材料优化识别能力。
核心中文实体识别模型公开整体评测结果:完整独立测试集严格实体级 F1 为 98.25%,敏感信息覆盖率为 99.26%;正式基准评测集严格实体级 F1 为 97.48%,覆盖率为 99.04%。详细评测口径见识别准确率。
使用场景
用于银行流水、账户及卡号、交易明细、授信资料、审计底稿、财务报表和风控合规材料在外发、归档或 AI 分析前脱敏。
用于专利申请、授权公告、作品登记和软件著作权等材料在提交 AI 分析、外部协作或公开流转前识别并脱敏相关编号。
面向中英文合同、商业发票、装箱单、提单、采购订单及客户、供应商资料,在对外发送、翻译或提交 AI 处理前,识别并脱敏其中的联系人、联系方式、地址、企业名称和账号等敏感信息。
用于内部报告、审批材料、协作文件、归档材料在流转前完成敏感信息处理。
用于员工档案、简历、薪资绩效、发票报销、工资表和财务表格。
用于招标文件、投标文件、采购文件、标书、供应商资料、报价表和评审材料在外发、归档、AI 分析或内部流转前脱敏。
把合同、报告、截图、聊天记录或表格提交给 AI 前,先在本机处理其中的敏感信息。
面向体检报告、病历、检查检验报告等医疗材料,在外发、共享或提交 AI 处理前,识别并脱敏其中的姓名、证件号、联系方式、病历号、就诊号、住院号及人脸等敏感信息。
用于调解材料、政务资料和批量文档在递交、协作或归档前完成本机脱敏和人工复核。
平台、安装与授权
企业授权与设备管理
零信脱敏支持 Windows、macOS 和 Linux 的静默部署,以及面向团队和组织的批量部署与统一授权管理。Windows 提供适合集中部署的 MSI 安装包;macOS 和 Linux 可通过脚本或企业设备管理工具部署。企业管理员可统一查看授权名额和设备状态,批量审批设备申请,停用或重新启用设备。人员离职或设备发生变化时,可回收并重新分配授权名额。
持续维护与问题响应
零信脱敏采用快速迭代、持续交付的更新机制。用户反馈由研发团队直接跟进,常规产品问题通常会在收到反馈后的 2 个工作日内完成修复、回归验证并发布,无需等待固定的大版本周期。
围绕识别准确率、专业材料适配、文档处理能力和使用体验持续改进。
支持在软件内检查更新升级,点击底部“检查更新”即可,无需每次前往官网重新下载安装。
系统要求
普通办公电脑即可使用,无需独立显卡或 CUDA。
Windows 10 64 位,x64,双核四线程 CPU,4GB 内存。
Windows 10/11 64 位,四核八线程 CPU,8GB 以上内存。
macOS 12 Monterey 及以上,4GB 内存。
8GB 以上内存;处理大文档、高清扫描件或大量图片时建议 16GB 以上。
x86_64 或 ARM64 / aarch64 桌面 Linux,建议 4GB 以上内存。
8GB 以上内存;正式采购前建议在目标发行版和桌面环境确认。
不要求独立显卡或 CUDA。
普通集成显卡即可使用。
与普通 PDF 编辑器的区别
普通 PDF 编辑器偏向手工标注、遮盖或编辑单个文件。
零信脱敏面向识别、审阅、脱敏、导出和代号还原的完整材料处理流程。
视觉遮挡后,底层文字可能仍可复制、搜索或提取。
强调内容级脱敏导出,对文本层和图像像素进行处理。
多文件、多页材料主要依赖人工逐项检查。
支持批量处理 PDF、Word、Excel、图片、扫描件和文本内容。
全部涂黑后上下文可读性下降。
代号替换保留人物、机构、地址等上下文关系,便于 AI 分析。
处理项分散,难以统一核对。
工作台集中呈现命中项、类别、原文位置和导出状态。
隐私与安全边界
- 原始文件副本、识别结果和审阅内容等处理记录内容以加密形式保存在本机,不会上传云端。
- 导出支持处理的 Word / PDF 时,会处理可识别的文档属性,以及作者、批注人、修订人等元数据,减少正文之外的身份信息残留。
- 零信脱敏用于在敏感材料发送给 AI、云服务、网页表单或外部系统前完成本地脱敏。
常见问题
脱敏处理是否需要联网?
不需要。识别、审阅、脱敏、导出及代号还原均在本机完成,可在断网或内网环境中使用。
原始文件会上云吗?
不会。软件不会将原始文件、识别结果、处理记录、脱敏配置或代号对应关系上传至本公司或任何第三方服务器。
适合在把资料交给 WorkBuddy、DeepSeek、豆包等 AI 工具前使用吗?
适合。可先在本机识别并处理敏感信息,再导出脱敏 Markdown、Word 或其他格式交给 AI 分析。代号替换能够以稳定代号取代直接标识信息,同时保留人物、机构和地址等上下文关系。AI 返回的内容如包含这些代号,还可在本机还原。
零信脱敏适合法律行业使用吗?
适合。零信脱敏支持合同、诉讼文书、卷宗、函件和证据材料等法律文件,可识别姓名、机构、地址、证件号码、联系方式和司法案号等敏感信息,并在本机完成识别、审阅、脱敏和导出。产品同时适用于金融、医疗、财税、外贸、招投标和政务等其他高敏感场景。
零信脱敏是否针对法律材料进行专项训练?
是。核心中文实体识别模型针对合同、诉讼文书、卷宗、函件和证据材料等法律材料进行了专项训练与持续优化,重点提升复杂法律上下文中姓名、机构和地址等敏感信息的识别能力;产品同时覆盖司法案号等专业编号。
什么情况下更适合选择零信脱敏?
当你需要正式处理合同、诉讼文书、卷宗、证据材料或其他高敏感文件,并重视公开准确率指标、全程本地处理、人工可审阅、内容级脱敏、批量处理、本机处理记录和代号还原时,适合选择零信脱敏。产品面向律师、律所、企业法务及金融、医疗、财税、外贸、招投标和政务等专业场景。
处理记录会自动保存吗?
会。处理结果和审阅状态会自动加密保存在本机。后续可直接从首页打开对应处理记录,继续审阅、调整和导出。
支持哪些文件和材料?
支持 PDF、Word(DOC / DOCX)、Excel(XLSX / XLS / XLSM)、CSV、TXT、Markdown、扫描件和图片。支持批量选择文件,也可拖入整个文件夹;从文件夹导入时会递归处理其中的受支持材料。
Word 或 PDF 中插入的证件、合同插图等,需要单独提取吗?
不需要。直接导入 Word 或 PDF 文件即可,软件会一并识别处理文档中的图片及文字内容,无需将图片单独提取出来处理。
文件名、目录名、工作表名、页眉页脚和水印可以处理吗?
可以。软件可对导出文件名、保留文件夹层级中的目录名和 Excel 工作表名脱敏,并按需移除 Word 页眉页脚、PDF 常见水印以及 PDF / Word 批注和注释。
识别准确率如何?
核心中文实体识别模型在完整独立测试集上的严格实体级 F1 为 98.25%,敏感信息覆盖率为 99.26%;正式基准评测集上的严格实体级 F1 为 97.48%,敏感信息覆盖率为 99.04%。实际效果会受文件清晰度、版式和内容影响。
脱敏后能保留原始版式吗?
导出原格式脱敏版时,会保留源文件的结构和版式;也可按用途导出便于查看和归档的 PDF、便于编辑和上传 AI 的 Word、适合交给 AI 分析的 Markdown,或纯文本 TXT。
扫描 PDF 文件太大,无法上传 AI 怎么办?
可导出脱敏 Markdown 或 Word(DOCX)。Markdown 文件更轻,适合直接交给 AI 分析;需要在 Word 中继续编辑时,可选择 DOCX。两者通常都比原始扫描 PDF 更便于上传和处理。
零信脱敏能处理多大规模的文档?
支持处理千页乃至万页级大文档。内部测试中,在测试设备上处理一份 1000 页文档约需 3–4 分钟;已有用户实际处理约 8000 页的 Word 文档,耗时 40 余分钟。实际耗时会受电脑配置、文件类型、页面复杂度、扫描质量、图片数量和命中项数量影响。
是简单遮挡,还是内容级脱敏?
软件会对可处理的文本层和图像像素进行处理,导出的脱敏副本不保留被处理的原文内容,而不是只在页面上覆盖一个可移除的遮挡层。
脱敏后是否还需要人工检查?
需要。软件用于辅助识别和脱敏处理,用户应在导出前审阅命中项,确认范围和结果符合业务要求。
扫描 PDF、旋转图片和手写签名能处理吗?
支持。软件内置离线 OCR,可在断网或内网环境中识别扫描件、图片页 PDF 和常见方向旋转图片,并在本机完成敏感信息识别、脱敏和代号替换;也支持识别其中的手写签名。低清晰度、复杂背景、倾斜变形或笔迹可能影响识别效果。
密码保护的 PDF 和 Word 能处理吗?
可以。密码仅在本机验证和使用;用户输入正确密码后才能继续处理,不支持绕过或破解未知密码。
Word 标注版和脱敏版有什么区别?
脱敏版用于最终交付;标注版仅供内部复核,保留敏感原文并通过高亮和批注标示内容,不能直接对外发送。
Excel 可以如何审阅?
可查看并调整识别结果;点击列标可设置整列脱敏、整列忽略或恢复默认识别。使用代号替换时,也支持在本机还原 Excel 和 CSV 中的代号。
自定义规则支持哪些方式?
支持固定文本、通配符、正则表达式和图形匹配。黑名单用于补充需要脱敏的内容,白名单用于排除无需脱敏的内容;框选 Logo、图标等特定图案后,后续可自动查找并标注该图形。
是否支持代号替换和还原?
支持。相同敏感内容可使用稳定代号替换,使导出内容不保留原始身份信息,同时保留上下文关系。代号替换还可自动关联识别到的同一机构不同名称,如简称、曾用名等,避免脱敏后被误认为不同主体。AI 或其他外部服务返回包含这些代号的文本或文件后,可在本机完成还原。